Récemment, j’ai mis en place une infrastructure IA locale dans le but d’arrêter mes abonnements que j’avais d’abord chez OpenAI, puis chez Perplexity. Plus qu’une simple IA conversationnelle, l’idée était de mettre en place un agent (Hermes Agent avec le modèle Qwen 3.6 35B A3B), qui peut donc accéder à internet, à mes dossiers, à des outils etc. Mais au fil des conversations quelque chose d’étrange s’est produit.
En demandant des informations sur ce que ma nouvelle infrastructure était capable de faire et quels types de modèles Bayésien je pourrais exécuter en utilisant PyMC, l’agent s’est subitement mis à parler… portugais. N’étant pas lusophone, j’ai d’abord cru qu’il s’agissait d’espagnol, mais c’était bel et bien du portugais. Alors que s’est-il passé pour que mon agent passe du français au portugais?
Tout d’abord, il faut bien comprendre que derrière un ChatGPT ou autre Large Language Model (LLM), il y a simplement un ensemble de matrices et de multiplication, similaire à une régression, qui a pour but de prédire le mot suivant de façon séquentielle, en utilisant tout le contexte dont il dispose (ce qui a été discuté avant, son éventuelle mémoire etc.). C’est donc le contexte, qui accumulé, a donné des probabilités plus fortes pour le portugais que pour le français.
Dans mon cas, il y avait deux thématiques qui ont déclenchées :
- Les librairies python pour les statistiques bayésiennes (PyMC)
- Le dosage de mes liquides nicotinés pour ma cigarette électronique
Détaillons.
Déclencheur 1: L’aimant Data Science (pandas et PyMC)
Les modèles sont largement entraînés sur les données du web, peu importe la langue. Or, il existe une grande communauté technique qui discute activement de PyMC et de pandas au Brésil. En effectuant des recherches, le modèle a donc extrait énormément de documentations ou tutoriels avancés de la communauté lusophones. Le contexte étant rempli majoritairement de textes lusophones l’IA s’est conformée à la langue majoritaire. Une fois le premier token émit en portugais, les tokens suivants ont encore plus de chance d’être émis en portugais.
Déclencheur 2: La Précision Mathématique du Liquide de Vapotage
Ce déclencheur est moins évident mais a pesé relativement lourd dans la balance mathématique. En effet, j’ai souvent décrit mon utilisation des liquides en ml ou en mg/ml, en français ou en anglais. Ces valeurs étaient dans le contexte suite à une conversation précédente. Certains tokens ont aussi alors été activés par erreur renforçant le glissement vers le portugais.
Malgré cette fuite de contexte, mon modèle a très vite retrouvé sa langue d’origine pour m’expliquer ce qu’il venait de se passer. Bien qu’ici, il ne s’agissait que d’un changement de langue, cela aurait très bien pu concerner le contenu ou certaines informations. C’est un bon rappel qu’il faut toujours être vigilant en utilisant des LLMs. La solution serait de nettoyer son contexte et de redémarrer une nouvelle conversation lorsqu’on change de thématique.
