Retour à l'accueil
Technologie

Étude: la répétition d’allégations fausses déstabilise certains modèles d’IA

Des chercheurs de l’université de l’Arizona ont constaté que certains modèles de langage peuvent revenir sur des réponses correctes lorsqu’un utilisateur répète une affirmation fausse et exerce une pression dans le dialogue. L’étude a porté sur sept modèles: GPT-3.5 était le plus susceptible de réaffirmer des informations trompeuses, tandis que Claude 3.5 Sonnet a montré la plus grande résistance à cet effet.

••4 min

Écouter cet article

Une version audio générée automatiquement.

0:00
0:00
Illustration d’une personne utilisant un ordinateur portable, avec un visuel numérique de l’intelligence artificielle et un symbole d’avertissement rouge au-dessus du clavier.

Une étude menée par des chercheurs de l’université américaine de l’Arizona montre que certains modèles d’intelligence artificielle peuvent abandonner des réponses correctes lorsqu’un utilisateur répète une information fausse, et revenir au cours de la conversation à l’affirmation trompeuse. Les résultats montrent que la réponse du modèle peut changer avec l’accumulation du contexte et la pression du dialogue, même lorsque sa première réponse est exacte.

L’étude teste sept modèles au cours de conversations en plusieurs tours

Publiée dans la revue Scientific Reports, du groupe Nature, l’étude a testé sept grands modèles de langage au cours de conversations en plusieurs tours, plutôt que de s’appuyer sur une seule question et une seule réponse. Les expériences visaient à mesurer la propension des modèles à se tromper et à se laisser convaincre, ainsi que leur capacité à réexaminer et corriger leurs réponses.

L’ambiguïté des sujets accroît la propension des modèles à être trompés

La propension des sept modèles à être trompés augmentait également lorsque les allégations portaient sur des sujets ambigus ou peu documentés. L’étude relie ce comportement à l’influence du contexte accumulé au cours de la conversation sur la réponse des modèles de langage, et non à une croyance dans la rumeur au sens humain.

Lorsque l’utilisateur répète son affirmation avec assurance, le modèle peut être tenté de le suivre ou de modifier sa position au lieu de maintenir la réponse la plus exacte. Ce comportement est appelé complaisance ou flatterie envers l’utilisateur. OpenAI avait reconnu l’apparition de ce comportement après une précédente mise à jour de GPT-4o, qui, selon l’entreprise, l’avait rendu plus enclin à fournir des réponses conformes aux attentes de l’utilisateur.

OpenAI prend des mesures pour réduire la complaisance envers l’utilisateur

L’entreprise a ensuite annoncé des mesures visant à réduire la complaisance et à renforcer l’honnêteté et la transparence des réponses. Les chercheurs ont également observé que certains modèles changeaient de position au cours d’une même conversation, passant de l’acceptation au rejet d’une affirmation fausse. Ils ont appelé ce schéma le « rebond ». Cela montre que l’erreur ou la position adoptée par le modèle à un moment du dialogue ne se maintient pas nécessairement jusqu’à la fin.

En revanche, quatre modèles — GPT-4o, GPT-4o mini, Gemini 1.5 Pro et DeepSeek-R1 — ont corrigé leurs erreurs à 100 % lorsqu’ils ont eu une seconde occasion de réévaluer leur réponse, selon l’étude. Ce résultat montre que reposer la question ou demander une vérification peut parfois contribuer à obtenir une meilleure réponse.

L’étude ajoute une dimension conversationnelle à de précédents travaux consacrés à la reproduction, par les modèles de langage, de croyances et d’informations fausses répandues dans les textes sur lesquels ils ont été entraînés. Selon les résultats, le problème ne tient pas seulement aux informations apprises par le modèle: il peut aussi apparaître et évoluer au cours du dialogue avec l’utilisateur.

Les résultats montrent qu’une réponse formulée avec assurance par un robot conversationnel ne suffit pas à en établir l’exactitude, notamment dans les domaines médical, juridique, financier et dans l’actualité.

Ils soulignent également l’importance de tester les modèles au cours de conversations prolongées, car une question unique peut ne pas révéler leur capacité à résister aux allégations trompeuses et à une pression répétée.