Poser la même question en arabe, en anglais ou en français à un modèle d’intelligence artificielle peut produire des réponses différentes en matière d’exactitude des informations, de terminologie, de détails et de compréhension du contexte culturel. Cette variation ne signifie pas nécessairement que le modèle « pense » mieux dans une langue que dans une autre. Elle tient principalement à la manière dont il a été entraîné, au volume de textes disponibles dans chaque langue et à la façon dont les langues sont représentées mathématiquement dans son architecture.
Des données d’entraînement inégales selon les langues
Les différences commencent par les données utilisées lors de l’entraînement des grands modèles de langage. Malgré l’emploi de volumes considérables de textes, ces ressources ne sont pas réparties équitablement entre les langues.
L’étude a attribué ces différences au volume et aux sources des données d’entraînement, à la distance linguistique entre les langues et à la manière dont les textes sont découpés avant leur traitement. Les résultats ont également montré que l’anglais n’arrivait pas en tête dans tous les tests: d’autres langues le dépassaient dans certaines tâches.
Une autre étude portant sur plus de 250 langues a conclu que l’intégration de données multilingues dans l’entraînement pouvait améliorer les performances des langues à faibles ressources. L’ampleur de cette amélioration dépend toutefois du volume de données disponibles et du degré de similarité linguistique entre les langues.
L’effet du découpage des mots sur les performances du modèle
À l’inverse, augmenter excessivement le nombre de langues prises en charge par le modèle peut limiter ses capacités au lieu d’améliorer de manière égale les performances dans toutes les langues. La question ne se limite pas à la quantité de textes, car les mots n’entrent pas dans le modèle sous leur forme habituelle. Avant le traitement de la question, les textes sont divisés en unités plus petites appelées tokens ou « jetons », et l’efficacité de cette opération peut varier d’une langue à l’autre.
Ainsi, deux questions identiques par leur sens peuvent parvenir au modèle sous deux formes informatiques différentes lorsqu’elles sont écrites dans deux langues différentes. Des recherches récentes ont indiqué que le choix de l’outil de segmentation des textes en tokens influait sur les performances du modèle et sur le coût de son entraînement. Les outils conçus principalement autour de l’anglais peuvent entraîner une forte baisse des performances lorsqu’ils sont utilisés avec d’autres langues, en raison de leur faible efficacité pour représenter les textes dans ces langues.
Ce dysfonctionnement technique se traduit par des différences dans la compréhension des questions, la formulation des réponses et la restitution des informations. Une étude présentée lors de la conférence 2025 de l’Association for Computational Linguistics a également conclu que la diversité linguistique influait sur la manière de découper les textes et que les différences qui en résultaient pouvaient se répercuter sur les performances des modèles dans plusieurs tâches.
Le contexte culturel modifie l’interprétation de la question
Changer la langue de la question ne revient donc pas simplement à remplacer certains mots par d’autres: cela peut modifier le nombre d’unités traitées par le modèle et les relations mathématiques entre elles. L’influence de la langue s’étend à la culture qui lui est associée, car certaines questions comportent des références culturelles même lorsque leur formulation paraît simple.
Une étude présentée lors de la conférence « ACL 2025 » a identifié ce que les chercheurs ont appelé une « synergie linguistique et culturelle »: les performances des modèles s’amélioraient lorsque la question était culturellement compatible avec la langue utilisée. Les chercheurs ont conclu que l’évaluation d’un modèle ne devait pas isoler la langue de son contexte culturel. Une autre étude a montré que les modèles pouvaient disposer de connaissances sur des cultures locales, sans toutefois mobiliser automatiquement ces connaissances chaque fois qu’ils répondent dans une langue associée à cette culture.
Inclure explicitement le contexte culturel dans la question peut rendre la réponse plus étroitement liée à l’environnement local qu’une question générale ne précisant ni le pays ni la société concernés. Cet effet apparaît notamment dans les questions portant sur une pratique sociale, un proverbe ou un système juridique. La langue utilisée peut suggérer au modèle un pays ou une culture donnée, qui construit alors sa réponse à partir de ces indices implicites.
Les défis de l’arabe, des dialectes et des langues à faibles ressources en matière de literacy
Lorsque la langue de la question change, les indices sur lesquels le modèle s’appuie peuvent également changer, même si le sens direct de la question reste le même. Le problème est particulièrement marqué dans les langues et les dialectes disposant de ressources numériques limitées. En arabe, les difficultés ne se limitent pas à la prise en charge de l’arabe standard: elles concernent aussi la grande diversité des dialectes et des contextes locaux.
Construire un modèle capable d’offrir un niveau comparable de précision et de conscience culturelle dans les différents environnements arabophones devient ainsi une tâche plus complexe. Selon l’article « Indice de maturité des technologies d’intelligence artificielle pour la langue arabe Balsam », publié dans les actes de la conférence sur le traitement automatique de l’arabe 2025, les performances des modèles en arabe sont influencées par plusieurs facteurs, notamment la rareté des données, la diversité linguistique et dialectale ainsi que la complexité morphologique.
L’article ajoute que la limitation des outils de mesure et des tests spécialisés constitue un autre obstacle à l’évaluation précise des capacités de ces modèles. Une autre étude a mis au point le référentiel « Aradis » pour tester les capacités des modèles dans les dialectes arabes et leur degré de conscience des contextes culturels dans le Golfe, en Égypte et au Levant.
Ce référentiel vise à prendre en compte le fossé entre l’arabe standard et les dialectes, ainsi que les différences culturelles au sein des régions arabes, au lieu d’évaluer les performances en arabe comme s’il s’agissait d’un bloc linguistique unique. D’autres langues font face à des difficultés comparables. L’UNESCO a ainsi indiqué que les systèmes d’intelligence artificielle entraînés principalement sur les langues dominantes pouvaient être moins efficaces avec certaines langues africaines.
Le manque de données locales n’affecte pas seulement la qualité de la formulation linguistique: il peut également limiter la capacité des systèmes à comprendre et à traiter les concepts culturels locaux. À lui seul, l’écart entre les réponses données dans deux langues ne constitue pas une preuve concluante de l’existence d’un biais intentionnel.
Cette variation peut découler de différences dans le volume des données, le mécanisme de segmentation des textes, le contexte culturel ou la formulation de la question. Ces facteurs peuvent toutefois se transformer en un véritable biais linguistique dans les résultats, notamment lorsqu’une langue est représentée par moins de données ou que les tests de performance sont conçus autour des langues les plus répandues.
C’est pourquoi les recherches s’orientent vers l’évaluation des modèles dans plusieurs langues et cultures, plutôt que de se limiter à leurs performances en anglais. Tester uniquement leur capacité à comprendre les mots ne suffit pas, car la qualité de la réponse dépend également de la compréhension de la question dans son environnement linguistique et culturel.
Les experts affirment que le modèle ne récupère pas une réponse fixe dans une base de données unique: il la construit à partir de représentations formées pendant l’entraînement. Sa manière de parvenir à la réponse change donc chaque fois que varient la langue, le contexte et les données disponibles.