قد يؤدي طرح السؤال نفسه بالعربية والإنجليزية أو الفرنسية على نموذج للذكاء الاصطناعي إلى إجابات متفاوتة في دقة المعلومات والمصطلحات والتفاصيل وفهم السياق الثقافي. ولا يعني هذا التفاوت بالضرورة أن النموذج «يفكر» بلغة أفضل من أخرى، بل يرتبط أساساً بطريقة تدريبه، وحجم النصوص المتاحة بكل لغة، والكيفية التي تُمثَّل بها اللغات حسابياً داخل بنيته.
تفاوت بيانات التدريب بين اللغات
تبدأ الفوارق من البيانات التي تعتمد عليها النماذج اللغوية الكبيرة خلال التدريب. فعلى الرغم من استخدام كميات ضخمة من النصوص، لا تتوزع هذه المواد بالتساوي بين اللغات.
وربطت الدراسة هذه الاختلافات بحجم بيانات التدريب ومصادرها، والمسافة اللغوية بين اللغات، وطريقة تقسيم النصوص قبل معالجتها. كما بينت النتائج أن الإنجليزية لم تتصدر الأداء في جميع الاختبارات، إذ تفوقت عليها لغات أخرى في بعض المهام.
وتوصلت دراسة أخرى شملت أكثر من 250 لغة إلى أن إدخال بيانات متعددة اللغات في التدريب يمكن أن يحسن أداء اللغات منخفضة الموارد. غير أن مقدار التحسن يتوقف على حجم البيانات المتاحة ودرجة التشابه اللغوي بين اللغات.
تأثير تقسيم الكلمات على أداء النموذج
وفي المقابل، قد يؤدي التوسع المفرط في عدد اللغات التي يتعامل معها النموذج إلى فرض قيود على قدراته بدلاً من تحقيق تحسن متساوٍ في جميع اللغات. ولا يقتصر الأمر على كمية النصوص، لأن الكلمات لا تدخل إلى النموذج بصورتها المعتادة. فقبل معالجة السؤال، تُجزأ النصوص إلى وحدات أصغر تُعرف باسم الرموز أو «التوكنات»، وقد تختلف كفاءة هذه العملية من لغة إلى أخرى.
وبذلك يمكن لسؤالين متطابقين في المعنى أن يصلا إلى النموذج في صورتين حسابيتين مختلفتين عند كتابتهما بلغتين مختلفتين. وأشارت أبحاث حديثة إلى أن اختيار أداة تقسيم النص إلى رموز يؤثر في أداء النموذج وفي تكلفة تدريبه. وقد تتسبب الأدوات المصممة بطريقة تتمحور حول الإنجليزية في تراجع كبير عند استخدامها مع لغات أخرى، نتيجة ضعف كفاءة تمثيل نصوص تلك اللغات.
ويتحول هذا الخلل التقني إلى فروق في فهم الأسئلة أو صياغة الإجابات واستحضار المعلومات. كما خلصت دراسة عُرضت في مؤتمر جمعية اللغويات الحاسوبية لعام 2025 إلى أن التنوع اللغوي يؤثر في طريقة تقسيم النص، وأن الفوارق الناتجة عن ذلك قد تنعكس على أداء النماذج في مهام متعددة.
السياق الثقافي يغير تفسير السؤال
ومن ثم، لا يكون تغيير لغة السؤال مجرد استبدال كلمات بأخرى، بل قد يغير عدد الوحدات التي يعالجها النموذج والعلاقات الحسابية بينها. ويمتد تأثير اللغة إلى الثقافة المرتبطة بها، إذ تحمل بعض الأسئلة إشارات ثقافية حتى لو بدت صياغتها بسيطة.
ووجدت دراسة قُدمت في مؤتمر «إيه سي إل 2025» ما سماه الباحثون «التآزر اللغوي الثقافي»، حيث تحسن أداء النماذج عندما كان السؤال متوافقاً ثقافياً مع اللغة المستخدمة. وخلص الباحثون إلى أن تقييم النموذج ينبغي ألا يعزل اللغة عن سياقها الثقافي. وأظهر بحث آخر أن النماذج قد تمتلك معرفة بثقافات محلية، لكنها لا تستدعي هذه المعرفة تلقائياً في كل مرة تجيب فيها بلغة مرتبطة بتلك الثقافة.
ويمكن أن يؤدي تضمين السياق الثقافي بصورة صريحة في السؤال إلى جعل الإجابة أكثر ارتباطاً بالبيئة المحلية، مقارنة بسؤال عام لا يحدد البلد أو المجتمع المقصود. ويظهر هذا الأثر، على سبيل المثال، في الأسئلة المتعلقة بعادة اجتماعية أو مثل شعبي أو نظام قانوني. فقد توحي اللغة المستخدمة للنموذج ببلد أو ثقافة محددة، فيبني إجابته وفق تلك الإشارات الضمنية.
تحديات العربية واللهجات محدودة الموارد literacy
وعندما تتغير لغة السؤال، قد تتغير معها الإشارات التي يعتمد عليها، حتى إذا بقي المعنى المباشر للسؤال ثابتاً. وتبرز المشكلة بصورة أكبر في اللغات واللهجات ذات الموارد الرقمية المحدودة. وفي العربية، تتجاوز التحديات مسألة التعامل مع الفصحى، لتشمل التنوع الواسع في اللهجات والسياقات المحلية.
ويجعل ذلك بناء نموذج قادر على تقديم مستوى متقارب من الدقة والوعي الثقافي في مختلف البيئات العربية مهمة أكثر تعقيداً. وبحسب ورقة «مؤشر نضج تقنيات الذكاء الاصطناعي للغة العربية بلسم»، المنشورة ضمن أعمال مؤتمر معالجة اللغة العربية 2025، يتأثر أداء النماذج بالعربية بعدة عوامل، تشمل ندرة البيانات والتنوع اللغوي واللهجي والتعقيد الصرفي.
وأضافت الورقة أن محدودية أدوات القياس والاختبارات المتخصصة تمثل تحدياً آخر أمام التقييم الدقيق لقدرات هذه النماذج. وطورت دراسة أخرى معيار «أراديس» لاختبار قدرات النماذج في اللهجات العربية ومدى وعيها بالسياقات الثقافية في الخليج ومصر وبلاد الشام.
ويستهدف هذا المعيار التعامل مع الفجوة القائمة بين العربية الفصحى واللهجات، إلى جانب الاختلافات الثقافية داخل المناطق العربية، بدلاً من تقييم الأداء العربي باعتباره كتلة لغوية واحدة. وتواجه لغات أخرى تحديات مماثلة. فقد أشارت منظمة اليونسكو إلى أن أنظمة الذكاء الاصطناعي التي تُدرَّب أساساً على اللغات المهيمنة قد تكون أقل فعالية عند التعامل مع بعض اللغات الأفريقية.
ولا يقتصر أثر نقص البيانات المحلية على جودة الصياغة اللغوية، بل قد يحد أيضاً من قدرة الأنظمة على فهم المفاهيم الثقافية المحلية ومعالجتها. ولا يشكل اختلاف الإجابات بين لغتين، بمفرده، دليلاً حاسماً على وجود تحيز متعمد.
فقد ينشأ التفاوت من اختلاف حجم البيانات أو آلية تقسيم النص أو السياق الثقافي أو صياغة السؤال. ومع ذلك، يمكن أن تتحول هذه العوامل إلى تحيز لغوي فعلي في المخرجات، ولا سيما عندما تُمثل لغة معينة ببيانات أقل أو تُبنى اختبارات الأداء حول اللغات الأوسع انتشاراً.
لهذا تتجه الأبحاث إلى اختبار النماذج عبر لغات وثقافات متعددة، بدلاً من الاكتفاء بتقييم أدائها بالإنجليزية. فاختبار القدرة على فهم الكلمات وحدها لا يكفي، لأن جودة الإجابة تتوقف أيضاً على فهم السؤال في بيئته اللغوية والثقافية.
ويقول الخبراء إن النموذج لا يستخرج جواباً ثابتاً من قاعدة بيانات واحدة، بل يبنيه من تمثيلات تشكلت أثناء التدريب؛ ولذلك تتغير طريقته في الوصول إلى الإجابة كلما تغيرت اللغة والسياق والبيانات المتاحة.