كشفت دراسة منشورة في دورية «بي إن إيه إس» أن الدماغ البشري لا يكتفي بالتعرف على مكونات المكان عند النظر إليه، بل يبني تلقائيا تمثيلا للأنشطة والحركات الممكنة داخله، في قدرة لم تتمكن نماذج الذكاء الاصطناعي المدربة على الصور والمشاهد ومقاطع الفيديو من محاكاتها بالكفاءة نفسها.
إمكانات الفعل تفسر إدراك الإنسان للمكان
وتناولت الدراسة مفهوم «إمكانات الفعل»، الذي طرحه عالم النفس الأميركي جيمس جيبسون في القرن العشرين، ويقوم على أن الإنسان يدرك الأماكن من خلال ما يستطيع فعله فيها، وليس استنادا إلى أشكالها أو عناصرها المرئية فقط. فعند النظر إلى الشاطئ، على سبيل المثال، لا يرى الدماغ الرمال والماء فحسب، بل يتعامل معه أيضا بوصفه مكانا يتيح السباحة أو بناء القصور الرملية.
وتوضح مي مبروك، أستاذة المعلوماتية الطبية الحيوية في كلية تكنولوجيا المعلومات وعلوم الحاسوب بجامعة النيل المصرية، التي لم تشارك في الدراسة، أن الفرق بين رؤية الشاطئ كمكان للسباحة ورؤيته بوصفه رمالا وماء فقط يتمثل في أن الدماغ لا يصف المشهد فحسب، وإنما يشتق منه إمكانية الحركة الفعلية داخله.
وأضافت أن هذه عملية عصبية تختلف عن مجرد التعرف على العناصر أو المواد الموجودة في الصورة. واعتمد الباحثون على تجارب سلوكية وتصوير نشاط الدماغ بالرنين المغناطيسي الوظيفي.
وعرضوا على مجموعة من المتطوعين 231 صورة لأماكن متنوعة، شملت بيئات داخلية وخارجية، وأماكن طبيعية وأخرى صناعية، ثم طلبوا من المشاركين تحديد الأفعال التي يمكنهم القيام بها في كل بيئة ظاهرة أمامهم. وشملت الخيارات الحركية التي قيّمها المشاركون المشي وركوب الدراجة والسباحة والقيادة والتسلق والإبحار.
وكان المطلوب هو استنتاج الفعل الممكن انطلاقا من كل صورة، بما يسمح للباحثين بدراسة العلاقة بين السمات البصرية للمشهد وبين الفرص الحركية التي يدركها الإنسان فيه. وخلال مشاهدة الصور، استخدم الفريق أجهزة الرنين المغناطيسي الوظيفي لرصد نشاط أدمغة المتطوعين وتحديد المناطق التي تستجيب عند مشاهدة مشاهد تتيح أنواعا معينة من الحركة.
نشاط الدماغ يرتبط بفرص الحركة في البيئة
وفي مرحلة المقارنة، استعان الباحثون بشبكات عصبية مدربة على تصنيف الصور، لاختبار مدى قدرتها على تمثيل المشهد بالطريقة التي يتعامل بها الدماغ البشري معه. وأظهرت النتائج نشاطا قويا في مناطق محددة من أدمغة المشاركين عند مشاهدة بعض البيئات، ولم يكن هذا النشاط مرتبطا بمحتوى الصور وحده، بل بإمكانات الحركة المتاحة فيها.
فعند رؤية البحر، على سبيل المثال، استجاب الدماغ لإمكانية السباحة التي يوفرها المكان، وليس لمجرد وجود الماء في الصورة. وتشير هذه النتيجة إلى أن الدماغ لا يتوقف عند التعرف على العناصر البصرية، مثل الصخور أو الأرضيات أو غيرها من مكونات المشهد، وإنما ينشئ بصورة تلقائية تمثيلات لما يمكن القيام به في كل بيئة.
وقد تشمل هذه الإمكانات أفعالا مثل المشي أو التسلق، إضافة إلى احتمالات حركية أخرى مثل السقوط. وحددت الدراسة منطقتين بصريتين متخصصتين يرتبط بهما هذا التمثيل الحركي، هما المنطقة المجاورة للحُصين والمنطقة القفوية البصرية. ويحدث بناء تمثيلات إمكانات الفعل حتى من دون توجيه انتباه الشخص إليها أو تكليفه بمهمة إدراكية محددة، ما يعني أن الدماغ يرسم خرائط للحركة بمجرد النظر إلى البيئة.
وقالت مبروك إن الدماغ يكوّن خرائط حركية بصورة مستمرة، وإن هذه الخرائط ضرورية للتفاعل الفوري والفعال مع المحيط. وترى أن هذه الآلية تدعم وظيفة الإدراك الموجه نحو العمل، إذ لا ينفصل فهم الإنسان لما يراه عن استعداده للتحرك أو اتخاذ قرار مناسب داخل المكان.
وبينت التجارب كذلك أن التمثيل العصبي لإمكانات الفعل لا يتوقف على نوع المهمة المطلوبة من الفرد. فسواء طُلب من المشاركين وصف الأشياء التي يشاهدونها أو الاكتفاء بالتحديق في نقطة، ظلت مناطق الدماغ تنشط بطريقة تدل على أن البيئة تُدرك باعتبارها فرصة لحركة معينة.
ويعني ذلك أن تمثيل فرص الحركة مكوّن أساسي في إدراك الإنسان للعالم، وليس استجابة تظهر فقط عند التفكير الواعي في تنفيذ فعل. ويمكن لهذه الخاصية أن تفسر سهولة اتخاذ قرارات حركية في بيئات جديدة، من دون الحاجة إلى تحليل واع لكل جسم أو سطح أو مادة موجودة في المشهد.
وأضافت مبروك أن الدراسة أظهرت أن إمكانات الفعل لا تُستخلص من مكونات المشهد، كالسطوح والمواد، وحدها، بل يمثلها الدماغ داخل فضاء تمثيلي مستقل يُعالج مباشرة في القشرة البصرية. ويفصل هذا التمثيل بين معرفة الأشياء الموجودة وبين فهم الوظائف الحركية التي يتيحها المكان.
ولا تتطابق الخريطة الحركية التي رصدتها الدراسة مع التصنيفات التقليدية للمشاهد، مثل البيئات المفتوحة أو المغلقة، كما لا تقوم فقط على نوع المادة، سواء كانت خشبا أو حجرا أو ماء، ولا على الأجسام المرئية مثل الأشجار والمباني والشوارع. وبدلا من ذلك، تتخذ شكل خريطة تمثيلية ثلاثية الأبعاد تربط عناصر محددة بالأفعال الممكنة المتصلة بها.
ومن أمثلة هذه الروابط اقتران البحر بإمكانية السباحة، والقارب بالتجديف، والصخور بالتسلق. وبهذا المعنى، يعالج الدماغ العلاقة الوظيفية بين العنصر والفعل، بدلا من الاكتفاء بوضع تسمية للعنصر أو تصنيف عام للمكان الذي يظهر فيه.
نماذج الصور تعجز عن محاكاة الإدراك الحركي
وعندما قارن الباحثون تمثيلات الدماغ باستجابات نماذج ذكاء اصطناعي مدربة على تصنيف الصور أو المشاهد أو حتى مقاطع الفيديو، ظهرت فجوة في قدرتها على محاكاة هذا النوع من الإدراك. فعلى الرغم من كفاءة الشبكات العصبية العميقة في التعرف على العناصر، فإنها أظهرت ضعفا في تمثيل إمكانات الفعل الحركي المرتبطة بها. وقالت مبروك إن الدراسة تربط هذا الضعف بافتقار النماذج إلى «التجربة المجسدة».
فالذكاء الاصطناعي لا يمتلك جسدا يتحرك ويتفاعل مع البيئة، ولذلك لا تصله المدخلات الحسية الحركية التي تغذي تمثيل الفعل لدى الإنسان. كما أن النماذج الحالية تدربت أساسا على تسمية الأشياء، وليس على استخدامها أو التفاعل الفعلي معها.
وبحسب هذا التفسير، لا يكفي أن تتعرف الآلة على ما تراه، بل تحتاج إلى خبرة مرتبطة بالفعل داخل البيئة. وأوضحت مبروك أن تقليص الفجوة يتطلب إدماج الجسم في عملية التعلم الحسي الحركي، بحيث يتعلم الذكاء الاصطناعي من خلال أداء الأفعال في العالم المحيط، على غرار ما يحدث في الروبوتات المتنقلة.
وأضافت أن الخطوة الحاسمة تتمثل في التعلم المجسد داخل بيئات طبيعية، بما قد يمكّن النماذج من تطوير تمثيلات وظيفية أقرب إلى ما ينتجه الدماغ البشري. وبهذا النهج، يرتبط التعلم بالحركة والتجربة الحسية بدلا من الاعتماد على الصور والبيانات البصرية وحدها.
تطبيقات الإدراك المجسد في القيادة والواقع الافتراضي
وتفتح النتائج مجالا لتطبيقات عملية، من بينها تحسين خوارزميات السيارات ذاتية القيادة، بحيث تصبح أكثر قدرة على التنبؤ بسلوك المشاة وتمييز الأماكن القابلة للعبور. وقد تستفيد بيئات الواقع الافتراضي والواقع المعزز أيضا من إدخال تمثيلات ديناميكية لإمكانات الحركة، بما يعزز تفاعل المستخدم مع الأماكن المصممة رقميا.
كما تدعم الدراسة اتجاه تطوير ذكاء اصطناعي متجسد يتعلم من الخبرة الحسية الحركية، لا من مشاهدة الصور وحدها.
وتوضح الخريطة العصبية التي رصدها الباحثون أن الإدراك البشري مرتبط بالفعل واتخاذ القرار، وأن الحركة والجسد عنصران أساسيان في الطريقة التي يفهم بها الإنسان البيئة المحيطة.