Une étude publiée dans la revue « PNAS » a révélé que le cerveau humain ne se contente pas d’identifier les composantes d’un lieu lorsqu’il l’observe: il construit automatiquement une représentation des activités et des mouvements qui peuvent y être réalisés. Une capacité que les modèles d’intelligence artificielle entraînés sur des images, des scènes et des séquences vidéo ne sont pas parvenus à reproduire avec la même efficacité.
Les possibilités d’action expliquent la perception humaine des lieux
L’étude s’est intéressée au concept de « possibilités d’action », proposé au XXe siècle par le psychologue américain James Gibson. Selon ce concept, l’être humain perçoit les lieux à travers ce qu’il peut y faire, et pas seulement en fonction de leurs formes ou de leurs éléments visibles. Lorsqu’il regarde une plage, par exemple, le cerveau ne voit pas uniquement le sable et l’eau: il la considère aussi comme un lieu où il est possible de nager ou de construire des châteaux de sable.
Mai Mabrouk, professeure d’informatique biomédicale à la faculté des technologies de l’information et des sciences informatiques de l’université égyptienne du Nil, qui n’a pas participé à l’étude, explique que la différence entre voir une plage comme un lieu où nager et la voir comme du sable et de l’eau בלבד réside dans le fait que le cerveau ne se contente pas de décrire la scène: il en déduit aussi la possibilité d’y effectuer réellement des mouvements.
Elle a ajouté qu’il s’agissait d’un processus neuronal différent de la simple reconnaissance des éléments ou des matières présents dans l’image. Les chercheurs se sont appuyés sur des expériences comportementales et sur l’imagerie de l’activité cérébrale par résonance magnétique fonctionnelle.
Ils ont présenté à un groupe de volontaires 231 images de lieux variés, comprenant des environnements intérieurs et extérieurs, ainsi que des lieux naturels et d’autres construits par l’être humain. Ils ont ensuite demandé aux participants d’indiquer les actions qu’ils pouvaient accomplir dans chaque environnement présenté. Les possibilités de mouvement évaluées comprenaient la marche, le vélo, la natation, la conduite, l’escalade et la navigation.
Il s’agissait de déduire l’action possible à partir de chaque image, afin de permettre aux chercheurs d’étudier la relation entre les caractéristiques visuelles de la scène et les possibilités de mouvement que l’être humain y perçoit. Pendant le visionnage des images, l’équipe a utilisé l’imagerie par résonance magnétique fonctionnelle pour surveiller l’activité cérébrale des volontaires et déterminer les régions qui réagissaient à la vue de scènes permettant certains types de mouvements.
L’activité cérébrale est liée aux possibilités de mouvement dans l’environnement
Lors de la phase de comparaison, les chercheurs ont utilisé des réseaux neuronaux entraînés à classifier des images afin de tester leur capacité à représenter une scène de la manière dont le cerveau humain la traite. Les résultats ont montré une forte activité dans certaines régions du cerveau des participants lorsqu’ils regardaient certains environnements. Cette activité n’était pas uniquement liée au contenu des images, mais aussi aux possibilités de mouvement qu’elles offraient.
Lorsqu’il voyait la mer, par exemple, le cerveau réagissait à la possibilité d’y nager, et pas seulement à la présence d’eau dans l’image. Ce résultat indique que le cerveau ne s’arrête pas à la reconnaissance des éléments visuels, tels que les rochers, les sols ou d’autres composantes de la scène: il construit automatiquement des représentations de ce qu’il est possible de faire dans chaque environnement.
Ces possibilités peuvent comprendre des actions comme marcher ou escalader, ainsi que d’autres éventualités motrices, comme tomber. L’étude a identifié deux régions visuelles spécialisées associées à cette représentation motrice: la région parahippocampique et la région occipitale visuelle. La construction de représentations des possibilités d’action se produit même sans orienter l’attention de la personne vers celles-ci ni lui confier une tâche perceptive précise. Autrement dit, le cerveau établit des cartes du mouvement dès qu’il regarde l’environnement.
Mai Mabrouk a déclaré que le cerveau formait en permanence des cartes motrices et que celles-ci étaient indispensables à une interaction immédiate et efficace avec l’environnement. Selon elle, ce mécanisme soutient une perception orientée vers l’action, car la compréhension de ce que l’être humain voit ne se sépare pas de sa disposition à se déplacer ou à prendre une décision adaptée dans le lieu observé.
Les expériences ont également montré que la représentation neuronale des possibilités d’action ne dépendait pas du type de tâche demandé à la personne. Que les participants soient invités à décrire les objets qu’ils observaient ou simplement à fixer un point, les régions cérébrales continuaient de s’activer d’une manière indiquant que l’environnement était perçu comme une possibilité de mouvement particulière.
Cela signifie que la représentation des possibilités de mouvement constitue un élément essentiel de la perception humaine du monde, et non une réponse apparaissant uniquement lorsqu’une personne réfléchit consciemment à l’exécution d’une action. Cette propriété pourrait expliquer la facilité avec laquelle des décisions motrices sont prises dans des environnements nouveaux, sans qu’il soit nécessaire d’analyser consciemment chaque objet, surface ou matière présent dans la scène.
Mai Mabrouk a ajouté que l’étude avait montré que les possibilités d’action n’étaient pas déduites des seules composantes de la scène, comme les surfaces et les matières. Le cerveau les représente dans un espace représentationnel distinct, directement traité par le cortex visuel. Cette représentation sépare la connaissance des objets présents de la compréhension des fonctions motrices que le lieu permet.
La carte motrice observée par l’étude ne correspond pas aux classifications traditionnelles des scènes, telles que les environnements ouverts ou fermés. Elle ne repose pas non plus uniquement sur le type de matière, qu’il s’agisse de bois, de pierre ou d’eau, ni sur les objets visibles comme les arbres, les bâtiments et les rues. Elle prend plutôt la forme d’une carte représentationnelle en trois dimensions qui relie certains éléments aux actions possibles qui leur sont associées.
Parmi ces associations figurent la mer et la possibilité de nager, le bateau et l’action de ramer, ou encore les rochers et l’escalade. En ce sens, le cerveau traite la relation fonctionnelle entre l’élément et l’action, au lieu de se contenter de donner un nom à l’élément ou de classer globalement le lieu où il apparaît.
Les modèles d’image ne parviennent pas à reproduire la perception motrice
Lorsque les chercheurs ont comparé les représentations cérébrales aux réponses de modèles d’intelligence artificielle entraînés à classifier des images, des scènes ou même des séquences vidéo, ils ont constaté un écart dans leur capacité à reproduire ce type de perception. Malgré l’efficacité des réseaux neuronaux profonds pour reconnaître les éléments, ceux-ci se sont montrés moins performants pour représenter les possibilités d’action motrice qui leur sont associées. Mai Mabrouk a déclaré que l’étude établissait un lien entre cette faiblesse et l’absence d’« expérience incarnée » des modèles.
L’intelligence artificielle ne possède pas de corps capable de se déplacer et d’interagir avec l’environnement. Elle ne reçoit donc pas les informations sensori-motrices qui alimentent la représentation de l’action chez l’être humain. En outre, les modèles actuels ont été principalement entraînés à nommer les objets, et non à les utiliser ou à interagir concrètement avec eux.
Selon cette interprétation, il ne suffit pas qu’une machine reconnaisse ce qu’elle voit: elle a besoin d’une expérience liée à l’action dans l’environnement. Mai Mabrouk a expliqué que la réduction de cet écart nécessitait d’intégrer le corps au processus d’apprentissage sensorimoteur, afin que l’intelligence artificielle apprenne en exécutant des actions dans le monde qui l’entoure, à l’image de ce qui se passe avec les robots mobiles.
Elle a ajouté que l’étape décisive consistait à mettre en place un apprentissage incarné dans des environnements naturels, ce qui pourrait permettre aux modèles de développer des représentations fonctionnelles plus proches de celles produites par le cerveau humain. Selon cette approche, l’apprentissage serait lié au mouvement et à l’expérience sensorielle, plutôt que de reposer uniquement sur des images et des données visuelles.
Les applications de la perception incarnée dans la conduite et la réalité virtuelle
Ces résultats ouvrent la voie à des applications pratiques, notamment l’amélioration des algorithmes des voitures autonomes, afin qu’elles soient davantage capables de prévoir le comportement des piétons et d’identifier les lieux où il est possible de traverser. Les environnements de réalité virtuelle et de réalité augmentée pourraient également tirer profit de l’intégration de représentations dynamiques des possibilités de mouvement, afin de renforcer l’interaction de l’utilisateur avec les espaces conçus numériquement.
L’étude soutient également le développement d’une intelligence artificielle incarnée, qui apprend de l’expérience sensorimotrice et pas seulement de l’observation d’images.
La carte neuronale observée par les chercheurs montre que la perception humaine est liée à l’action et à la prise de décision, et que le mouvement et le corps sont des éléments essentiels de la manière dont l’être humain comprend son environnement.