Aller au contenu principal
EAGOR : raisonnement incarné omnidirectionnel
RecherchearXiv cs.RO 

EAGOR : raisonnement incarné omnidirectionnel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent EAGOR, un framework de raisonnement directionnel pour agents dotés de caméras omnidirectionnelles à 360 degrés, conçu pour les tâches de navigation et de recherche d'objets sans carte préalable. Contrairement aux modèles vision-langage (VLM) existants qui projettent les images à 360 degrés en projection équirectangulaire (ERP) et les traitent avec des architectures pensées pour des images classiques, EAGOR traite directement la géométrie sphérique de l'observation via une estimation bayésienne récursive sur la sphère, sans réentraîner le modèle VLM sous-jacent. Sa brique centrale, le Spherical Harmonic Belief Field (SH-BF), maintient une croyance continue sur la direction cible et la propage de façon cohérente lors des déplacements du robot. Évalué sur les benchmarks HOS et OSR-Bench ainsi que sur un robot à pattes en conditions réelles, EAGOR affiche des gains relatifs moyens de 34,4% et 45,6% sur ces deux jeux de données, une amélioration de 14,6% du taux de réussite en navigation, une réduction de 17,7% du nombre de pas nécessaires et une baisse de 24,5% de l'erreur angulaire moyenne.

L'enjeu dépasse la simple performance sur benchmark : les VLM actuels perdent en cohérence directionnelle dès que l'agent bouge, car la projection ERP introduit des distorsions de latitude et des discontinuités aux coutures de l'image, ce qui rend peu fiable toute estimation de cap dans un contexte de navigation autonome sans carte. En traitant nativement la sphère plutôt que sa projection 2D, EAGOR répond directement à ce problème d'écart entre démonstration et fiabilité opérationnelle, un point sensible pour les intégrateurs qui cherchent à déployer des agents mobiles ou des robots à pattes capables de s'orienter de manière robuste dans des environnements changeants, sans dépendre d'une cartographie préalable coûteuse à maintenir.

Cette approche s'inscrit dans la lignée des travaux cherchant à exploiter la vision omnidirectionnelle pour des tâches embarquées, un domaine où les architectures perspective restent dominantes par simple héritage des VLM génériques. En étant training-free, EAGOR peut potentiellement se greffer sur des piles de navigation existantes sans coût de réentraînement, et les tests menés sur un robot à pattes en conditions réelles, au-delà des seuls benchmarks synthétiques, suggèrent une voie vers une adoption plus rapide dans des systèmes de navigation autonome déployés en environnement réel.

À lire aussi

Locomotion amphibie omnidirectionnelle par actionnement de masse interne
1arXiv cs.RO 

Locomotion amphibie omnidirectionnelle par actionnement de masse interne

Des chercheurs du General Robotics Lab ont présenté MARBLE, un robot roulant amphibie omnidirectionnel entièrement fermé dont toute la locomotion repose sur le déplacement de masses internes. Trois glissières linéaires orthogonales déplacent ces masses pour faire tourner une coque sphérique rigide, pilotée par un contrôleur qui convertit des commandes de vitesse planaire en positions de glissières. Cette coque étanche sert simultanément de surface de contact au sol, d'enveloppe flottante et de support à des ailerons passifs assurant la propulsion en surface de l'eau, sans reconfiguration mécanique ni actionneurs dédiés à chaque milieu. Le robot a été testé en locomotion omnidirectionnelle, sur terrains hétérogènes, en surface aquatique, lors de transitions terre-eau et lors de chocs délibérés contre des obstacles. Décrite dans une prépublication arXiv (2609.27358) de septembre 2026, l'étude s'accompagne d'une promesse d'ouverture complète du logiciel et de la conception matérielle sur le site du laboratoire. L'intérêt pour la robotique de terrain tient à l'unification de la propulsion : la plupart des robots amphibies combinent des systèmes séparés, roues ou pattes pour la terre, hélices pour l'eau, ce qui multiplie les points de défaillance face à la boue, aux débris ou à la végétation. En logeant tous les organes actifs dans une coque scellée, MARBLE gagne en étanchéité et en robustesse aux chocs, tandis que sa forme sphérique lui permet d'absorber les changements d'orientation et de point de contact lors d'une collision, un mode d'échec courant sur le terrain. Pour les concepteurs de robots d'inspection, de surveillance environnementale ou de recherche et sauvetage, l'approche esquisse une alternative mécaniquement plus simple aux architectures hybrides à pattes ou à roues, misant sur la compacité plutôt que sur la charge utile ou la vitesse. La locomotion par déplacement de masse interne équipe déjà des robots sphériques terrestres de type « ballbot » ; sa nouveauté ici tient à l'extension au milieu aquatique via une coque étanche et des ailerons passifs, sans mécanisme de transition dédié. Le projet, associé au General Robotics Lab, reste à un stade de validation expérimentale en laboratoire : aucun partenariat industriel, pilote de déploiement ni calendrier de commercialisation n'est mentionné dans la publication. Les auteurs annoncent vouloir publier en open source l'ensemble du logiciel et des plans matériels, une démarche orientée reproduction académique plutôt que produit commercial. Aucun acteur français ou européen n'apparaît dans ces travaux.

RecherchePaper
1 source
ObsGraph : représentation hiérarchique des observations pour le raisonnement incarné et l'exploration
2arXiv cs.RO 

ObsGraph : représentation hiérarchique des observations pour le raisonnement incarné et l'exploration

Des chercheurs ont soumis le 24 juin 2026 sur arXiv (identifiant 2606.24068) un système baptisé ObsGraph, une représentation hiérarchique de scène centrée sur l'observation, destinée aux agents robotiques déployés dans des environnements complexes et inconnus. L'architecture repose sur trois couches emboîtées : les pièces (rooms), qui fournissent des ancres sémantiques grossières à l'échelle d'une zone ; les vues (views), qui préservent la co-visibilité contextuelle des objets dans un même champ ; et les objets (objects), qui stockent les détails fins nécessaires à l'exécution des tâches. Sur cette représentation, ObsGraph exécute une récupération d'information hiérarchique contrainte par un budget computationnel, du plus grossier au plus précis, puis utilise les résultats obtenus pour structurer dynamiquement la stratégie d'exploration : activation de l'exploration au niveau pièce, raffinement de vue, ou exploration de frontière (frontier exploration). La contribution centrale est le couplage serré entre représentation, récupération et exploration adaptative, là où la majorité des approches existantes traitent ces trois composantes de manière découplée. En pratique, ce que l'agent a déjà observé détermine directement où il cherche ensuite, réduisant l'exploration redondante. Les expériences sur des benchmarks d'embodied reasoning et d'exploration montrent des améliorations en taux de réussite et en efficacité, mais les auteurs ne publient pas de chiffres précis dans le résumé de la pré-publication, ce qui limite l'évaluation indépendante à ce stade. Pour un intégrateur ou un COO industriel, ce type de système pointe vers des agents capables de naviguer dans un entrepôt ou un atelier non cartographié avec un budget d'exploration réduit, un point critique pour les déploiements en environnements non structurés. Ce travail s'inscrit dans la dynamique plus large de l'embodied AI, où l'enjeu est de faire raisonner des agents sur des scènes inédites sans carte préexistante. Les approches concurrentes incluent les semantic maps, les topological graphs, et les modèles VLA (Vision-Language-Action) qui intègrent raisonnement et contrôle moteur dans un même réseau de neurones. ObsGraph se positionne comme une couche mémoire et représentation complémentaire à ces modèles d'action, et non comme un système de contrôle moteur à part entière. Il s'agit pour l'instant d'un preprint arXiv sans déploiement réel ni partenariat industriel annoncé ; la prochaine étape logique serait une intégration avec des frameworks robotiques comme ROS 2 ou des systèmes VLA déjà validés en conditions réelles, afin de mesurer le gain effectif au-delà des benchmarks académiques.

RecherchePaper
1 source
Démasquer l'illusion du raisonnement incarné dans les modèles vision-langage-action (VLA)
3arXiv cs.RO 

Démasquer l'illusion du raisonnement incarné dans les modèles vision-langage-action (VLA)

Des chercheurs ont publié le 22 avril 2026 un article sur arXiv (référence 2604.18000) introduisant BeTTER, un benchmark de diagnostic conçu pour tester le raisonnement incarné réel dans les modèles de type Vision-Language-Action (VLA). L'objectif : vérifier si les taux de succès élevés affichés par des modèles comme pi-0, OpenVLA ou RoboVLMs sur les benchmarks standards reflètent une véritable intelligence physique, ou un artefact d'évaluation. BeTTER applique des interventions causales ciblées, modifications de la disposition spatiale, extrapolation temporelle, tout en isolant cinématiquement les échecs de raisonnement de haut niveau des limites d'exécution motrice de bas niveau. Résultat : les VLA de pointe s'effondrent dans des scénarios dynamiques, exhibant des raccourcis lexico-cinématiques (le modèle associe des mots à des patterns moteurs sans vraiment "comprendre"), une inertie comportementale, et un effondrement de la représentation sémantique. Ces résultats remettent en cause l'un des postulats les plus optimistes du secteur : que les hauts scores sur benchmarks constituent une preuve de généralisation. L'analyse mécaniste des auteurs identifie deux goulots d'étranglement architecturaux structurels, la compression de capacité et le sous-échantillonnage myope, qui dégradent systématiquement la représentation sémantique fondamentale du modèle. En d'autres termes, les architectures VLA actuelles sont structurellement contraintes à sacrifier le raisonnement de haut niveau pour maintenir la fréquence de contrôle nécessaire à l'exécution motrice en temps réel. Les protocoles d'évaluation trop statiques masquent cette dégradation en permettant au modèle d'overfitter aux priors sensorimoteurs du dataset, ce qui est un signal d'alarme direct pour les intégrateurs industriels qui évaluent ces systèmes avant déploiement. La famille VLA a connu une accélération marquée depuis fin 2023, avec les travaux de Physical Intelligence (pi-0), Google DeepMind (RT-2, puis Helix en collaboration avec Figure AI), et des efforts académiques nombreux autour de modèles open-source comme OpenVLA. Le gap benchmark-réalité est un problème récurrent en robotique, le sim-to-real transfer en est la version la plus connue, mais BeTTER le documente cette fois au niveau du raisonnement cognitif plutôt que de la dynamique physique. Les auteurs valident leurs conclusions sur robot réel, ce qui exclut l'hypothèse d'un artefact de simulation. La prochaine étape logique pour le secteur est de repenser les architectures VLA pour résoudre la tension structurelle entre contrôle haute fréquence et raisonnement sémantique robuste, probablement via des approches hiérarchiques déjà explorées par des équipes comme Wandercraft côté locomotion, ou Enchanted Tools pour la manipulation expressive.

UEWandercraft et Enchanted Tools, acteurs français actifs sur la locomotion et la manipulation expressive, sont directement concernés par les goulots d'étranglement architecturaux identifiés par BeTTER, qui constitue un signal d'alarme pour tout intégrateur européen évaluant des systèmes VLA avant déploiement industriel.

RechercheOpinion
1 source
Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon
4arXiv cs.RO 

Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon

Cortex, présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.05377), est un nouveau framework d'agent incarné destiné aux tâches de manipulation robotique à long horizon. Le problème qu'il cible: les modèles Vision-Language-Action (VLA) actuels, de par leur nature markovienne, ne s'appuient que sur l'observation courante et peinent sur les séquences longues, tandis que les approches hiérarchiques à double système existantes souffrent d'un décalage entre la sémantique du planning haut niveau et la cinématique d'exécution bas niveau. Cortex introduit une interface de planification qui traduit les plans du VLM haut niveau en sous-tâches exécutables pour le VLA bas niveau, en standardisant les manipulations en 32 primitives de compétences canoniques. Les chercheurs ont ainsi pu annoter automatiquement plus de 4 000 heures de vidéos open-source et générer 30 heures de données de simulation, avec une stratégie d'échantillonnage équilibré par événements pour affiner l'entraînement sur les transitions ambiguës entre sous-tâches. Sur le plan des résultats, Cortex dépasse les baselines monolithiques de 3,1% sur le benchmark Libero-long et de 4,1% sur RoboTwin, en évaluation à la fois open-loop (VLM) et closed-loop (système complet). Plus notable pour l'industrie: le VLM généraliste de Cortex permet de réaliser en zero-shot des tâches réelles inédites à long horizon, comme des expériences de chimie en plusieurs étapes, simplement en le couplant à un VLA fine-tuné, une capacité que le fine-tuning d'un VLA seul n'atteint pas. Cela suggère qu'une architecture correctement pontée entre planification et exécution peut combler l'écart simulation-réel mieux qu'un unique modèle monolithique, un argument qui intéresse directement les intégrateurs cherchant à généraliser au-delà des tâches d'entraînement. Ce travail s'inscrit dans la lignée des architectures duales explorées par des modèles comme Pi-0, GR00T N2 ou Helix, qui tentent chacun de résoudre la même tension entre raisonnement sémantique et contrôle moteur. Cortex reste à ce stade une contribution de recherche évaluée sur benchmarks académiques et non un système déployé en production, mais son approche par primitives standardisées et annotation automatique à grande échelle pourrait influencer la prochaine génération de frameworks d'agents robotiques génécralistes.

RechercheActu
1 source