Aller au contenu principal
RecherchearXiv cs.RO 

L'intelligence à travers les incarnations robotiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv en septembre 2026 sous la référence 2609.27095, cet article de position définit l'embodiment robotique, capteurs, cinématique, dynamique, géométrie, actionneurs, commande, comme l'ensemble des propriétés physiques par lesquelles un agent interagit avec le monde, des propriétés qui varient d'un robot à l'autre et évoluent dans le temps. Ses auteurs soutiennent qu'une intelligence incarnée générale exige un apprentissage qui s'accumule malgré ces différences plutôt qu'un réentraînement à chaque nouvelle plateforme. Ils critiquent les méthodes dominantes, qui bâtissent des correspondances explicites entre embodiments : utiles à court terme mais limitantes pour le transfert à long terme. Ils proposent plutôt de rechercher des représentations généralisables, en posant la diversité des embodiments comme axe de passage à l'échelle, complétée par de larges a priori appris, et appellent à des évaluations mesurant mieux l'écart entre embodiments. Aucun chiffre, modèle ou benchmark n'est fourni : il s'agit d'une contribution théorique, non d'une annonce produit.

L'enjeu dépasse l'exercice académique. La plupart des modèles vision-langage-action actuels, du Pi-0 de Physical Intelligence au GR00T N2 de NVIDIA en passant par Helix de Figure AI, s'appuient sur des correspondances d'embodiment largement ad hoc pour transférer des compétences entre un bras fixe, un robot mobile et un humanoïde bipède. L'article avance que cette stratégie plafonnera la généralisation à mesure que le nombre de plateformes augmente, et suggère de traiter la diversité des corps comme un levier de scaling au même titre que le volume de données. Pour les intégrateurs opérant des flottes hétérogènes, la promesse d'une politique "generalist" unique reste conditionnée à la diversité réelle des embodiments d'entraînement, pas seulement à leur volume brut.

Cette publication arrive alors que la robotique généraliste traverse une phase de scaling intensif, après des années où chaque nouveau robot exigeait un réentraînement quasi complet ; les modèles VLA avaient promis de contourner ce problème via une politique unique partagée entre embodiments, promesse que ce texte nuance en pointant les limites des méthodes de correspondance actuelles. Le résumé ne nomme ni laboratoire ni institution affiliée, et ne mentionne aucun déploiement, pilote industriel, calendrier ou acteur français ou européen : il s'agit d'un appel à réorienter les priorités de recherche de la communauté, non d'une feuille de route commerciale.

À lire aussi

RobotEQ : de l'intelligence passive à l'intelligence active dans l'IA incarnée
1arXiv cs.RO 

RobotEQ : de l'intelligence passive à l'intelligence active dans l'IA incarnée

Une équipe de chercheurs a publié en mai 2025 RobotEQ (arXiv:2605.06234), un benchmark conçu pour évaluer ce qu'ils appellent l'intelligence active dans les systèmes d'IA incarnée. Contrairement aux approches actuelles, où un robot exécute des tâches sur instruction explicite de l'utilisateur (intelligence passive), l'intelligence active désigne la capacité d'un système à identifier de manière autonome quelles actions sont socialement acceptables ou interdites, sans consigne préalable. Pour mesurer cette aptitude, les auteurs ont constitué RobotEQ-Data : un jeu de données de 1 900 images en vue égocentrique, couvrant 10 catégories scénario typiques de l'IA incarnée et 56 sous-catégories. Via annotation manuelle intensive, ils ont produit 5 353 questions de jugement d'action et 1 286 questions d'ancrage spatial, formant ensemble le socle du benchmark RobotEQ-Bench. Les résultats d'évaluation sur les modèles de pointe actuels sont sans ambiguïté : aucun ne satisfait de manière fiable aux exigences de l'intelligence active, avec des lacunes particulièrement marquées sur l'ancrage spatial, c'est-à-dire la capacité à localiser précisément les objets ou zones pertinents dans une scène pour motiver un comportement conforme aux normes sociales. L'étude montre cependant qu'intégrer des bases de connaissances externes via des techniques de RAG (Retrieval-Augmented Generation) améliore significativement les performances, ce qui suggère une piste concrète pour les développeurs de systèmes robotiques sociaux. Pour les industriels et intégrateurs, ce résultat pointe une limite critique avant tout déploiement en environnement humain non contrôlé : les robots actuels ne sont pas équipés pour naviguer les conventions implicites du quotidien. RobotEQ s'inscrit dans un effort académique plus large visant à combler le fossé entre capacités de manipulation assistée et autonomie sociale réelle, un sujet de plus en plus pressant à mesure que les robots humanoïdes entrent dans des espaces partagés avec des humains. Les grandes plateformes évaluées ne sont pas nommées explicitement dans l'abstract, mais le benchmark cible les VLMs (Vision-Language Models) utilisés dans les architectures d'IA incarnée actuelles, comme ceux sous-tendant des systèmes tels que Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Aucun partenaire industriel ni calendrier de déploiement n'est annoncé, ce papier restant à ce stade une contribution de recherche fondamentale avec dataset et benchmark disponibles pour la communauté.

RecherchePaper
1 source
Vers l'intelligence des mains dextériques en robotique : un état de l'art
2arXiv cs.RO 

Vers l'intelligence des mains dextériques en robotique : un état de l'art

Une équipe de chercheurs a publié en mai 2026 sur arXiv (identifiant 2605.13925) une revue systématique de l'état de l'art des mains robotiques dextres, couvrant l'ensemble de la chaîne de recherche : mécanique et actionnement, perception tactile, méthodes de contrôle et d'apprentissage, jeux de données et protocoles d'évaluation. Le papier structuré en quatre axes examine les compromis fondamentaux entre capacité de force, compliance mécanique, bande passante de contrôle et complexité d'intégration. Il recense les principales architectures de transmission (câbles, tendons, engrenages), les modalités sensorielles embarquées (capteurs de force, peau artificielle, vision tactile type GelSight), et retrace l'évolution chronologique des paradigmes de contrôle : du contrôle impédanciel classique vers les approches par apprentissage par renforcement, imitation, et plus récemment les Visual-Language-Action models (VLA) appliqués à la manipulation en contact riche. L'intérêt principal de cette synthèse pour les équipes R&D et les intégrateurs industriels est qu'elle tente de résoudre un problème structurel du domaine : l'hétérogénéité des hypothèses expérimentales rend les comparaisons entre travaux quasi impossibles. Les auteurs pointent explicitement que les résultats publiés varient selon l'embodiment de la main, la configuration sensorielle, le type de tâche et le protocole d'évaluation retenu, ce qui obscurcit la trajectoire réelle du secteur. En consolidant datasets, pratiques de benchmarking et métriques d'évaluation dans un cadre commun, le survey fournit une grille de lecture pour juger si les progrès annoncés relèvent d'avancées méthodologiques réelles ou d'artefacts de setup. C'est particulièrement utile dans un contexte où les démos vidéo soigneusement sélectionnées et les claims "sim-to-real solved" se multiplient sans validation robuste sur des tâches industrielles répétables. Ce travail s'inscrit dans une vague de consolidation académique portée par l'essor des mains humanoïdes commerciales : Figure (main intégrée sur Figure 02 et 03), Tesla Optimus, Agility Robotics ou encore les systèmes de Sanctuary AI ont tous relancé l'intérêt pour la manipulation dextre après deux décennies de progrès limités post-DLR Hand et Shadow Hand. Côté recherche, les laboratoires Carnegie Mellon, Stanford, ETH Zurich et, en Europe, des acteurs comme Enchanted Tools (France) et des spin-offs universitaires allemands poussent des approches hybrides hardware-learning. Le survey identifie comme chantiers ouverts prioritaires : la généralisation hors distribution (objets inconnus, matériaux déformables), la robustesse sensorielle en conditions industrielles dégradées, et la co-optimisation hardware-software encore trop rare. Aucun calendrier de publication étendue n'est annoncé ; le preprint est disponible en accès libre sur arXiv.

UELe survey cite explicitement Enchanted Tools (France) et des spin-offs universitaires allemands comme acteurs actifs sur la manipulation dextre hybride hardware-learning, en faisant une ressource de référence directement pertinente pour les équipes R&D françaises du secteur.

RecherchePaper
1 source
Le fossé de l'incarnation dans les modèles fondation pour robots
3arXiv cs.RO 

Le fossé de l'incarnation dans les modèles fondation pour robots

Une étude publiée sur arXiv sous la référence 2608.18433v1, intitulée « The Embodiment Gap in Robot Foundation Models », dresse un état des lieux critique des modèles de fondation pour la robotique (RFM), dont les politiques vision-langage-action (VLA). Le papier part d'un constat simple : un modèle peut généraliser sur le papier tout en nécessitant un travail d'adaptation important avant de tourner sur un robot physique donné. Les auteurs baptisent cet écart le « embodiment gap », soit le fossé entre des modèles, représentations ou jeux de données réutilisables et leur mise en œuvre effective sur le robot cible. La contribution centrale est une cartographie à deux axes qui classe les méthodes existantes selon le type de structure partagée et le stade d'adaptation requis avant exécution. L'étude passe ensuite en revue trois axes de recherche qui se recoupent : le partage de sémantique et de perception, le partage de données et d'interfaces robotiques, et l'apprentissage de correspondances entre différents types de corps robotiques. Elle propose enfin un cadre de reporting destiné à documenter ce travail d'adaptation, jugé invisible si l'on ne regarde que le taux de réussite final. Pour les intégrateurs et décideurs B2B du secteur, ce travail vient nuancer le récit dominant selon lequel la simple mise à l'échelle (plus de données, plus de paramètres, plus de benchmarks) suffirait à résoudre le transfert d'un modèle d'un robot à un autre. En creux, l'étude interroge la promesse d'un VLA générique qui s'appliquerait tel quel à n'importe quelle plateforme, qu'il s'agisse d'un bras industriel, d'un robot mobile ou d'un humanoïde. Elle rappelle qu'un taux de réussite affiché sur une démonstration ne dit rien du travail d'ingénierie (recalibrage, réentraînement partiel, adaptation d'interface) nécessaire pour porter un modèle d'un embodiment à un autre. Pour une industrie où plusieurs politiques VLA sont présentées comme quasi prêtes à l'emploi, ce cadre offre une grille de lecture plus rigoureuse pour distinguer généralisation en laboratoire et déploiement réel sur une nouvelle chaîne robotique. Ce travail s'inscrit dans la vague de modèles de fondation robotiques apparue dans le sillage des grands modèles de langage, portée par des acteurs comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix, qui revendiquent tous une forme de généralisation entre tâches et parfois entre robots. En pointant l'absence de cadre commun pour mesurer ce qui reste réellement à faire lors d'un transfert d'embodiment, les auteurs comblent un vide méthodologique plutôt qu'ils ne proposent un nouveau modèle concurrent. La suite logique consisterait en une adoption de ce cadre de reporting par la communauté pour comparer les futures publications sur une base homogène, ainsi qu'en des études de cas documentant le coût d'adaptation d'un même modèle sur plusieurs corps robotiques distincts, question que les auteurs identifient explicitement comme ouverte pour de futurs travaux.

RecherchePaper
1 source
N₀-Foundation : vers l'ère de l'intelligence tactile
4arXiv cs.RO 

N₀-Foundation : vers l'ère de l'intelligence tactile

Publiée sur arXiv en août 2026 (arXiv:2608.29601), N0-Foundation est une infrastructure complète pour la manipulation robotique par le toucher: un capteur tactile à base de vision, une interface universelle de manipulation (UMI) tactile, et un système de collecte synchronisée visuo-tactile compatible avec plusieurs types de robots. Elle a permis de constituer NeoData, plus de 30000 heures de démonstrations visuo-tactiles synchronisées couvrant six embodiments robotiques et 450 tâches, soit des milliards de paires d'images RGB et de signaux tactiles, collectées par téléopération réelle et via l'UMI. Un sous-ensemble de 5000 heures, OpenNeoData, est publié en accès libre, aux côtés de NeoForce, un modèle de représentation tactile transférable d'un capteur à un autre, et d'un benchmark combinant la suite réelle NeoReal et la suite simulée NeoSim. Le tactile demeure le maillon faible des modèles de manipulation actuels: la plupart des architectures vision-langage-action (VLA) déployées dans l'industrie s'appuient presque exclusivement sur la caméra et le langage, sans retour de force ou de contact fiable. Ce vide freine des tâches critiques pour l'industrie, comme la manipulation d'objets déformables, l'assemblage de précision, le contrôle fin de la force ou le maintien prolongé d'un contact de surface. Le résultat expérimental le plus notable est que les politiques progressent grâce à l'état de contact physique plutôt qu'à l'apparence propre à chaque capteur, ouvrant la voie à des représentations tactiles transférables d'un matériel à un autre et à une mutualisation des données entre laboratoires. Ce travail s'inscrit dans la course aux modèles fondation pour la manipulation, où des architectures comme GR00T N2, Pi-0 ou Helix, entraînées notamment sur des plateformes telles que Figure 03 ou Optimus Gen 3, restent surtout centrées sur la vision. En publiant simultanément le jeu de données, le modèle de représentation et le protocole d'évaluation, les auteurs cherchent à établir le tactile comme modalité standardisée et comparable, sur le modèle de ce qu'a été ImageNet pour la vision. Il s'agit à ce stade d'une publication de recherche assortie d'un jeu de données ouvert, non d'un produit commercial ni d'un déploiement industriel: aucun pilote ni calendrier d'intégration n'est annoncé. Aucun acteur français ou européen comme Wandercraft, Exotec, Pollen Robotics ou Enchanted Tools n'apparaît dans ces travaux.

RecherchePaper
1 source