Aller au contenu principal
RecherchearXiv cs.RO 

ARC : une méthode de raisonnement pour les modèles fondation en robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent ARC, une méthode de raisonnement qui améliore sensiblement les performances « zero-shot » de modèles de fondation robotiques (RFM) existants, sans nouvelles démonstrations robot ni entraînement à grande échelle. Elle repose sur trois éléments. Le premier est une trace de raisonnement ancrée dans la prochaine action du robot, qui explique pourquoi l'action est appropriée et quel effet elle doit produire. Le deuxième est un pipeline d'étiquetage automatique, qui a permis de construire ARC-Trace-DROID à partir du jeu de données DROID existant, sans collecte de données robot supplémentaire. Le troisième est une stratégie d'adaptation propre à chaque architecture. Les auteurs l'appliquent au VLA π0.5 et au WAM (modèle d'action-monde) Cosmos3-Nano-Policy, avec un fine-tuning et une inférence ajustés à chacun. Les modèles adaptés établissent un nouvel état de l'art sur RoboLab-120 et MolmoSpaces, avec jusqu'à 50 points de pourcentage de gain sur RoboLab-Reasoning-50. Sur robots réels, le taux de succès de π0.5 progresse de 82,2 points de pourcentage.

Ces résultats remettent en cause l'idée dominante selon laquelle la performance des RFM ne progresse qu'avec des modèles plus gros, davantage de démonstrations téléopérées et des budgets d'entraînement élevés. Si les chiffres tiennent, le raisonnement devient un levier complémentaire et bon marché pour les équipes qui disposent déjà d'un VLA, car il réutilise des données existantes au lieu d'en collecter de nouvelles. C'est un argument fort pour les intégrateurs et les décideurs B2B, pour qui le coût de la donnée robot reste le principal frein au passage à l'échelle. L'approche touche aussi un point faible des VLA actuels, leur faible généralisation à des tâches nouvelles décrites en langage. Quelques précautions s'imposent. Le gain de 82,2 points sur robots réels est mesuré sur la base de départ de π0.5, et l'article ne détaille pas ici le nombre de tâches, de plateformes ni d'essais. Le terme « sans précédent » vient des auteurs eux-mêmes. Le gain de 50 points concerne un benchmark de raisonnement conçu pour ce type d'évaluation, donc probablement favorable à la méthode. Enfin, on ne sait pas encore ce que la génération de traces ajoute en latence d'inférence, un paramètre décisif pour le contrôle en boucle fermée.

ARC s'inscrit dans la tendance des VLA « avec raisonnement », qui font générer au modèle des étapes intermédiaires (sous-tâches, trajectoires, texte) avant d'agir. Elle prolonge les travaux autour de π0.5 de Physical Intelligence, entraîné sur de larges corpus hétérogènes, et du jeu de données DROID, devenu une base de référence en manipulation. L'usage d'un modèle d'action-monde comme Cosmos3-Nano-Policy, issu de l'écosystème Cosmos de NVIDIA, montre que la méthode vise plusieurs familles d'architectures et pas un seul modèle. Elle se positionne face aux approches qui misent sur l'échelle de données, comme GR00T chez NVIDIA ou Helix chez Figure. Il s'agit d'un travail académique publié sur arXiv (2610.12386v1), accompagné d'un site de projet. Il ne s'agit ni d'un produit ni d'un déploiement industriel. La suite logique serait une réplication indépendante, une évaluation sur d'autres robots et tâches longues, puis une mesure du coût en temps de calcul avant toute intégration dans des piles commerciales.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Déploiement de modèles fondation pour la navigation robotique incarnée
1arXiv cs.RO 

Déploiement de modèles fondation pour la navigation robotique incarnée

Un article publié sur arXiv (2609.25666v1) détaille deux limites concrètes du déploiement de modèles de fondation (FM) sur des agents incarnés chargés de navigation : un biais d'entraînement qui dégrade la personnalisation dans des environnements inédits, et une longueur de contexte insuffisante qui pénalise les tâches à long horizon. Face au premier problème, les auteurs proposent TAP (Transit-Aware Planning), qui amorce le FM avec des données d'habitudes humaines extraites directement de la scène. Pour le second, ils introduisent MemCtrl, doté d'une "tête de mémoire" (memory head) qui gère activement le contexte plutôt que de le laisser s'accumuler passivement. Testé en conditions réelles dans un environnement de laboratoire avec un robot Turtlebot sur une tâche de recherche de cible personnalisée, TAP affiche une amélioration moyenne de 18% par rapport à une base sans cette méthode. MemCtrl, évalué sur plusieurs tâches incarnées, obtient un gain moyen de 6%, qui monte à 20% sur les sous-ensembles d'instructions longues, tout en consommant près de moitié moins de contexte que le modèle de référence. Ces résultats visent deux angles morts souvent minimisés dans les annonces de robots généralistes pilotés par des modèles vision-langage-action (VLA) : la personnalisation réelle une fois le robot sorti de son jeu de données d'entraînement, et le coût en contexte des tâches longues, qui limite la scalabilité en usage réel. Le fait que le gain de TAP soit mesuré sur un robot physique, et non sur des vidéos sélectionnées en simulation, constitue un signal utile pour les intégrateurs, même si l'échelle reste celle d'un laboratoire contrôlé et non d'un déploiement commercial. Diviser par deux le budget de contexte tout en améliorant la précision représente aussi un argument économique concret pour qui doit faire tourner ces modèles en inférence à grande échelle sur du matériel embarqué. Pour les décideurs B2B qui évaluent des piles VLA pour la logistique ou le service, le papier rappelle que le sim-to-real et le passage à l'échelle du contexte restent des problèmes ouverts, non résolus par la seule taille des modèles. Le travail s'inscrit dans un corpus déjà dense de recherches sur la navigation incarnée pilotée par des FM, que les auteurs organisent en une taxonomie pour situer leurs deux contributions par rapport à l'état de l'art. Il s'agit d'une publication de recherche académique, pas d'une annonce produit : elle défend une position argumentée sur la déployabilité réelle des agents incarnés fondés sur des FM et liste des pistes de recherche ouvertes plutôt qu'une feuille de route commerciale. Aucun partenariat industriel, aucun site de déploiement commercial ni aucun calendrier de mise sur le marché n'est mentionné ; les suites annoncées portent sur l'extension des tests à d'autres environnements et tâches à long horizon, pas sur un lancement produit.

RechercheActu
1 source
AssemLM : un modèle de langage multimodal pour le raisonnement spatial en assemblage robotique
2arXiv cs.RO 

AssemLM : un modèle de langage multimodal pour le raisonnement spatial en assemblage robotique

Des chercheurs ont publié AssemLM (arXiv:2604.08983), un modèle multimodal de raisonnement spatial pour la robotique d'assemblage. Le système fusionne trois sources (manuels d'assemblage, nuages de points 3D, instructions textuelles) pour prédire des poses 6D, c'est-à-dire la position et l'orientation complètes d'une pièce dans l'espace tridimensionnel. Un encodeur de nuages de points spécialisé extrait des caractéristiques géométriques et rotationnelles fines, transmises ensuite à un LLM multimodal pour le raisonnement spatial de haut niveau. Les auteurs publient également AssemBench, un benchmark de plus de 900 000 échantillons multimodaux avec annotations de poses 6D précises, étendant l'évaluation classique du grounding 2D à l'inférence géométrique 3D complète. Des tests sur robot réel valident des performances à l'état de l'art sur des tâches d'assemblage multi-étapes en conditions réelles. Le verrou ciblé est central en manipulation fine industrielle: les VLMs courants opèrent sur des images 2D et peinent à raisonner sur la géométrie précise qu'exigent le vissage, l'emboîtement ou l'alignement de composants au sous-millimètre. En intégrant les nuages de points comme modalité native, AssemLM raisonne sur l'orientation exacte d'une pièce, pas seulement sur sa présence dans le champ visuel. Pour un intégrateur ou une équipe R&D en automatisation industrielle, prédire des poses 6D depuis un manuel PDF et une capture 3D ouvre la voie à des cellules d'assemblage reconfigurables sans reprogrammation manuelle entre chaque référence produit. AssemBench, avec ses 900 000 échantillons annotés, comble par ailleurs un manque d'infrastructure de comparaison rigoureuse dans ce sous-domaine. Le raisonnement spatial est un défi persistant pour les modèles de vision-langage, majoritairement entraînés sur des tâches 2D (captioning, grounding d'objets, VQA). Les modèles VLA (Vision-Language-Action) récents, comme pi0 de Physical Intelligence, OpenVLA ou les travaux de Google DeepMind sur RoboVLMs, progressent sur la manipulation généraliste, mais l'assemblage industriel structuré avec ses contraintes de précision sub-millimétrique reste peu adressé par ces approches. AssemLM se positionne dans cette niche en ciblant explicitement les tâches avec documentation formalisée (manuels, nomenclatures). Les auteurs annoncent la mise à disposition publique du code, des modèles et du dataset AssemBench, point d'entrée potentiel pour la communauté académique et les industriels souhaitant affiner le modèle sur leurs propres composants. Aucun partenaire industriel ni déploiement commercial n'est mentionné: il s'agit à ce stade d'une publication de recherche, sans produit ni pilote planifié.

UELa publication en open-source d'AssemBench (900 000 échantillons annotés 6D) constitue une ressource d'entraînement et d'évaluation directement exploitable par les labos européens travaillant sur la manipulation industrielle précise, sans acteur FR/EU impliqué à ce stade.

RechercheOpinion
1 source
3arXiv cs.RO 

Modèles du monde fondation pour la robotique multi-embodiment, fondés sur des actions latentes

Des chercheurs proposent LAC-WM (Latent Action-Conditioned Robot World Model), un modèle du monde robotique qui fonctionne dans un espace d'actions latent unifié, appris et partagé entre embodiments très différents. Il est comparé à une variante de référence, EAC-WM (Explicit Action-Conditioned World Model), conditionnée par des étiquettes de mouvement explicites propres à chaque robot. Les deux modèles sont évalués sur des tâches de manipulation dextre et sur une version modifiée du benchmark LIBERO. Lors de l'adaptation à des robots absents du pré-entraînement, LAC-WM améliore la performance aval jusqu'à 46,7 % sur la manipulation dextre et 11,7 % sur LIBERO. Le travail, publié sur arXiv (2610.10846v1), s'accompagne d'un site de projet (lacwm.github.io). Le résumé ne précise ni les robots testés, ni la taille des modèles, ni les volumes de données de pré-entraînement. Le résultat le plus significatif concerne le passage à l'échelle. La performance de LAC-WM augmente avec le nombre d'embodiments vus au pré-entraînement. À l'inverse, celle d'EAC-WM diminue quand ce nombre croît. Selon les auteurs, des étiquettes d'action explicites produisent des représentations disjointes d'un robot à l'autre, et ajouter des plateformes crée alors de l'interférence plutôt que du transfert. Pour les équipes qui construisent des modèles fondations robotiques, cela remet en cause l'idée qu'agréger davantage de données hétérogènes améliore mécaniquement la généralisation. L'espace d'action serait un goulot d'étranglement central, et pas seulement le volume de données. Pour un intégrateur, l'enjeu est concret : si ce principe se confirme, un modèle du monde pré-entraîné pourrait être adapté à une nouvelle plateforme avec moins de données propriétaires. Les gains annoncés sont toutefois mesurés sur des benchmarks, dont un LIBERO modifié, et non sur des déploiements industriels. Le gain de 11,7 % sur LIBERO est modeste, et l'écart de 46,7 % dépend de la base de comparaison choisie par les auteurs. On parle ici de résultats de recherche, pas d'un produit livré. Ce travail s'inscrit dans la course aux modèles généralistes cross-embodiment, où les approches VLA (vision-langage-action) comme Pi-0 ou GR00T se heurtent à la diversité des espaces d'action, entre bras à 6 ou 7 DOF, mains dextres et humanoïdes. Les modèles du monde, qui prédisent l'évolution de la scène en fonction des actions, sont devenus un axe parallèle pour la planification et l'évaluation des politiques. Les actions latentes, apprises à partir des seules transitions visuelles, offrent une voie pour exploiter de grandes quantités de vidéos sans étiquettes d'action. Le papier est une prépublication v1, sans relecture par les pairs. Il faudra surveiller la publication du code et des poids, des tests sur du matériel réel, ainsi que des comparaisons directes avec d'autres modèles du monde cross-embodiment pour savoir si l'effet de passage à l'échelle se maintient avec des dizaines de plateformes.

RecherchePaper
1 source
Kinematic MeanFlow : une politique de génération d'actions en une seule étape pour les modèles fondation en robotique
4arXiv cs.RO 

Kinematic MeanFlow : une politique de génération d'actions en une seule étape pour les modèles fondation en robotique

Des chercheurs affiliés à Intel Chine proposent Kinematic MeanFlow (K-MF), une politique de génération d'actions en une seule étape pour les modèles de fondation robotiques (RFM), publiée sur arXiv (2610.00864v1). L'objectif est de supprimer la latence d'inférence du flow matching multi-étapes, qui impose plusieurs passes de débruitage dans la tête d'action. Les auteurs constatent d'abord qu'une application directe de MeanFlow, cadre censé permettre la génération en un pas, fait s'effondrer les performances. Ils l'attribuent à deux dynamiques propres au champ de vitesse des RFM : l'« accélération locale » reste stable au début du débruitage puis grimpe brutalement vers la fin, et la dispersion des amplitudes entre échantillons s'élargit à mesure que le débruitage avance. K-MF repose sur une identité cinématique. Il scinde le terme de dérivée temporelle de MeanFlow en deux termes sur des sous-intervalles, séparés par un point intermédiaire. Chaque terme capte la dynamique du début ou de la fin du débruitage, ce qui limite l'amplification des erreurs. Sur GR00T-N1.6, la latence de la tête d'action baisse de 67,5 % à 74,4 % selon les configurations (GPU L40 et Jetson Orin, modes eager et compilé). La latence de bout en bout baisse de 30,3 % à 54,9 %. Le code sera publié sur GitHub (IntelChina-AI/K-MF). L'enjeu est très concret pour les intégrateurs et les équipes embarquées. Les politiques VLA basées sur la diffusion ou le flow matching, comme GR00T ou Pi-0, paient un coût d'inférence multiplié par le nombre d'étapes, ce qui limite la fréquence de contrôle, surtout sur du matériel embarqué de classe Jetson Orin. Le gain de bout en bout reste nettement inférieur au gain sur la tête d'action : le reste du modèle (encodeur visuel, backbone langage) devient alors le goulot d'étranglement. Les auteurs affirment aussi que K-MF fonctionne en entraînement from scratch comme en fine-tuning, et dépasse le flow matching multi-étapes « dans la plupart des cas ». Cette formulation appelle à la prudence. Il s'agit d'une préimpression non relue par des pairs, et le résumé ne donne ni taux de réussite précis, ni liste de tâches, ni validation sur robot physique. Aucun déploiement industriel n'est annoncé. Le travail s'inscrit dans une course à la réduction de la latence des politiques génératives. MeanFlow a émergé comme alternative aux approches par distillation ou par consistance, et la distillation en une étape ou les têtes d'action plus légères restent les principales pistes concurrentes. Le choix de GR00T-N1.6 de NVIDIA comme banc d'essai et des plateformes L40 et Jetson Orin reflète la réalité du déploiement actuel des humanoïdes, où la puissance de calcul embarquée est contrainte. L'implication d'Intel Chine laisse penser que l'optimisation de l'inférence en périphérie est un axe stratégique pour le fabricant. La suite dépendra de la publication du code, qui permettra à la communauté de reproduire les résultats, de les tester sur d'autres architectures VLA et de vérifier si l'accélération se maintient sur des tâches réelles de manipulation fine.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source