Aller au contenu principal
Robots toujours actifs : observer, mémoriser, agir sur des flux incarnés simultanés
IA physiquearXiv cs.RO 

Robots toujours actifs : observer, mémoriser, agir sur des flux incarnés simultanés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié en septembre 2026 sur arXiv (2609.28429) ARMS (Always-on Robot in Multi-modal Streams), une politique de contrôle pour robots bimanuels fonctionnant en continu plutôt que sur une seule instruction figée. Le système s'appuie sur un unique modèle pré-entraîné π0.5, complété par trois modules légers qui transforment la perception en direct, l'état du robot et l'historique de ses actions passées en contexte exploitable, mis à jour de façon asynchrone pour que les deux bras agissent simultanément sans blocage. Entraîné sur un jeu de données auto-étiqueté à partir de téléopération bimanuelle réelle (ARMS Dataset), le modèle atteint 45% de réussite sur la tâche combinée contre 28% pour le meilleur des quatre modèles de référence testés, les ablations confirmant que le module mémoire, l'état incarné et la concurrence asynchrone sont chacun indispensables.

Ce travail cible un angle mort des modèles vision-langage-action actuels, conçus pour une instruction unique sans interruption possible en cours de tâche, alors qu'un robot déployé en usine ou en entrepôt doit gérer des ordres qui changent, une scène qui évolue, et ses propres actions passées. Pour les intégrateurs envisageant des robots bimanuels en fonctionnement continu, l'écart entre 45% et 28% indique que les architectures VLA à instruction figée, convaincantes en démonstration, restent mal adaptées à un usage réel où le robot ne repart jamais de zéro. Le résultat nuance l'idée qu'un backbone VLA pré-entraîné suffirait seul à couvrir tous les cas d'usage, sans mémoire explicite ni traitement asynchrone.

ARMS s'appuie sur la famille π0 développée par Physical Intelligence et se positionne face à d'autres architectures VLA récentes comme GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent elles aussi une autonomie généraliste pour des robots humanoïdes ou bimanuels. Contrairement à ces annonces industrielles, ARMS reste à ce stade une contribution de recherche publiée en preprint, sans déploiement commercial ni partenaire industriel cité, et validée uniquement sur le jeu de données construit par ses propres auteurs. Les suites logiques, non détaillées dans l'article, porteraient sur des tâches plus longues, davantage de bras ou de robots, et une validation au-delà du cadre de téléopération ayant servi à générer les données d'entraînement.

À lire aussi

La transmission directe mise sur les robots à roues-pattes pour franchir le premier obstacle de l'IA incarnée : se lever
1Pandaily 

La transmission directe mise sur les robots à roues-pattes pour franchir le premier obstacle de l'IA incarnée : se lever

Direct Drive, entreprise chinoise basée à Dongguan, développe une famille de robots à roues-pattes conçus pour franchir les obstacles que les robots mobiles classiques ne savent pas gérer. Lancé en 2021, Xingtian est présenté par la société comme le premier robot bipède à roues entièrement à entraînement direct au monde, combinant la vitesse du roulage et la capacité de saut des pattes. En 2023, le modèle TITA a ajouté huit degrés de liberté ainsi que des interfaces modulaires pour accueillir capteurs et calculateurs d'IA embarqués. En 2025, la troisième génération modulaire, baptisée D1, franchit des rebords de 70 centimètres et transporte jusqu'à 100 kilogrammes en mode reptation à quatre roues, tout en se combinant à d'autres modules pour former des configurations multiples. Direct Drive affirme avoir déjà livré plusieurs milliers d'unités dans le monde, déployées dans l'inspection industrielle, la logistique et la gestion de parcs intelligents. Cette approche déplace le débat central de l'IA incarnée : plutôt que de se demander si le "cerveau" d'un robot est assez intelligent, Direct Drive pose que le vrai verrou est l'accès physique à l'environnement. De nombreux robots qui impressionnent en démonstration peinent à passer à l'échelle une fois déployés sur un site réel, et certains clients doivent aménager leur environnement (rampes dédiées, marqueurs de positionnement visuel, couloirs de circulation contraints) pour accueillir la machine, ce qui alourdit le coût unitaire de déploiement et compromet la rentabilité. Les robots purement à roues sont efficaces sur de longues distances mais bloqués par une marche ou un trottoir cassé ; les robots purement à pattes franchissent les obstacles mais consomment beaucoup d'énergie pour maintenir leur équilibre, au détriment de la charge utile et de l'autonomie. En misant sur une architecture hybride, Direct Drive cherche à répondre concrètement à l'écart bien identifié entre démonstration scénique et usage industriel réel, un argument qui parle directement aux intégrateurs et décideurs B2B confrontés à des sols mixtes : bitume, pierre, rampes, ascenseurs, escaliers, terrain boueux. La technologie repose sur le remplacement des réducteurs classiques par des moteurs à entraînement direct, qui font aussi office de moyeux de roue et d'articulations, une architecture censée simplifier la mécanique plutôt que de compenser ses limites par du logiciel. Ce choix structure toute la gamme de l'entreprise depuis Xingtian jusqu'à D1, dans un secteur où d'autres acteurs misent en parallèle sur des humanoïdes bipèdes ou sur des modèles fondation vision-langage-action pour piloter la manipulation. Direct Drive ne communique pas de calendrier précis de nouveaux déploiements pilotes, mais revendique une doctrine claire : les roues restent plus efficaces que les pattes, et les pattes permettent de franchir ce que les roues ne peuvent pas, une combinaison jugée nécessaire avant même d'envisager l'entrée des robots dans les foyers, que l'entreprise voit arriver "en roulant" plutôt "qu'en marchant".

IA physiqueActu
1 source
Vers des agents incarnés à long horizon avec des modèles vision-langage-action (VLA) alignés sur les outils
2arXiv cs.RO 

Vers des agents incarnés à long horizon avec des modèles vision-langage-action (VLA) alignés sur les outils

Des chercheurs ont déposé en mai 2026 sur arXiv un papier proposant "VLAs-as-Tools", une architecture modulaire pour dépasser les limites des modèles vision-langage-action (VLA) sur des tâches robotiques à long horizon. Le principe repose sur une division des rôles : un agent VLM (vision-language model) de haut niveau prend en charge la planification temporelle, l'analyse de scène et la récupération sur erreur, tandis qu'une famille d'outils VLA spécialisés exécutent chacun une sous-tâche physique bornée. Une interface dédiée expose la sélection explicite d'outils et un retour de progression en cours d'exécution, permettant au planificateur de se reconfigurer sur événement plutôt que de surveiller le robot en continu. Pour entraîner ces outils spécialisés à suivre fidèlement les invocations de l'agent, l'équipe propose TAPT (Tool-Aligned Post-Training), qui construit des unités d'entraînement alignées et s'appuie sur des adaptateurs résiduels par famille d'outils. Appliqué au modèle π0.5 de Physical Intelligence, ce pipeline améliore le taux de succès de 4,8 points sur LIBERO-Long et de 23,1 points sur RoboTwin, et augmente la fidélité d'invocation de 15,0 points mesurée par le Non-biased Rate. Ce résultat s'attaque à l'un des goulots d'étranglement les mieux documentés des VLA : leur incapacité à enchaîner des séquences d'actions longues et hétérogènes sans dérive ou blocage. Le gain de 23,1 points sur RoboTwin est particulièrement significatif, ce benchmark simulant des tâches de manipulation complexes proches des conditions industrielles. Là où les approches précédentes soumettaient en boucle le contexte complet au modèle planificateur, VLAs-as-Tools découple strictement planification et exécution, ce qui réduit la latence de replanification et évite la saturation du contexte. Pour un intégrateur ou un COO industriel, cela signifie que des fondations généralistessont en train de franchir le seuil des workflows multi-étapes sans orchestration comportementale ad hoc -- territoire jusqu'ici réservé aux systèmes classiques de type BT ou FSM. Il faut néanmoins souligner que les résultats restent confinés à la simulation : aucune validation sur hardware réel n'est présentée dans le papier. π0.5 est le modèle VLA généraliste de Physical Intelligence (Pi), startup fondée en 2023 par Sergey Levine, Chelsea Finn et d'autres anciens de Google et Berkeley, avec plus de 400 millions de dollars levés. Pi est l'un des rares acteurs à proposer un VLA pré-entraîné sur données réelles à large échelle, en concurrence directe avec GR00T N2 de NVIDIA, les efforts de Google DeepMind, et les approches open-source comme OpenVLA (Stanford). La course se joue désormais sur la généralisation zero-shot et la robustesse hors distribution, deux critères que les benchmarks actuels n'évaluent que partiellement. Les auteurs annoncent la publication du code, ouvrant la voie à l'adaptation de TAPT sur d'autres VLA de base; une validation sur plateforme réelle, annoncée implicitement comme prochaine étape, sera déterminante pour confirmer les gains observés en simulation.

💬 +23 points sur RoboTwin, c'est du solide. Séparer planificateur haut-niveau et exécuteurs VLA spécialisés, l'intuition était là depuis un moment, mais VLAs-as-Tools est le premier à boucler le pipeline complet avec les chiffres qui justifient. Bon, c'est de la simulation pure : aucune manip sur hardware réel dans le papier, et c'est là que les gains ont tendance à fondre.

IA physiqueOpinion
1 source
Show-Harness : un simple agent VLM suffit pour piloter des robots
3arXiv cs.RO 

Show-Harness : un simple agent VLM suffit pour piloter des robots

Une équipe de recherche présente Show-Harness, un cadre logiciel ("embodied harness") permettant à des modèles vision-langage (VLM) généralistes de piloter directement des robots, décrit dans un preprint arXiv publié début septembre 2026 (arXiv:2609.10522). Le système repose sur une interface sémantique compacte : il expose un ensemble d'unités d'action discrètes que le VLM peut manipuler par raisonnement, tandis que des interpréteurs spécifiques à chaque plateforme robotique traduisent ces unités en commandes locales de manière déterministe, le VLM restant responsable des décisions physiques fines. Les auteurs démontrent deux usages : le contrôle "zero-shot" de robots avec des VLM propriétaires de pointe (closed-source), sans entraînement supplémentaire, et l'adaptation de VLM open-source de petite taille via seulement quelques heures de calcul GPU de fine-tuning, pour un déploiement à moindre coût. Le papier introduit aussi GUMI (GUI Manipulation Interface), qui étend le même espace d'action sémantique à la collecte de démonstrations via une interface graphique, permettant à des humains ou à des agents de générer des données d'entraînement pour différents robots sans matériel de téléopération spécialisé. Cette approche s'attaque à deux limites récurrentes des pipelines vision-langage-action (VLA) : le coût du pré-entraînement spécifique à chaque embodiment robotique, et l'écart persistant entre l'intelligence généraliste des modèles fondation et leur capacité réelle à contrôler finement un corps physique. Si la thèse tient, elle suggère qu'un VLM du commerce, y compris propriétaire, pourrait être réorienté vers la robotique sans le fine-tuning coûteux ni les jeux de données spécialisés qu'exigent aujourd'hui la plupart des modèles VLA dédiés. Pour les intégrateurs et décideurs industriels, l'argument est d'abord économique : la collecte de démonstrations par téléopération matérielle est lente et coûteuse à mettre à l'échelle, et GUMI propose de la remplacer par une interface graphique standard. Les auteurs affirment que leurs agents équipés de Show-Harness généralisent mieux, à travers tâches, robots et environnements, que des paradigmes agentiques et VLA représentatifs existants, mais l'abstract ne détaille ni taux de réussite ni tâches précises testées, ce qui invite à attendre la publication complète et une validation indépendante avant de juger l'ampleur réelle du gain. Show-Harness s'inscrit dans une course plus large où plusieurs laboratoires et start-ups cherchent à doter des robots humanoïdes ou industriels d'une couche de décision fondée sur des modèles vision-langage-action, à l'image des travaux menés par des acteurs comme Physical Intelligence, NVIDIA ou Figure sur leurs propres modèles généralistes. La proposition des auteurs se distingue en misant sur la conception d'une interface plutôt que sur l'augmentation de la capacité du modèle ou un pré-entraînement coûteux propre à chaque robot. Le texte, classé comme nouvelle soumission sur arXiv, ne mentionne ni partenaire industriel, ni déploiement en production, ni calendrier de suite : il s'agit pour l'instant d'une contribution de recherche destinée à être évaluée par la communauté, sans acteur français ou européen identifié dans cette publication.

IA physiqueActu
1 source
GIF : génération à base d'agents de compositions d'objets interactifs et fonctionnels pour l'apprentissage des robots
4arXiv cs.RO 

GIF : génération à base d'agents de compositions d'objets interactifs et fonctionnels pour l'apprentissage des robots

Des chercheurs ont publié sur arXiv, sous la référence 2609.05927 (version 2, qui remplace une publication antérieure), un système baptisé GIF, conçu pour générer automatiquement des scènes d'objets fonctionnels et interactifs destinées à l'entraînement et à l'évaluation de modèles de manipulation robotique en simulation. Le pipeline découpe le problème en deux étapes distinctes : un module nommé CoGen reconstruit des maillages 3D séparés par instance avec des poses initiales grossières, en combinant les forces des modèles génératifs 2D et 3D existants, puis un second module, GPRM, affine la pose relative entre les objets sous une double contrainte géométrique et physique. Un vérificateur basé sur un modèle vision-langage (VLM) sélectionne ensuite, parmi les candidats produits, celui qui correspond le mieux à la spécification structurée demandée. Les auteurs ont construit un benchmark couvrant huit classes représentatives de géométries de contact et ont comparé GIF à des générateurs de scènes considérés comme état de l'art. Résultat : le système améliore à la fois la qualité des objets générés et la justesse des relations spatiales entre eux, tout en faisant chuter le taux de collision sous la barre de 1%. Les données produites ont ensuite servi à entraîner des politiques de manipulation, avec une progression des performances observée à mesure que la diversité des scènes augmente, aussi bien en simulation qu'en déploiement réel. Cette contribution vise un maillon précis, et souvent négligé, de la chaîne d'entraînement des modèles de manipulation de type VLA : la génération de scènes. Les méthodes existantes se limitaient surtout à des agencements grossiers d'objets, sans modéliser la façon dont ils s'emboîtent ou interagissent physiquement, ce qui limite leur utilité pour des tâches fines comme ouvrir un couvercle ou insérer une pièce. En automatisant la production de compositions à faible taux de collision, GIF s'attaque directement au goulot d'étranglement des données d'entraînement pour la manipulation robotique, un enjeu central pour les équipes qui cherchent à réduire l'écart entre démonstrations en simulation et comportements robustes en conditions réelles. L'observation d'une montée en performance liée à la diversité des scènes, confirmée à la fois en simulation et sur robot réel, constitue l'élément le plus significatif pour les intégrateurs, car elle appuie l'hypothèse selon laquelle davantage de données synthétiques bien construites profite au transfert vers le monde réel. Ce travail s'inscrit dans la lignée des recherches sur la génération automatique de scènes de simulation pour la robotique, un domaine qui a jusqu'ici privilégié le placement grossier d'objets plutôt que la composition fine de leurs relations fonctionnelles et de contact. Les auteurs positionnent explicitement GIF face aux générateurs de scènes existants sans toutefois nommer d'acteur commercial concurrent, l'article restant à ce stade une contribution de recherche publiée sur arXiv plutôt qu'un produit déployé. La suite annoncée par les auteurs porte sur l'extension de cette génération de données synthétiques à plus grande échelle pour l'entraînement de politiques de manipulation, avec des premiers résultats de transfert vers le monde réel déjà rapportés, mais sans calendrier ni partenaire industriel précisé.

IA physiquePaper
1 source