Aller au contenu principal

Dossier arXiv cs.RO — page 35

2437 articles · page 35 sur 49

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

Robot Control : un pré-entraînement vidéo-action natif pour un contrôle robotique généralisable
1701arXiv cs.RO IA physiqueActu

Robot Control : un pré-entraînement vidéo-action natif pour un contrôle robotique généralisable

Une équipe de recherche présente, dans un preprint publié sur arXiv (arXiv:2607.08639v1), LingBot-VA 2.0, un modèle fondation vidéo-action conçu spécifiquement pour le contrôle robotique, en succession directe de LingBot-VA. Quatre changements architecturaux structurent cette évolution. D'abord, l'équipe abandonne les VAE classiques axés sur la reconstruction d'image au profit d'un tokenizer visuel-action sémantique, qui aligne les représentations visuelles à la fois sur le sens et sur l'action, ce qui améliore le suivi d'instructions et la précision des gestes lors de l'apprentissage de politiques. Ensuite, le modèle adopte un pré-entraînement causal from scratch plutôt qu'une architecture bidirectionnelle adaptée après coup, pour éviter l'oubli catastrophique observé lors de ce type d'adaptation. Troisième point, un backbone MoE (mixture of experts) épars permet d'augmenter la capacité du modèle sans alourdir l'inférence, condition nécessaire pour du contrôle à haute fréquence. Enfin, un schéma d'inférence asynchrone prédit les futurs états latents en parallèle de l'exécution des actions, en recalant chaque rollout sur la dernière observation via une dynamique prédictive apprise, pour du contrôle en boucle fermée temps réel. Le papier ne précise ni le nombre de degrés de liberté, ni le payload, ni les sites ou volumes de déploiement, ni de calendrier commercial. Cette publication s'inscrit dans la course aux modèles VLA (vision-language-action) pour la robotique généraliste, où l'enjeu central est de dépasser le simple réemploi de générateurs vidéo pensés pour le contenu numérique, souvent inadaptés à la physique du monde réel faute d'ancrage dans l'action. En traitant frontalement l'oubli catastrophique et le coût d'inférence, LingBot-VA 2.0 répond à deux limites fréquemment citées des modèles fondation robotiques actuels: la difficulté à tenir un contrôle réactif et la fragilité des architectures reconverties depuis la génération vidéo pure. LingBot-VA 2.0 vient after LingBot-VA, dans un paysage où rivalisent des modèles comme GR00T N2 (Nvidia), Helix (Figure) ou Pi-0 (Physical Intelligence). Le papier revendique une validation par déploiement réel et une généralisation few-shot sur des tâches de manipulation complexes, mais sans benchmark chiffré ni comparaison directe publiée à ce stade, la portée exacte de ces résultats reste à confirmer par des évaluations indépendantes.

1 source
Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée
1702arXiv cs.RO 

Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée

Un article publié le 9 juillet 2026 sur arXiv (référence 2607.06990) présente un nouveau système multi-agent destiné à fiabiliser la manipulation robotique lorsque plusieurs robots doivent coopérer. Les chercheurs proposent une architecture hiérarchique et bouclée reposant sur trois agents pilotés par un grand modèle de langage (LLM) : un agent de planification qui décompose une instruction globale en sous-tâches réparties entre les robots, un agent de manipulation propre à chaque robot qui exécute les actions en mobilisant dynamiquement des outils adaptés, et un agent de vérification qui observe les résultats physiques réels et renvoie des corrections sémantiques en cas d'échec ou d'écart. Le système a été testé lors d'expériences réelles, sans que l'article ne précise pour l'instant de chiffres exacts (taux de succès, nombre de robots, temps de cycle) au-delà de l'affirmation d'une performance supérieure aux approches existantes, aussi bien sur des tâches limitées à un seul poste de travail que sur des tâches réparties entre plusieurs espaces de travail distincts. L'intérêt de ce travail tient au problème qu'il cible directement : la plupart des approches actuelles combinant LLM et robotique se cantonnent soit à un seul bras manipulateur, où la prise en compte du contact physique est robuste mais sans coordination multi-robot possible, soit à une planification multi-robot de haut niveau qui traite la manipulation comme une brique idéalisée, ignorant les aléas réels d'exécution (glissement, échec de préhension, erreur de perception). En bouclant la boucle perception-action-vérification à l'échelle du système multi-robot, cette architecture s'attaque à un angle mort connu du secteur : la difficulté à faire passer un plan LLM cohérent en langage naturel vers une exécution physique fiable quand plusieurs machines doivent se synchroniser sur des tâches à long horizon. Ce travail s'inscrit dans une tendance de recherche plus large qui cherche à doter les architectures VLA (vision-language-action) et les systèmes agentiques d'un mécanisme de rétroaction correctif, plutôt que de se reposer uniquement sur des plans ouverts non révisables. Il concurrence conceptuellement les approches de planification hiérarchique pure et les méthodes de manipulation mono-robot type Pi-0 ou GR00T N2, en visant explicitement le passage à l'échelle vers des ateliers ou des cellules industrielles à plusieurs robots. L'article, encore un simple dépôt arXiv à ce stade, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial.

RechercheActu
1 source
Modèle vision-langage-action pour la génération compositionnelle de mouvements à partir de démonstrations avec champs neuronaux centrés sur l'objet
1703arXiv cs.RO 

Modèle vision-langage-action pour la génération compositionnelle de mouvements à partir de démonstrations avec champs neuronaux centrés sur l'objet

Des chercheurs publient sur arXiv (identifiant 2607.07129, soumission de type "new", juillet 2026) un framework d'apprentissage par démonstration pour la génération de mouvement robotique compositionnel. La méthode combine des représentations neuronales centrées objet, des neural fields canoniques associés à des déformations conditionnées par une variable latente, pour rendre des scènes en capturant variations de position et de géométrie de façon lisse et interprétable. Pour la génération de mouvement, un mélange d'experts temporel (temporal mixture-of-experts) utilise un mécanisme de gating qui combine dans le temps des primitives de mouvement conditionnées par objet, produisant des trajectoires complètes. En simulation, le modèle accomplit des tâches de manipulation à long horizon avec significativement moins de données d'entraînement que les méthodes de référence basées sur l'image. Des expériences en conditions réelles confirment la robustesse au bruit, une généralisation au niveau catégoriel grâce à des modèles de segmentation pilotés par le langage, et la capacité d'opérer directement sur des représentations de scène en 3D. Cette approche s'attaque à un problème central de l'apprentissage par démonstration en robotique: généraliser au-delà des configurations de scène vues à l'entraînement sans faire exploser les besoins en données. En ancrant le mouvement dans une structure visuelle explicite plutôt que dans des pixels bruts, la méthode promet une efficacité data nettement supérieure, un enjeu critique pour les intégrateurs industriels qui ne disposent pas des volumes de démonstrations que collectent les grands laboratoires spécialisés en modèles vision-langage-action. Si ces résultats se confirment à plus grande échelle, cette compositionnalité spatio-temporelle pourrait réduire le coût de déploiement de bras manipulateurs dans des environnements variés, sans réentraînement complet à chaque nouvelle configuration. Le travail s'inscrit dans la double lignée des "movement primitives", qui structurent le mouvement en briques réutilisables, et des neural fields appliqués à la robotique, qui représentent la géométrie de façon compacte. Il se positionne comme alternative modulaire et interprétable face aux modèles VLA end-to-end à grande échelle, généralement plus gourmands en données mais plus généralistes. L'article, validé en simulation et par des expériences réelles limitées, ne mentionne aucun déploiement industriel ni partenariat commercial: il s'agit à ce stade d'une contribution académique dont la suite logique serait une évaluation sur des plateformes robotiques partagées et des benchmarks standardisés.

IA physiqueActu
1 source
Des fondamentaux à l'application : améliorer les modèles VLA en pratique
1704arXiv cs.RO 

Des fondamentaux à l'application : améliorer les modèles VLA en pratique

Les chercheurs à l'origine du modèle VLA (vision-language-action) LingBot dévoilent LingBot-VLA 2.0, une version améliorée conçue pour réduire l'écart entre les performances en laboratoire et les conditions réelles de déploiement, un problème récurrent des modèles fondation pour la robotique. Trois axes de travail sont mis en avant. D'abord, la généralisation entre tâches et morphologies de robots a été retravaillée via un nouveau pipeline de traitement de données, avec environ 60 000 heures de données de pré-entraînement, dont 50 000 heures de trajectoires robotiques couvrant 20 configurations de robots différentes et 10 000 heures de vidéos égocentriques humaines. Ensuite, l'espace d'action a été étendu au-delà des plateformes à double bras classiques, pour inclure les degrés de liberté (DOF) de la tête, du buste, de la base mobile et des mains dextres. Enfin, le système intègre une modélisation prédictive de la dynamique, en formulant la prédiction du futur comme tâche annexe, appuyée par un modèle de représentation vidéo pour les indices sémantiques et un modèle d'estimation de profondeur pour les indices géométriques. Les évaluations ont été menées sur le benchmark GM-100 en configuration généraliste. Cette annonce illustre une tendance de fond dans la robotique humanoïde et manipulatrice: le passage de bras robotiques figés à des systèmes corps entier, capables de coordonner tête, buste, base mobile et mains, à l'image des approches poursuivies par Pi-0, GR00T N2 ou Helix. L'accent mis sur la généralisation cross-embodiment et sur le raisonnement temporel prédictif répond directement à une critique fréquente des modèles VLA actuels: leur difficulté à transférer des compétences apprises entre différents robots et à anticiper les conséquences physiques de leurs actions dans des tâches longues et complexes de manipulation mobile. Il s'agit ici d'une publication de recherche (arXiv), pas d'un produit commercialisé ni d'un déploiement industriel annoncé. LingBot-VLA 2.0 s'inscrit dans la succession directe de la première version LingBot-VLA, dans un paysage où les laboratoires chinois et américains multiplient les modèles fondation généralistes pour la robotique, sans que les auteurs ne précisent à ce stade de calendrier de mise en production ou de partenariats industriels.

IA physiqueOpinion
1 source
Personnalisation responsable : l'épée à double tranchant de la personnalisation dans l'interaction homme-robot
1705arXiv cs.RO 

Personnalisation responsable : l'épée à double tranchant de la personnalisation dans l'interaction homme-robot

Une équipe de chercheurs en interaction homme-robot (HRI) publie sur arXiv (référence 2607.06344, juillet 2026) un cadre structuré pour analyser les risques éthiques de la personnalisation des robots sociaux. Le constat de départ: la littérature existante sur la "personnalisation responsable" reste fragmentée, avec des études isolées qui décrivent des risques éthiques ponctuels sans vision d'ensemble de la façon dont ils apparaissent selon le contexte d'interaction. Les auteurs proposent un modèle basé sur le cycle de vie de la personnalisation, croisé avec deux axes caractérisant l'interaction: court terme versus long terme, et domaine ouvert versus domaine fermé. Ce croisement permet d'analyser systématiquement cinq familles de risques identifiées: l'érosion de l'autonomie de l'utilisateur, les biais dans la modélisation du profil utilisateur, la manipulation, la déshumanisation et les atteintes à la vie privée. Cette contribution compte parce que la personnalisation devient une capacité centrale des robots sociaux et compagnons, mais qu'elle repose sur un compromis rarement rendu explicite: plus un robot adapte son comportement à un individu, plus il capte de données intimes et plus il peut influencer les décisions de cette personne, parfois à son insu. Les auteurs insistent sur un point spécifique à la robotique: contrairement aux assistants vocaux ou aux recommandeurs logiciels, l'embodiment (présence physique) et la présence sociale d'un robot amplifient ou transforment ces risques, voire en créent de nouveaux, un facteur souvent sous-estimé dans les débats sur l'IA responsable centrés sur les systèmes purement logiciels. Le travail s'inscrit dans un courant de recherche croissant sur l'éthique de l'IA appliquée à la robotique sociale, à mesure que des robots compagnons et d'assistance se déploient dans des contextes domestiques, éducatifs ou de soin où l'interaction est longue et personnelle. Plutôt qu'un simple état des lieux, les chercheurs traduisent leur cadre en recommandations concrètes de conception pour les développeurs de robots et identifient des pistes de recherche ouvertes, notamment sur la manière d'évaluer et de limiter ces risques avant un déploiement à grande échelle.

Societe/EthiqueActu
1 source
Lift3D-VLA : élever les modèles VLA vers une manipulation intégrant géométrie 3D et dynamique
1706arXiv cs.RO 

Lift3D-VLA : élever les modèles VLA vers une manipulation intégrant géométrie 3D et dynamique

Des chercheurs présentent Lift3D-VLA, un nouveau framework de type Vision-Language-Action (VLA) qui intègre un raisonnement 3D explicite pour la manipulation robotique. Construit sur leurs travaux antérieurs Lift3D, le système utilise une stratégie de projection 2D-vers-3D qui aligne géométriquement les nuages de points avec les embeddings positionnels 2D déjà pré-entraînés, ce qui permet d'encoder directement les données de profondeur dans l'encodeur visuel du modèle sans perte d'information spatiale. Les auteurs y ajoutent un module baptisé GC-MAE (Geometry-Centric Masked Autoencoding), qui apprend simultanément à reconstruire le nuage de points courant et à prédire son évolution géométrique future, ainsi qu'un mécanisme de modélisation temporelle des actions réparti sur plusieurs couches du modèle de langage, pour générer des séquences de gestes cohérentes dans le temps. Testé sur 22 tâches simulées et 8 tâches de manipulation réelles, Lift3D-VLA affiche des taux de réussite supérieurs de 10,8 points sur le benchmark MetaWorld et 11,1 points sur RLBench par rapport aux meilleures méthodes VLA existantes, avec un gain de 4 points de pourcentage face à la référence la plus solide en conditions réelles. Ce résultat s'attaque à un angle mort connu des modèles VLA actuels: la plupart raisonnent en 2D et peinent à capturer la géométrie et la dynamique physique des scènes, ce qui limite leur capacité à généraliser hors des conditions d'entraînement, un problème central pour tout déploiement industriel de bras robotiques ou d'humanoïdes. En démontrant une meilleure robustesse face aux perturbations hors distribution, les travaux apportent un argument concret dans le débat sur la viabilité des architectures VLA à grande échelle, plutôt qu'une simple promesse marketing. Le papier s'inscrit dans la lignée directe de Lift3D, projet antérieur des mêmes auteurs sur l'encodage 3D pour la robotique, et vient enrichir un champ de recherche déjà occupé par des modèles VLA généralistes comme GR00T N2, Pi-0 ou Helix. Publié sur arXiv comme prépublication, sans affiliation industrielle ni annonce de déploiement, Lift3D-VLA reste à ce stade une contribution académique dont l'impact réel dépendra de son adoption par les acteurs commerciaux du secteur.

RechercheActu
1 source
Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon
1707arXiv cs.RO 

Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon

Cortex, présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.05377), est un nouveau framework d'agent incarné destiné aux tâches de manipulation robotique à long horizon. Le problème qu'il cible: les modèles Vision-Language-Action (VLA) actuels, de par leur nature markovienne, ne s'appuient que sur l'observation courante et peinent sur les séquences longues, tandis que les approches hiérarchiques à double système existantes souffrent d'un décalage entre la sémantique du planning haut niveau et la cinématique d'exécution bas niveau. Cortex introduit une interface de planification qui traduit les plans du VLM haut niveau en sous-tâches exécutables pour le VLA bas niveau, en standardisant les manipulations en 32 primitives de compétences canoniques. Les chercheurs ont ainsi pu annoter automatiquement plus de 4 000 heures de vidéos open-source et générer 30 heures de données de simulation, avec une stratégie d'échantillonnage équilibré par événements pour affiner l'entraînement sur les transitions ambiguës entre sous-tâches. Sur le plan des résultats, Cortex dépasse les baselines monolithiques de 3,1% sur le benchmark Libero-long et de 4,1% sur RoboTwin, en évaluation à la fois open-loop (VLM) et closed-loop (système complet). Plus notable pour l'industrie: le VLM généraliste de Cortex permet de réaliser en zero-shot des tâches réelles inédites à long horizon, comme des expériences de chimie en plusieurs étapes, simplement en le couplant à un VLA fine-tuné, une capacité que le fine-tuning d'un VLA seul n'atteint pas. Cela suggère qu'une architecture correctement pontée entre planification et exécution peut combler l'écart simulation-réel mieux qu'un unique modèle monolithique, un argument qui intéresse directement les intégrateurs cherchant à généraliser au-delà des tâches d'entraînement. Ce travail s'inscrit dans la lignée des architectures duales explorées par des modèles comme Pi-0, GR00T N2 ou Helix, qui tentent chacun de résoudre la même tension entre raisonnement sémantique et contrôle moteur. Cortex reste à ce stade une contribution de recherche évaluée sur benchmarks académiques et non un système déployé en production, mais son approche par primitives standardisées et annotation automatique à grande échelle pourrait influencer la prochaine génération de frameworks d'agents robotiques génécralistes.

RechercheActu
1 source
Ask-to-Clarify : résoudre l'ambiguïté des instructions par un dialogue multi-tours
1708arXiv cs.RO 

Ask-to-Clarify : résoudre l'ambiguïté des instructions par un dialogue multi-tours

Des chercheurs proposent Ask-to-Clarify, un cadre qui permet à un robot équipé d'un modèle vision-langage-action (VLA) de poser des questions avant d'agir plutôt que d'exécuter aveuglément une consigne ambiguë. Le système marie un planificateur cognitif basé sur un modèle vision-langage, chargé de mener le dialogue de clarification, à un exécuteur moteur fondé sur la diffusion, chargé du contrôle bas niveau. Les deux modules communiquent via un adaptateur d'alignement sémantico-visuel, une interface qui traduit l'intention exprimée en langage naturel en flux de perception visuelle exploitable par le contrôleur. Pour l'entraîner, les auteurs ont dû résoudre un oubli catastrophique observé lors de leurs premiers essais : le réglage fin sur les tâches de manipulation effaçait entièrement la capacité de dialogue du modèle. Leur parade est une stratégie d'entraînement en deux étapes qui isole la logique conversationnelle de l'apprentissage moteur. Le système a été testé sur 11 tâches de manipulation réelles, où il devance nettement les méthodes existantes. L'enjeu dépasse le confort d'usage. La quasi-totalité des VLA actuels, qu'il s'agisse de familles comme Pi-0 ou GR00T N2, fonctionnent selon un paradigme rigide d'écoute puis d'exécution : ils postulent que l'instruction est claire et agissent sans vérifier, ce qui échoue dès qu'un environnement réel présente plusieurs objets similaires ou une consigne sous-spécifiée d'un utilisateur non expert. C'est précisément l'écart entre démonstrations scénarisées et déploiement réel que pointe régulièrement le secteur. En documentant un oubli catastrophique aussi net entre dialogue et contrôle moteur, ce travail met aussi en garde les équipes qui cherchent à empiler perception, raisonnement et action dans un modèle généraliste unique : ce n'est pas gratuit, cela demande des architectures et des entraînements spécifiquement pensés pour éviter que les compétences s'écrasent entre elles. Historiquement, la clarification d'instructions robotiques passait par des planificateurs externes de type LLM (dans la lignée de SayCan) posés au-dessus d'un contrôleur bas niveau séparé, une architecture en deux blocs disjoints. Ask-to-Clarify s'en distingue en intégrant dialogue et contrôle moteur dans un seul système entraîné de bout en bout, sans primitives d'action codées à la main ni planificateur externe. Les auteurs, dont les travaux sont publiés sur arXiv, envisagent d'étendre l'approche à des instructions et environnements plus variés, au-delà de la simple levée d'ambiguïté.

IA physiqueActu
1 source
Worldscape-MoE : un modèle du monde à mélange d'experts unifié pour un contrôle d'action hétérogène et évolutif
1709arXiv cs.RO 

Worldscape-MoE : un modèle du monde à mélange d'experts unifié pour un contrôle d'action hétérogène et évolutif

Une équipe de recherche publie sur arXiv (7 juillet 2026) Worldscape-MoE, un modèle du monde basé sur des Diffusion Transformers combinés à une architecture Mixture-of-Experts (MoE), conçu pour unifier le contrôle d'actions hétérogènes dans les simulateurs génératifs vidéo. Jusqu'ici, les modèles du monde utilisés pour l'IA incarnée traitaient séparément chaque type de commande, trajectoires de caméra, actions robotiques, signaux de jointures de main, avec des interfaces isolées les unes des autres. Worldscape-MoE introduit à la place une injection de contrôle sensible à la modalité, des experts partagés et des experts spécifiques à chaque type de commande, ainsi qu'une stratégie d'entraînement MoE progressive permettant d'ajouter de nouvelles modalités d'action sans tout réentraîner. Les tests couvrent trois domaines, locomotion, manipulation robotique et contrôle égocentrique de la main, avec des résultats évalués sur le benchmark WorldArena. L'apport principal tient dans un résultat contre-intuitif pour le secteur: faire apprendre au même modèle des signaux de contrôle très différents (déplacement d'un robot, geste d'une main, trajectoire de caméra) améliore les performances sur chaque tâche individuelle, plutôt que de les dégrader par interférence. Cela infirme l'hypothèse répandue selon laquelle mélanger les types de supervision dilue la qualité du contrôle. Pour les équipes qui développent des simulateurs destinés à entraîner des politiques robotiques ou des agents VLA (vision-language-action), ce résultat plaide pour des architectures mutualisées plutôt que des modèles du monde spécialisés par tâche, un enjeu direct de coût et de scalabilité pour l'industrie. Le travail s'inscrit dans la montée en puissance des modèles du monde comme infrastructure de base pour l'IA incarnée, à mesure que la fragmentation des interfaces de contrôle devient un frein au passage à l'échelle. Worldscape-MoE se positionne comme une alternative structurelle aux générateurs vidéo contrôlables existants, avec une architecture pensée pour absorber, au fil du temps, nouvelles modalités et nouveaux jeux de données sans repartir de zéro, un axe que les auteurs annoncent vouloir poursuivre avec l'ajout d'experts et de données supplémentaires.

IA physiqueActu
1 source
ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde
1710arXiv cs.RO 

ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde

ACID (Action Consistency via Inverse Dynamics), présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.02403v1), s'attaque à un défaut connu de la planification par modèles du monde conditionnés par l'action, une méthode largement utilisée en contrôle robotique. Le problème identifié par les auteurs : le coût de planification standard ne juge une trajectoire candidate qu'à l'aune de la proximité entre l'état terminal prédit et l'objectif, sans vérifier si les transitions intermédiaires sont réalisables. Résultat, une trajectoire peut sembler cohérente sur le papier tout en divergeant fortement une fois exécutée dans l'environnement réel. ACID introduit un principe de "cohérence d'action cyclique" : à chaque étape, un modèle de dynamique inverse tente de retrouver, à partir de la transition prédite, l'action qui l'a produite ; l'écart entre cette action reconstruite et l'action réelle est intégré au coût de planification via une pondération adaptative invariante à l'échelle. Les auteurs valident la méthode sur quatre modèles du monde différents et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle de systèmes articulés et la navigation visuelle, avec un gain systématique en qualité de planification. L'apport principal n'est pas seulement la précision, mais l'efficacité : ACID atteint une exactitude comparable aux méthodes de référence tout en réduisant substantiellement le budget de calcul nécessaire à la planification. C'est un point sensible pour l'embarqué robotique, où le temps de cycle et la puissance de calcul disponible contraignent directement le déploiement temps réel. Le papier touche aussi à un débat plus large dans le secteur : la fiabilité des modèles du monde utilisés pour anticiper les conséquences d'une action avant de l'exécuter, un maillon critique face aux erreurs qui s'accumulent le long d'une trajectoire prédite. Cette approche s'inscrit dans la lignée des travaux sur la planification par modèle prédictif (MPC) couplée à des dynamiques apprises, une alternative aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui n'exposent pas de mécanisme de vérification explicite des trajectoires intermédiaires. Publié en preprint, ACID n'a pas encore fait l'objet d'une revue par les pairs ni d'une validation sur robot physique au-delà des bancs de test utilisés dans l'étude ; la suite logique serait une évaluation en conditions réelles et une comparaison directe avec les méthodes de planification par diffusion, autre piste active du domaine.

RecherchePaper
1 source
Accessibilité de Hamilton-Jacobi contrainte par variété pour planification de mouvement multi-agents décentralisée
1711arXiv cs.RO 

Accessibilité de Hamilton-Jacobi contrainte par variété pour planification de mouvement multi-agents décentralisée

Des chercheurs en robotique publient une nouvelle version (v2) d'un article arXiv intitulé "Manifold-constrained Hamilton-Jacobi Reachability Learning for Decentralized Multi-Agent Motion Planning" (arXiv:2511.03591), qui propose une méthode pour planifier les mouvements de plusieurs robots de façon sûre et décentralisée tout en respectant des contraintes géométriques imposées par la tâche elle-même. L'exemple donné par les auteurs est celui d'un robot de service qui doit porter une tasse bien droite, sans la renverser, tout en évitant des collisions avec des humains ou d'autres robots présents dans la même zone. Pour résoudre ce problème, l'équipe combine l'apprentissage par accessibilité de Hamilton-Jacobi, une technique mathématique servant à calculer les zones qu'un système peut atteindre en toute sécurité, avec des contraintes dites de variété (manifold), qui formalisent les gestes ou postures que la tâche impose. Ce calcul de sécurité contrainte est ensuite intégré dans un planificateur de trajectoires décentralisé, c'est-à-dire que chaque robot planifie ses propres mouvements sans connaître à l'avance la stratégie des autres agents. Pour l'industrie robotique, l'enjeu dépasse la simple prouesse académique: la plupart des planificateurs multi-agents actuels garantissent soit la sécurité, soit le respect d'une contrainte de tâche, rarement les deux simultanément à haute vitesse et en environnement dynamique. Une méthode capable de tenir les deux à la fois, tout en restant assez rapide pour un usage temps réel, intéresse directement les concepteurs de flottes de robots mobiles autonomes (AMR) en entrepôt, les fabricants de robots de service et les équipes qui développent des bras manipulateurs coopératifs, où un geste manqué ou une collision a un coût opérationnel direct. L'article s'inscrit dans la lignée des travaux récents sur la planification de mouvement multi-agents décentralisée pour systèmes à haute dimension, un domaine qui peine historiquement à intégrer des contraintes de tâche complexes sans hypothèses fortes sur le comportement des autres agents. Les auteurs affirment que leur approche généralise à des tâches variées et passe à l'échelle sur des problèmes de manipulation multi-agents en haute dimension, en dépassant les planificateurs contraints existants sur des bancs d'essai internes, une performance à nuancer puisqu'elle repose sur des comparaisons choisies par l'équipe elle-même. Une démonstration vidéo accompagne la publication.

RecherchePaper
1 source
Modèle vision-langage-action cinématique centré sur les actionneurs pour robots miniers souterrains (MineRobot)
1712arXiv cs.RO 

Modèle vision-langage-action cinématique centré sur les actionneurs pour robots miniers souterrains (MineRobot)

Des chercheurs présentent MineRobot, un framework de modélisation cinématique centré sur les actionneurs pour les robots miniers souterrains, dans un article publié en version révisée sur arXiv sous la référence 2603.22055. Contrairement aux bras industriels classiques à chaîne ouverte, les engins miniers représentatifs reposent souvent sur des chaînes cinématiques fermées entraînées par vérins linéaires, avec des liaisons planes en quadrilatère articulé (four bar linkage), ce qui complique la modélisation réutilisable et la résolution en temps réel de la cinématique directe (FK) et inverse (IK). Le framework introduit le MRDF (Mining Robot Description Format), une représentation dédiée qui paramètre nativement les actionneurs et les fermetures de boucle. Il contracte ensuite les sous structures en quadrilatère articulé en articulations généralisées, puis extrait pour chaque actionneur un chemin topologiquement équivalent indépendant (ITEP), classé en quatre types canoniques. Ces types alimentent des solveurs dédiés assemblés en pipeline séquentiel pour la FK, tandis que l'IK est formulée comme un problème d'optimisation sous contraintes de longueur d'actionneur, résolu par un schéma itératif de type Gauss Seidel. Les expériences menées sur des robots miniers souterrains représentatifs montrent des performances FK en temps réel et une convergence robuste de l'IK sur les plages de fonctionnement testées. L'enjeu dépasse le simple confort de calcul. Dans les mines souterraines, tester physiquement un engin (chargeuse, foreuse, bras de forage) est coûteux et dangereux, d'où le recours croissant à la planification de trajectoires, à l'entraînement des opérateurs et aux jumeaux numériques pour valider les mouvements avant tout déploiement réel. Or la plupart des outils de cinématique existants ciblent des manipulateurs à chaîne ouverte et gèrent mal les mécanismes fermés et sous-actionnés typiques du matériel minier, ce qui oblige souvent les équipes à écrire un solveur spécifique par machine. En automatisant cette dérivation via une décomposition topologique générique, MineRobot vise à réduire ce travail manuel répétitif et à accélérer l'intégration de nouveaux engins dans les chaînes de simulation, un argument qui parlera autant aux intégrateurs et fournisseurs d'équipements miniers qu'aux équipes de R&D en robotique industrielle. Le papier s'inscrit dans un courant de recherche plus large sur la cinématique des mécanismes fermés, un domaine longtemps traité au cas par cas faute de formalisme réutilisable pour les chaînes à boucles multiples. La classification en quatre types d'ITEP et le solveur Gauss Seidel pour l'IK rappellent des approches modulaires déjà explorées pour les robots parallèles et les mécanismes hybrides, mais appliquées ici spécifiquement au vocabulaire métier minier. À ce stade, il s'agit d'un résultat académique validé en simulation sur des robots représentatifs, et non d'un produit déployé chez un opérateur minier. La suite logique serait une intégration dans des suites de planification ou des jumeaux numériques commerciaux, suivie d'une validation sur du matériel réel en conditions souterraines.

RecherchePaper
1 source
Modélisation structurelle-hydrodynamique unifiée des mécanismes sous-actionnés sous-marins et des robots souples
1713arXiv cs.RO 

Modélisation structurelle-hydrodynamique unifiée des mécanismes sous-actionnés sous-marins et des robots souples

Sous-marins et souples, des robots sans actionneurs excédentaires posent un problème classique en robotique : comment modéliser précisément un système dont on ne connaît ni les paramètres structurels (raideur, amortissement) ni les forces hydrodynamiques qui s'exercent dessus. Une équipe de recherche propose une réponse dans un article mis à jour sur arXiv (2603.07939v2) : un cadre d'optimisation globale piloté par trajectoire, inspiré de la stratégie d'évolution CMA-ES (Covariance Matrix Adaptation Evolution Strategy), capable d'identifier simultanément les paramètres élastiques, d'amortissement et hydrodynamiques distribués d'un système multi-corps sous-marin. La méthode fonctionne en comparant, trajectoire par trajectoire, un mouvement simulé à un mouvement observé expérimentalement, et ne nécessite qu'un simple enregistrement vidéo pour calibrer le modèle. Sur un mécanisme sous-actionné articulé testé en configuration active-passive et passive pure, l'erreur de position normalisée de l'effecteur reste sous les 5 % quelles que soient la trajectoire et les conditions initiales. La méthode a ensuite été validée sur un bras souple asymétrique inspiré de la pieuvre, puis sur un système complet de huit bras assemblés en un robot pieuvre nageur, où le même jeu de paramètres reproduit un comportement corporel réaliste sans recalibrage supplémentaire. L'enjeu dépasse la simple prouesse académique : les mécanismes sous-actionnés et les robots souples sont privilégiés en environnement sous-marin car réduire le nombre d'actionneurs limite les risques de fuite au niveau des moteurs, tout en offrant une compliance mécanique utile pour manipuler des objets fragiles ou s'adapter aux courants. Le principal frein à leur adoption reste la difficulté de modéliser des systèmes à la fois élastiques et soumis à une hydrodynamique complexe, ce qui limite le contrôle précis et le transfert simulation-vers-réel. Un cadre unifié qui identifie structure et hydrodynamique conjointement, et qui se généralise d'un bras isolé à un assemblage complet sans retuning, réduirait significativement le travail d'ingénierie nécessaire avant tout déploiement en exploration océanique ou manipulation sous-marine. Ce travail s'inscrit dans une lignée de recherches sur l'identification de paramètres pour robots souples et sous-actionnés, où les approches précédentes traitaient généralement séparément la caractérisation structurelle et l'estimation hydrodynamique, ou nécessitaient des bancs d'essai instrumentés lourds. En s'appuyant sur une simple vidéo et une optimisation de type CMA-ES, les auteurs visent une méthode moins coûteuse à mettre en œuvre. Les prochaines étapes annoncées concernent l'extension à des géométries plus complexes et des essais en conditions océaniques réelles, au-delà des validations en bassin présentées ici.

RecherchePaper
1 source
StemVLA : un modèle vision-langage-action open source avec connaissance géométrique 3D future et représentation historique 4D
1714arXiv cs.RO 

StemVLA : un modèle vision-langage-action open source avec connaissance géométrique 3D future et représentation historique 4D

StemVLA est un nouveau modèle vision-langage-action (VLA) open source destiné à la manipulation robotique, présenté dans un article arXiv (2602.23721v2, version révisée). Contrairement à la plupart des VLA existants, qui mappent directement des images 2D vers des séquences d'actions sans modéliser la structure spatiale sous-jacente, StemVLA intègre explicitement deux briques supplémentaires : une anticipation de la géométrie 3D future de la scène (pour prévoir la configuration des objets à venir) et une représentation spatiotemporelle 4D construite à partir de l'historique des images, extraite via un transformeur vidéo-géométrie pré-entraîné et agrégée dans le temps par un module d'attention temporelle baptisé VideoFormer. Sur la suite de benchmarks de simulation LIBERO, le modèle atteint une précision moyenne de 92,0 %, et 86,0 % sur le sous-ensemble LIBERO-Long, dédié aux tâches à horizon long. L'enjeu dépasse la simple performance chiffrée : les VLA actuels peinent souvent sur le raisonnement spatial fin et la planification à long terme, précisément parce qu'ils ignorent la géométrie 3D et la dynamique temporelle de la scène. En forçant le modèle à prédire explicitement l'évolution future de l'espace 3D plutôt qu'à réagir à des images plates, StemVLA cherche à combler un des angles morts identifiés dans la littérature récente sur les modèles fondation pour la robotique, celui de la cohérence temporelle et de la généralisation dans des environnements dynamiques. Les gains observés sur LIBERO-Long, sous-ensemble réputé plus exigeant, suggèrent que l'ajout de connaissances géométriques structurées améliore la robustesse sur des tâches multi-étapes, un point sensible pour les intégrateurs qui cherchent à dépasser les démonstrations de laboratoire. Ce travail s'inscrit dans une vague de recherche VLA qui, après les architectures pionnières fondées sur des mappings image-action directs, cherche à enrichir la représentation du monde interne des modèles, en écho aux approches combinant perception géométrique et politiques d'action explorées par d'autres laboratoires du secteur. Les résultats restent pour l'instant limités à la simulation LIBERO ; l'étape suivante attendue par la communauté sera la validation sur robots physiques réels, où l'écart entre performance simulée et transfert sim-to-real demeure le principal obstacle à la généralisation des VLA.

RechercheOpinion
1 source
Motion planning dans des espaces de représentation compressée
1715arXiv cs.RO 

Motion planning dans des espaces de représentation compressée

Ce n'est pas de la démonstration produit ni de déploiement industriel, mais un article de recherche qui touche directement au coeur du "VLA qui marche à l'échelle" : je rédige l'article en respectant le format demandé. Des chercheurs proposent une nouvelle méthode de planification de mouvement combinant apprentissage profond et recherche algorithmique classique, dans un article publié sur arXiv le 30 juin 2026 (arXiv:2606.30940). Le principe repose sur un autoencodeur entraîné à fort taux de compression, dont l'espace latent est organisé en tokens discrets hiérarchisés, du grossier au fin. Plutôt que de générer des trajectoires directement, le système effectue une recherche dans cet espace latent compressé pour construire des plans de mouvement, en optimisant des fonctions objectif définies au moment du test, sans entraînement spécifique à la tâche. La méthode a été évaluée sur deux jeux de données de référence en conduite autonome, nuPlan et le Waymo Open Motion Dataset, sur des tâches de planification de mouvement en boucle fermée et de synthèse de scénarios multi-agents guidés. L'enjeu pour l'industrie robotique et la conduite autonome est de taille : les approches par apprentissage profond capturent bien la complexité des comportements réels mais restent rigides une fois entraînées sur un objectif fixe, tandis que les méthodes de recherche et d'optimisation classiques offrent flexibilité et contrôle explicite au prix d'un manque de réalisme. En permettant de rechercher directement dans un espace latent compressé et hiérarchisé, les auteurs affirment obtenir le meilleur des deux mondes, un espace de solutions réduit et structuré qui garde le réalisme générique de l'autoencodeur, tout en acceptant n'importe quel objectif spécifié à la volée. Si les résultats se confirment à plus grande échelle, cela ouvrirait la voie à des planificateurs capables de s'adapter à de nouvelles contraintes (sécurité, confort, interaction multi-agents) sans réentraînement coûteux, un point critique pour les intégrateurs qui doivent déployer des systèmes de navigation sur des flottes hétérogènes de véhicules ou de robots mobiles. Ce travail s'inscrit dans une lignée de recherches cherchant à réconcilier planification model-based et modèles génératifs appris, un débat qui traverse aussi bien la conduite autonome que la robotique manipulatrice, où des architectures VLA comme Pi-0 ou GR00T N2 tentent une intégration différente entre perception, langage et action. La méthode se distingue en misant sur la compression et la structure discrète hiérarchique de l'espace latent plutôt que sur des politiques bout-en-bout continues. Les auteurs ne mentionnent pas de partenariat industriel ni de déploiement au-delà des benchmarks nuPlan et Waymo ; l'article reste donc à ce stade une contribution de recherche, sans calendrier de transfert vers un produit commercial ou un pilote terrain.

RecherchePaper
1 source
3D HAMSTER : relier planification et contrôle dans les modèles VLA hiérarchiques grâce au guidage par trajectoire 3D
1716arXiv cs.RO 

3D HAMSTER : relier planification et contrôle dans les modèles VLA hiérarchiques grâce au guidage par trajectoire 3D

Papier académique en robotique (VLA hiérarchique), pas de named companies commerciales ni d'acteur FR/EU à mettre en avant ici. Je rédige directement l'article. Des chercheurs du laboratoire DAVIAN Robotics présentent 3D HAMSTER, un nouveau framework pour les modèles Vision-Langage-Action (VLA) hiérarchiques utilisés en manipulation robotique, détaillé dans un preprint arXiv (2606.31329v1). Ces architectures séparent la planification de haut niveau, confiée à un modèle vision-langage (VLM), du contrôle bas niveau exécuté par une politique dédiée. Les approches récentes font produire au VLM des trajectoires 2D de l'effecteur terminal pour guider cette politique, mais les politiques de pointe travaillent en réalité dans un espace métrique 3D à partir de nuages de points. Faute de profondeur, chaque point de la trajectoire 2D doit hériter de la profondeur de la surface visible sous lui dans la scène, ce qui déforme géométriquement le chemin prédit. 3D HAMSTER corrige ce défaut en dotant le VLM d'un encodeur de profondeur dédié et d'un objectif de reconstruction dense de la profondeur, afin qu'il prédise directement des séquences de points de passage en 3D, ensuite injectées dans une politique bas niveau opérant sur nuages de points. Cette correction cible un goulot d'étranglement précis de la génération actuelle de VLA hiérarchiques: la conversion 2D vers 3D introduisait un bruit géométrique qui limitait la fiabilité des gestes de manipulation, en particulier lors de changements d'apparence de la scène ou de conditions inédites (langage, position spatiale, visuel). Sur les trois bancs d'essai testés (prédiction de trajectoire 3D, simulation, manipulation réelle), 3D HAMSTER dépasse à la fois des VLM propriétaires état de l'art et les méthodes concurrentes guidées en 2D, avec les écarts les plus marqués justement sur ces conditions de généralisation difficile. Ce résultat va dans le sens d'une hypothèse clé du secteur: une bonne partie de l'écart entre démonstrations en laboratoire et déploiement réel des robots manipulateurs tient moins à la politique de contrôle elle-même qu'à la qualité du signal de planification qui la guide. Le travail s'inscrit dans la lignée des architectures VLA hiérarchiques qui ont émergé ces deux dernières années pour améliorer la généralisation des robots manipulateurs, en s'appuyant sur des politiques bas niveau désormais matures en perception 3D par nuages de points. En comparant directement sa méthode à des VLM propriétaires non nommés publiquement dans le résumé, l'équipe positionne 3D HAMSTER comme une alternative open, avec une page projet dédiée (davian-robotics.github.io/3D_HAMSTER) où code et données devraient être publiés pour permettre une reproduction indépendante des résultats.

RechercheActu
1 source
UniTac : modèle multimodal unifié pour la compréhension et la génération tactiles multi-capteurs
1717arXiv cs.RO 

UniTac : modèle multimodal unifié pour la compréhension et la génération tactiles multi-capteurs

Une équipe de recherche présente UniTac, décrit comme le premier modèle multimodal unifié (UMM) conçu spécifiquement pour la compréhension et la génération de données tactiles, dans un article publié sur arXiv (2606.31451v1). Le système modélise le processus tactile comme une transition entre l'absence de contact et le contact, via une représentation à deux niveaux qui encode à la fois les attributs du capteur utilisé et ceux de l'objet touché. Pour la compréhension, UniTac introduit deux tâches inédites : la description des propriétés physiques d'un objet et l'identification du capteur à l'origine du signal. Pour la génération, les auteurs proposent un entraînement en deux étapes, reconstruction puis alignement, complété par une stratégie d'échantillonnage basée sur les caractéristiques propres à chaque capteur afin de simuler des contacts réalistes. Entraîné sur des jeux de données tactiles multi-capteurs à grande échelle, le modèle revendique des performances état de l'art en compréhension tactile et une capacité à générer des signaux tactiles crédibles quel que soit le capteur d'origine. L'enjeu principal touche à la fragmentation du capteur tactile en robotique : les technologies existantes (capteurs optiques type GelSight ou DIGIT, capteurs magnétiques comme ReSkin, etc.) produisent des signaux de formats incompatibles, ce qui oblige généralement à ré-entraîner un modèle par type de capteur. Un modèle unifié capable à la fois d'interpréter et de générer du signal tactile à travers différents capteurs ouvrirait la voie à un transfert d'apprentissage sans recollecte massive de données, et à une augmentation synthétique des jeux de données tactiles pour l'entraînement de politiques de manipulation. C'est un pas potentiel vers l'intégration du toucher dans les modèles vision-langage-action (VLA) qui structurent aujourd'hui la robotique humanoïde, où la perception reste très majoritairement centrée sur la vision. Ce travail s'inscrit dans la continuité des modèles multimodaux unifiés développés pour l'image et le texte, ici transposés au domaine tactile encore largement sous-exploré selon les auteurs. Il ne s'agit à ce stade que d'une publication de recherche, sans capteur commercial ni intégration robotique annoncée : l'article ne précise ni partenariat industriel, ni calendrier de déploiement, ce qui en fait une contribution méthodologique plutôt qu'un produit prêt à l'emploi.

RecherchePaper
1 source
Apprentissage de la préhension dextérique à partir d'une taxonomie clairsemée
1718arXiv cs.RO 

Apprentissage de la préhension dextérique à partir d'une taxonomie clairsemée

Une équipe de recherche a présenté GRIT, un système de manipulation dextre en deux étapes conçu pour piloter des mains robotiques multi-doigts sans exiger de plan de préhension dense pour chaque objet et chaque tâche. Concrètement, GRIT prédit d'abord une spécification de prise à partir d'une taxonomie de préhension (un ensemble limité de catégories de prises, comme on en trouve en robotique manipulatoire depuis des taxonomies classiques à une vingtaine d'entrées), en s'appuyant sur la scène observée et le contexte de la tâche. Une politique de contrôle continue génère ensuite les mouvements des doigts nécessaires pour exécuter la tâche tout en respectant la structure de prise choisie. Selon les auteurs, cette approche atteint un taux de réussite global de 87,9 % et généralise mieux à des objets jamais vus que les méthodes de référence, avec des expérimentations validées en conditions réelles (real-world experiments) et non uniquement en simulation. Le papier, republié sur arXiv en tant que version corrigée (v2), ne précise pas la plateforme matérielle exacte ni le nombre de degrés de liberté de la main utilisée dans le résumé disponible. L'intérêt de ce travail dépasse la simple métrique de succès : il s'attaque à un vrai dilemme d'ingénierie pour les intégrateurs de mains robotiques dextres. D'un côté, spécifier des cibles de contact ou de pose détaillées pour chaque objet est impraticable à l'échelle industrielle. De l'autre, l'apprentissage par renforcement de bout en bout, guidé uniquement par une récompense de tâche, produit des comportements peu contrôlables, difficiles à corriger quand un échec survient sur une chaîne de production ou en logistique. En montrant qu'une guidance taxonomique éparse suffit à préserver à la fois généralisation et contrôlabilité, GRIT offre une piste concrète pour des systèmes où un opérateur pourrait ajuster la stratégie de prise via une sélection de haut niveau, plutôt que de reprogrammer une trajectoire complète. Cette recherche s'inscrit dans un courant plus large de travaux sur la manipulation dextre qui cherchent un compromis entre commande explicite et apprentissage bout-en-bout, un axe également exploré par des laboratoires travaillant sur les architectures VLA (vision-language-action) pour la robotique généraliste. Le texte ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial : il s'agit à ce stade d'un résultat académique, dont la prochaine étape logique serait un portage sur des plateformes de préhension dextre plus largement utilisées en laboratoire ou en intégration industrielle.

RecherchePaper
1 source
Limites de stabilité et performance motrice dans les interactions dyadiques médiées par robot avec délai
1719arXiv cs.RO 

Limites de stabilité et performance motrice dans les interactions dyadiques médiées par robot avec délai

Une équipe de chercheurs publie sur arXiv (référence 2510.14511, troisième révision) un cadre analytique permettant de déterminer avec précision les frontières de stabilité dans les systèmes d'interaction haptique à distance entre deux opérateurs humains médiatisés par un robot. La méthode repose sur une approche de passage par zéro dans le domaine fréquentiel, qui contourne les approximations conservatives habituellement employées dans la littérature pour extraire des limites de stabilité explicites, directement liées aux dynamiques matérielles du robot et à la raideur de couplage entre les interfaces. Les auteurs étendent ensuite l'analyse d'un couplage élastique simple vers une topologie de proxy virtuel asymétrique et complexe, démontrant la généralité du framework. Le résultat théorique central est que la raideur d'interaction contraint de manière non linéaire la marge de stabilité du système: augmenter la rigidité du couplage accroît la sensibilité aux délais réseau, ce qui est contre-intuitif pour des concepteurs habitués aux systèmes mécaniques passifs. Ce résultat est validé expérimentalement par des essais montrant une corrélation directe entre les marges de stabilité analytiques et les performances motrices empiriques mesurées lors d'interactions dyadiques avec délai. Pour les intégrateurs de solutions haptiques téléopérées -- rééducation neuromotrice, chirurgie à distance, collaboration industrielle distribuée -- ce travail fournit des règles de conception rigoureuses et pose les conditions préalables à l'élaboration de stratégies effectives de compensation du délai. Ce papier s'inscrit dans un champ de recherche actif sur la téléhaptique et le contrôle bilatéral à distance, où les approches classiques comme les variables d'onde (wave variables) ou les modèles passifs souffrent souvent d'un conservatisme excessif qui pénalise les performances. Le problème du délai réseau est critique au-delà d'environ 100 ms de latence aller-retour, seuil au-delà duquel les systèmes haptiques conventionnels basculent vers l'instabilité. Cette contribution, sous forme de preprint en troisième itération, n'est pas encore un produit déployé mais un outil théorique destiné aux chercheurs et concepteurs de systèmes d'interaction haptique distante, avec une application potentielle directe en robotique médicale et dans les environnements collaboratifs industriels géographiquement distribués.

RecherchePaper
1 source
X-Morph : des priors de mouvement humain pour l'apprentissage robotique évolutif multi-morphologies
1720arXiv cs.RO 

X-Morph : des priors de mouvement humain pour l'apprentissage robotique évolutif multi-morphologies

Une équipe de chercheurs a publié fin juin 2026 sur arXiv (arXiv:2606.30290v1) X-Morph, un pipeline qui convertit des données de mouvement humain en politiques de locomotion et de loco-manipulation déployables sur des robots à pattes non-humanoïdes. L'approche cible trois morphologies distinctes : un quadrupède, un hexapode, et un quadrupède équipé d'un bras manipulateur. Le pipeline fonctionne en trois étapes : un module de re-ciblage cross-morphologique transforme des séquences de mouvement humain en références cinématiquement cohérentes avec la structure mécanique du robot cible ; ces références sont ensuite suivies par une politique d'apprentissage par renforcement (RL) dite "privileged" qui accède à des informations d'état complètes, puis distillées en une politique étudiante causale utilisable en inférence temps-réel. Les politiques obtenues généralisent à des mouvements humains non vus à l'entraînement et ouvrent trois applications concrètes : téleopération par vidéo, contrôle par prior comportemental, et génération de mouvement conditionnée par texte. La valeur technique de X-Morph tient à ce qu'il propose une réponse directe au problème central de la robotique non-humanoïde : la rareté des données de mouvement robot-spécifiques. Les systèmes humanoïdes comme Figure 02, Optimus Gen 2 ou Atlas bénéficient d'immenses corpus de capture de mouvement humain (AMASS, CMU MoCap, entre autres), mais les quadrupèdes de type Spot, ANYmal ou Unitree Go2 n'ont pas d'équivalent structurel. X-Morph pose l'hypothèse qu'un re-ciblage morphologique rigoureux peut combler cet écart sans collecter de nouvelles données robot. La mécanique RL "privileged" puis distillée est bien établie dans la littérature, notamment chez ETH Zurich et ANYbotics, mais son application à la réutilisation cross-morphologique de données humaines reste peu explorée à cette échelle. La capacité à conditionner les politiques par texte représente par ailleurs une interface opérateur plus accessible pour les intégrateurs industriels. Ce preprint s'inscrit dans une dynamique de recherche qui a accéléré depuis 2023, portée par des laboratoires exploitant les données humaines pour bootstrapper des comportements robotiques généraux : Pi-0 chez Physical Intelligence (Berkeley), GR00T N2 chez NVIDIA, ou Helix chez Figure AI. X-Morph se distingue en ciblant explicitement les morphologies non-humanoïdes, là où la majorité de la recherche reste concentrée sur les bipèdes. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné, ce qui en fait pour l'instant une contribution académique à suivre plutôt qu'un produit disponible. La question ouverte demeure celle du sim-to-real gap sur les morphologies hexapodes, que le papier ne quantifie pas en conditions réelles.

IA physiqueOpinion
1 source
Passage de messages amélioré par flots normalisants pour la localisation collaborative multi-robots
1721arXiv cs.RO 

Passage de messages amélioré par flots normalisants pour la localisation collaborative multi-robots

Des chercheurs proposent dans un preprint arXiv (identifiant 2606.29868, juin 2026) un algorithme de passage de messages pour la localisation collaborative distribuée de flottes multi-robots, en unifiant la propagation de croyances gaussiennes (GBP) et l'approximation champ moyen (MF). GBP préserve les dépendances entre les états des robots, tandis que MF estime dynamiquement les statistiques de bruit. Pour traiter les termes non conjugués issus de modèles de mesure non linéaires, l'algorithme intègre un estimateur de gradient basé sur des flux normalisants (NF), des modèles génératifs qui rendent l'échantillonnage paramétrique et entraînable de bout en bout, les paramètres du NF étant ajustés selon le comportement du passage de messages lors d'un entraînement global. La méthode est étendue aux espaces d'états sur groupes de Lie pour représenter correctement les rotations 3D, puis validée sur des véhicules de surface autonomes (ASV) en fusionnant odométrie, mesures GNSS et télémétrie inter-robots ultra-wideband (UWB). La nature distribuée de l'algorithme élimine tout point de défaillance centralisé : chaque robot maintient et propage ses propres estimations, ce qui est critique pour des flottes opérant en environnements dégradés ou à couverture GNSS partielle. L'intégration des flux normalisants comme estimateurs de gradient rend l'approximation adaptative, là où la linéarisation classique (EKF) perd en précision face à des non-linéarités fortes. La fusion odométrie/GNSS/UWB couvre explicitement les situations où le signal satellite seul est insuffisant, configuration typique en milieu maritime, portuaire ou en zone urbaine dense. La localisation collaborative multi-robots est un domaine actif depuis les années 2000, avec des approches allant des filtres particulaires décentralisés aux graphes de facteurs incarnés par des systèmes comme COVINS ou Kimera-Multi. L'apport des flux normalisants au cadre de passage de messages reste récent, et la validation expérimentale sur ASVs en simulation et en conditions réelles distingue ce travail des contributions purement théoriques. Les auteurs n'annoncent pas de déploiement opérationnel : l'étape suivante probable est la montée en échelle vers des flottes plus larges et l'intégration dans des pipelines de navigation pour l'inspection maritime ou la logistique portuaire autonome.

RecherchePaper
1 source
OpenSPM : modèle robotique transférable combinant mémoire de poses spatiales et génération d'actions par flow matching
1722arXiv cs.RO 

OpenSPM : modèle robotique transférable combinant mémoire de poses spatiales et génération d'actions par flow matching

OpenSPM (Open-environment Spatial Persistent Memory) est un framework de manipulation robotique tabletop présenté sur arXiv en juin 2026 (réf. 2606.29936). Le système repose sur deux blocs : une mémoire spatiale persistante orientée objet et un modèle de génération d'actions par flow-matching conditionnel. À l'entraînement, OpenSPM utilise de la perception 3D sémantique couplée à un filtre de Kalman pour suivre les poses 6D des objets, extrait les poses spatiales clés depuis des démonstrations humaines et les stocke comme entrées mémoire réutilisables. À l'inférence, il récupère ces entrées via une instruction en langage naturel, transfère les poses dans de nouveaux environnements par transformations rigides SE(3), puis génère des séquences d'actions à une fréquence de contrôle équivalente de 1033,3 Hz. Sur le benchmark LIBERO-GOAL (10 tâches de manipulation), le système atteint 85,6 % de taux de succès avec une correction résiduelle terminale en boucle fermée, le tout en requérant une puissance de calcul minimale à l'inférence. La fréquence de 1033 Hz combinée à une empreinte computationnelle légère est le point saillant pour les intégrateurs. Les modèles VLA (Vision-Language-Action) end-to-end comme Pi-0 de Physical Intelligence ou OpenVLA généralisent bien sémantiquement, mais restent coûteux à entraîner et peinent à imposer des contraintes géométriques fines pour des tâches de précision comme l'assemblage ou l'insertion de pièces. OpenSPM propose un compromis : conserver la compréhension en langage naturel tout en ancrant l'exécution physique dans une mémoire géométrique explicite et transférable. L'aspect transférabilité est industriellement pertinent : les poses clés s'adaptent via SE(3) sans réentraînement complet lors d'un changement de configuration, ce qui réduit le coût de reconfiguration sur des lignes de production évolutives. LIBERO-GOAL est un benchmark académique de référence pour la manipulation tabletop, sur lequel se mesurent régulièrement les architectures Diffusion Policy, ACT et les VLA actuels, dont GR00T N2 de NVIDIA et Pi-0 de Physical Intelligence. OpenSPM se positionne entre les deux extrêmes du secteur : ni LLM lourd en boucle fermée, ni pipeline rigide à primitives fixes. Il s'agit pour l'instant d'un preprint sans déploiement industriel ni partenariat commercial annoncé. Les ablations publiées renforcent la rigueur méthodologique, mais la généralisation à des contextes hors tabletop, manipulation en environnement non structuré ou sur plateforme mobile, reste entièrement à démontrer.

IA physiqueOpinion
1 source
CAR : adaptation cinédynamique inter-véhicules par représentation de la mobilité
1723arXiv cs.RO 

CAR : adaptation cinédynamique inter-véhicules par représentation de la mobilité

Des chercheurs proposent sur arXiv (arXiv:2603.06866) un cadre algorithmique baptisé CAR, pour Cross-vehicle kinodynamics Adaptation via mobility Representation, conçu pour transférer rapidement les modèles de comportement dynamique d'un robot mobile à un autre sans recollecte massive de données. Le système exploite un encodeur Transformer avec normalisation de couche adaptative (Adaptive Layer Normalization) pour projeter trajectoires et configurations physiques de véhicules dans un espace latent commun dit "espace de mobilité partagé". CAR identifie ensuite les voisins les plus proches dans cet espace pour extraire les comportements communs et les adapter à une nouvelle plateforme. Évalué sur le simulateur Verti-Bench, construit sur le moteur multi-physique Chrono, et validé sur quatre configurations distinctes de la plateforme Verti-4-Wheeler, le framework atteint une réduction de l'erreur de prédiction de 67,2 % par rapport à un transfert direct entre plateformes similaires, avec seulement une minute de nouvelles données de trajectoire. Ce résultat adresse un verrou opérationnel réel pour les déployeurs de flottes hétérogènes : adapter un système de navigation autonome à un nouveau châssis exige aujourd'hui soit des campagnes d'acquisition de données coûteuses et spécifiques à chaque plateforme, soit des modèles simplifiés (unicycle, bicyclette) qui ignorent la kinodynamique réelle du robot. Ces abstractions montrent rapidement leurs limites sur terrain accidenté ou en conditions industrielles. CAR propose un transfert de connaissances inter-plateformes à faible coût de calibration. Pour un intégrateur déployant des AMR avec plusieurs types de châssis, réduire à une minute la fenêtre d'adaptation représente un levier opérationnel concret, même si ces conditions de benchmark restent à reproduire en environnements de production réels. L'article s'inscrit dans un courant actif de la recherche en robotique de terrain visant à briser la dépendance aux modèles plateforme-spécifiques. La plateforme Verti-4-Wheeler, reconfigurable mécaniquement, et le simulateur Verti-Bench offrent un banc d'essai modulaire bien adapté à ce type d'étude. Les approches concurrentes incluent les méthodes de méta-apprentissage (MAML et dérivés) et les modèles à dynamiques latentes (Dreamer, RSSM) appliqués à la locomotion. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné : il s'agit d'un résultat académique en cours de révision (v3 sur arXiv), dont la validation à grande échelle reste à démontrer.

RecherchePaper
1 source
J-LAW : localisation conjointe et modélisation du monde orientée action via des graphes de facteurs latents couplés
1724arXiv cs.RO 

J-LAW : localisation conjointe et modélisation du monde orientée action via des graphes de facteurs latents couplés

Un préprint publié sur arXiv (identifiant 2606.28712) introduit J-LAW (Joint Localization and Actionable World Modeling), une architecture qui fusionne le SLAM classique et les modèles de monde conditionnés par l'action dans un unique graphe de facteurs probabilistes. L'objectif MAP (Maximum A Posteriori) commun optimise simultanément les poses métriques des objets, les états latents du monde et les embeddings latents de landmarks. Le pont entre ces deux formulations est un encodeur latent conditionné par la pose et un facteur de couplage pose-latent appris. Les expériences portent sur deux benchmarks : PushT, une tâche de manipulation planaire, et WildGS, un environnement de reconstruction 3D gaussienne. Les résultats montrent que la correction par graphe couplé réduit l'erreur quadratique moyenne de prédiction latente et la dérive de point final par rapport au rollout en boucle ouverte, tandis que la fermeture de boucle latente améliore la cohérence globale de trajectoire. L'enjeu est structurant pour la robotique de manipulation : les systèmes actuels souffrent d'une dichotomie entre localisation précise et planification prédictive. Le SLAM produit des cartes métriques que les planificateurs ne savent pas exploiter directement ; les modèles de monde appris prédisent l'effet des actions mais perdent la cohérence spatiale sur des horizons longs, limitant leur utilité en déploiement réel. J-LAW démontre qu'en couplant ces deux estimations, chaque composante améliore l'autre : une meilleure localisation stabilise la prédiction latente, et réciproquement. C'est une réponse partielle à la dérive en open-loop, problème concret dans les pipelines de manipulation autonome. Pour les équipes travaillant sur des systèmes VLA ou de navigation, ce cadre suggère une représentation unifiée, métrique et actionnable, sans orchestrer deux pipelines distincts. La séparation entre SLAM et modèles de monde appris est historiquement ancrée : le SLAM probabiliste date des années 2000, tandis que les modèles de monde deep (RSSM, DreamerV3) sont apparus dans la décennie suivante. Plusieurs travaux récents tentent ce rapprochement dans le champ des VLA, où la cohérence spatiale devient un enjeu croissant. J-LAW se positionne comme une contribution théorique structurée via la formalisation en graphe de facteurs, et non comme un système prêt au déploiement. Limite à noter : les expériences restent sur des benchmarks standardisés, sans validation sur robot physique réel en scène dynamique. Aucun partenariat industriel ni timeline de transfert n'est mentionné dans ce préprint.

RechercheOpinion
1 source
Apprentissage de politiques hiérarchiques par décomposition spectrale
1725arXiv cs.RO 

Apprentissage de politiques hiérarchiques par décomposition spectrale

Des chercheurs ont publié le 30 juin 2026 sur arXiv (réf. 2606.29570) une nouvelle architecture de politique robotique appelée Causal Spectral Policy (CSP), fondée sur une décomposition spectrale des séquences d'actions via la transformée en cosinus discrète (DCT). L'observation centrale est la suivante : les composantes basse fréquence d'une séquence de mouvements encodent la trajectoire globale et l'intention de tâche, tandis que les composantes haute fréquence capturent le timing précis, l'alignement et les comportements de contact. CSP génère d'abord un mouvement grossier conditionné sur l'observation visuelle et l'instruction en langage naturel, puis produit des corrections fines conditionnellement sur la trajectoire réalisée, selon un processus causal dit "coarse-to-fine". Les évaluations en simulation et en environnement réel montrent des performances supérieures aux baselines sur des tâches de manipulation sensibles à la précision. L'équipe propose également une augmentation de données par injection de bruit de télé-opération humaine, simulant les imperfections naturelles des démonstrations collectées par opérateur. Cette approche répond à un défi structurel persistant de l'apprentissage par imitation (behavior cloning) : les politiques standards peinent à concilier cohérence globale du mouvement et précision locale au moment du contact. En séparant explicitement ces deux niveaux via la décomposition spectrale, CSP évite que les perturbations haute fréquence ne corrompent la planification de trajectoire, et inversement. La robustesse aux démonstrations bruitées est particulièrement pertinente pour les intégrateurs industriels qui collectent des données de télé-opération à grande échelle, où la qualité des démonstrations est intrinsèquement variable. Cela adresse aussi partiellement le problème du sim-to-real gap : traiter séparément la dynamique globale et les ajustements fins rend la politique moins sensible aux écarts entre simulation et réel. CSP s'inscrit dans un mouvement plus large de raffinement des politiques d'imitation, qui a vu émerger ces dernières années Diffusion Policy (Chi et al., 2023), ACT (Action Chunking with Transformers) ou des modèles VLA comme Pi-0 de Physical Intelligence et OpenVLA. Là où ces approches misent sur l'expressivité de l'architecture ou le volume de données d'entraînement, CSP parie sur un biais inductif structurel emprunté au traitement du signal. Il s'agit à ce stade d'un résultat de preprint sans déploiement industriel annoncé. Les prochaines étapes naturelles incluent des benchmarks sur des tâches de haute précision type assemblage ou vissage, et une validation sur des plateformes matérielles standardisées comme Franka ou UR.

RechercheOpinion
1 source
MoPe : permanence du mouvement pour une cartographie gaussienne monoculaire robuste en environnements dynamiques
1726arXiv cs.RO 

MoPe : permanence du mouvement pour une cartographie gaussienne monoculaire robuste en environnements dynamiques

Une équipe de recherche publie en préimpression sur arXiv (2606.29237) une méthode baptisée MoPe (Motion Permanence) qui vise à corriger un défaut structurel des systèmes de cartographie par Gaussian Splatting monoculaire en environnements dynamiques. Le problème ciblé est précis : les approches actuelles de SLAM avec Gaussian Splatting traitent chaque image de manière indépendante pour décider si une région est dynamique ou statique. Résultat, quand un piéton ralentit, s'arrête ou réapparaît après une occultation, la trame courante semble statique et le système intègre ce contenu mobile dans la carte permanente, générant des artefacts de type "fantôme" (ghosting). MoPe repose sur un principe qu'il nomme Motion Permanence : l'identité dynamique d'un objet doit persister dans le temps plutôt qu'être réévaluée à chaque image. Concrètement, la méthode propage le posterior dynamique historique via un warping géométriquement cohérent en SE(3), puis le fusionne avec les observations de la trame courante par mises à jour bayésiennes en log-odds bornées. Ce posterior persistant pilote le suivi, la cartographie, l'insertion sélective de gaussiennes et un post-nettoyage par gaussienne individuelle. Les auteurs évaluent MoPe sur trois benchmarks publics (Wild-SLAM, Bonn, TUM) et rapportent des gains de robustesse en tracking et une réduction des ghosting, avec les améliorations les plus marquées sur les séquences à humains dynamiques. L'enjeu pour les intégrateurs et les équipes de navigation autonome est direct : un SLAM qui "hallucine" des obstacles statiques là où un piéton s'était simplement immobilisé dégrade la planification de trajectoire et la prise de décision en aval. En introduisant une mémoire temporelle au niveau de la représentation de scène elle-même, MoPe traite le problème à la racine plutôt qu'en post-filtrage. La méthode prouve qu'un filtre d'incertitude à mémoire, relativement léger à implémenter, suffit à franchir une partie du fossé entre les démos en laboratoire et les déploiements réels en environnements peuplés, sans recourir à une caméra stéréo ou à un LiDAR. Le Gaussian Splatting appliqué au SLAM est un domaine en effervescence depuis 2023, porté par des travaux comme SplaTAM, MonoGS et GaussianSLAM, qui ont démontré la faisabilité d'une cartographie haute-fidélité en temps réel à partir d'une seule caméra. MoPe s'inscrit dans la vague des méthodes qui cherchent à rendre ces représentations exploitables hors des environnements contrôlés, aux côtés d'approches concurrentes comme RobustSplat ou les variantes uncertainty-aware de MonoGS. Il s'agit pour l'instant d'une préimpression non revue par les pairs, sans code publié ni validation sur robot réel annoncée, ce qui invite à tempérer les conclusions : les gains mesurés sur séquences vidéo ne garantissent pas un comportement équivalent sur plateforme embarquée avec contraintes temps-réel. Les prochaines étapes naturelles seront l'intégration dans un pipeline de navigation complet et la validation sur datasets intérieurs type HM3D ou ScanNet avec scènes plus peuplées.

RecherchePaper
1 source
La translation comme action passerelle : transférer des compétences de manipulation de l'humain au robot
1727arXiv cs.RO 

La translation comme action passerelle : transférer des compétences de manipulation de l'humain au robot

Une équipe de chercheurs a publié en juin 2026 (arXiv:2606.28133) une méthode pour transférer des compétences de manipulation humaine vers des robots bi-manuels à pinces parallèles, sans passer par une télé-opération coûteuse. Le principe repose sur une représentation d'action dite "pont" : plutôt que de capturer les 6 degrés de liberté (6DoF) du poignet humain rotations incluses, les auteurs n'utilisent que la translation relative du poignet dans le repère de la caméra tête initiale. Cet espace d'action minimal est partagé par les humains et les robots, ce qui élimine la principale source de bruit : l'estimation de la pose rotative d'une main humaine reste imprécise, et les schémas de contact des doigts diffèrent fondamentalement de ceux d'une pince parallèle. Un modèle vision-language-action (VLA) de type Pi-0 est ensuite entraîné avec des tokens d'action entrelacés et un masquage d'attention pour gérer l'absence de certaines composantes selon l'embodiment considéré. Le résultat central est que cette représentation "translation seule" transfère les connaissances de manipulation humaine vers le robot bien plus efficacement que les actions humaines bruitées en 6DoF, et que la performance scale avec la quantité de données humaines disponibles. Les expériences restent confinées à un ensemble de tâches bi-manuelles en laboratoire, ce qui invite à la prudence avant toute généralisation. Pour les intégrateurs B2B cherchant à exploiter des vidéos non instrumentées pour former des robots d'assemblage ou de manutention, c'est une validation de principe utile : les données humaines bon marché deviennent exploitables à condition de définir soigneusement l'espace d'action appris. Cela suggère que la conception de la représentation importe autant que le volume de données brutes. Ce travail s'inscrit dans la course à l'apprentissage cross-embodiment à partir de données humaines peu coûteuses, un front ouvert depuis que RT-2 (Google DeepMind, 2023) a popularisé les VLA multi-modaux. Physical Intelligence a lancé Pi-0 début 2025 comme modèle fondation bi-manuel ; ce papier en adopte l'architecture pour valider une hypothèse d'embodiment transfer distincte. Les concurrents directs incluent OpenVLA (Berkeley), AgiBot World et GR00T N2 (NVIDIA), qui explorent chacun des espaces d'action universels différents. La limite naturelle de cette approche reste les tâches impliquant des rotations fines ou des contacts précis, un angle que les auteurs n'abordent pas encore.

RechercheOpinion
1 source
L'effondrement neuronal ordinal comme a priori de représentation pour la navigation visuelle
1728arXiv cs.RO 

L'effondrement neuronal ordinal comme a priori de représentation pour la navigation visuelle

Une équipe de recherche a publié en juin 2026 sur arXiv (2606.26839) ORION, une méthode d'apprentissage de politiques de navigation visuelle pour robots mobiles. Le problème de départ est celui de l'imitation learning de bout en bout : lorsqu'on entraîne conjointement un encodeur visuel et un décodeur d'actions via une unique loss d'action, le signal de supervision reste indirect pour l'encodeur. Résultat : l'encodeur apprend des représentations dites "action-agnostic", insensibles aux distinctions qui comptent pour la navigation. Dans les environnements réels, avec leurs distracteurs visuels et la variabilité des scènes, ces représentations ambiguës se traduisent par des actions incohérentes aux carrefours et aux intersections complexes, générant des échecs de navigation. ORION impose explicitement une structure ordinale à l'espace de représentation de l'encodeur : les catégories de commandes ego-centriques (de "Far Left" à "Far Right") forment une séquence naturelle où les classes voisines partagent des contextes visuels similaires. L'encodeur est contraint d'organiser ces classes le long d'un axe discriminant unique, en supprimant la variance hors-axe au sein de chaque classe. Cet encodeur pré-entraîné est ensuite intégré dans un framework de navigation basé sur la diffusion, puis affiné end-to-end. Les expériences, conduites en simulation et en conditions réelles, montrent que ORION surpasse les baselines end-to-end et neural collapse classiques sur le taux de succès de navigation et la progression vers l'objectif, avec des gains particulièrement marqués aux intersections multi-voies. L'intérêt de cette approche réside dans sa réponse à un problème structurel des VLA (Vision-Language-Action models) et plus généralement de l'imitation learning visuelle : la supervision indirecte de l'encodeur. En robotique mobile autonome, notamment pour les AGV et AMR déployés en entrepôt ou en milieu urbain, les représentations "action-agnostic" sont un vecteur d'échec documenté et coûteux en production. L'idée d'exploiter la structure ordinale naturelle des commandes directionnelles pour contraindre l'espace latent est élégante et transférable : elle n'exige pas de données supplémentaires, mais réorganise le signal de supervision existant. La démonstration de gains concrets sur des intersections complexes est particulièrement pertinente pour les intégrateurs de robots de livraison ou de surveillance en environnements non structurés. Cela confirme une hypothèse émergente dans le secteur : la qualité de la représentation visuelle, et non la puissance brute du décodeur, est souvent le goulet d'étranglement dans le passage du labo au terrain. Le concept de "neural collapse" est emprunté à la littérature sur la classification supervisée, où il décrit la convergence des représentations de dernière couche vers des structures géométriques idéales en fin d'entraînement. ORION étend ce cadre à la navigation en y ajoutant la dimension ordinale, ce qui le distingue des travaux précédents qui appliquaient neural collapse sans tenir compte de la relation sémantique entre classes de commandes. Dans l'écosystème des frameworks de navigation diffusion-based, on retrouve des travaux proches comme NoMaD ou GNFactor, ainsi que des approches VLA comme pi-0 de Physical Intelligence. Les auteurs n'annoncent pas de déploiement commercial ni de partenariat industriel identifiable dans ce preprint ; les prochaines étapes naturelles seraient une validation à plus grande échelle sur des plateformes comme Clearpath ou Boston Dynamics Spot, et une extension aux politiques multimodales intégrant des instructions en langage naturel.

RechercheOpinion
1 source
RMTL : apprentissage par renforcement sur micro-tâches pour la manipulation à long terme avec récompenses VLM
1729arXiv cs.RO 

RMTL : apprentissage par renforcement sur micro-tâches pour la manipulation à long terme avec récompenses VLM

Une équipe de chercheurs a publié en juin 2026, via arXiv (identifiant 2606.26175), une méthode baptisée RMTL (Reinforced Micro-Task Learning) visant à résoudre un problème central de l'apprentissage par renforcement appliqué à la manipulation robotique : la conception du signal de récompense. Plutôt que de s'appuyer sur une fonction de récompense dense codée manuellement (coûteuse à calibrer et souvent fragile) ou sur des démonstrations humaines, RMTL exploite des modèles vision-langage (VLM) préentraînés comme signaux de récompense zero-shot. La nouveauté réside dans la décomposition de la tâche globale en un petit ensemble de micro-tâches décrites en langage naturel, chacune associée à un prompt dédié. À chaque étape, l'agent reçoit une récompense calculée par le VLM selon la micro-tâche active, moyennée sur plusieurs angles de caméra pour atténuer les effets d'occlusion. Un curriculum inverse expose progressivement l'agent à des conditions initiales plus difficiles, tandis qu'un gestionnaire hiérarchique appris remplace une règle de sélection de phase basée sur la distance. Les expériences ont été menées sur l'environnement Fetch, benchmark standard de la manipulation en simulation, avec seulement trois prompts courts sans ajustement supplémentaire. L'apport principal est l'amélioration significative du signal d'apprentissage par rapport à une approche VLM à prompt unique. Un prompt global produit un signal de récompense quasi-plat en début de trajectoire : l'agent ne détecte pas ses progrès précoces, ce qui ralentit drastiquement la convergence sur des tâches à long horizon. RMTL répond à ce problème structurel en rendant chaque micro-tâche localement observable. Pour les équipes cherchant à réduire leur dépendance aux démonstrations humaines ou à l'ingénierie manuelle des récompenses, cela représente une piste sérieuse pour rendre le RL guidé par le langage plus scalable sans coût d'annotation supplémentaire. Ce travail s'inscrit dans une vague active de recherches utilisant les VLMs comme substituts de fonctions de récompense, dont EUREKA de NVIDIA ou les approches SayCan de Google DeepMind. Contrairement à certaines de ces méthodes qui nécessitent un fine-tuning ou des démonstrations vidéo, RMTL mise sur une décomposition minimale en trois phases sans recalibrage des prompts. L'évaluation reste cependant confinée à la simulation sur robot Fetch, et aucun résultat sur plateforme physique n'est rapporté. La prochaine étape critique sera de valider si cette approche tient face au gap sim-to-real, notamment sur des manipulateurs physiques avec variabilité sensorielle réelle.

RechercheActu
1 source
MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique
1730arXiv cs.RO 

MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique

Des chercheurs présentent MAPL (Multi-Objective AI-Informed Preference Learning), un cadre d'apprentissage par renforcement pour la locomotion quadrupède qui remplace les fonctions de récompense manuelles par des préférences générées par LLM. Publié sur arXiv (réf. 2606.25398) en juin 2025, le système soumet des paires de trajectoires à un grand modèle de langage, qui les évalue selon plusieurs critères sémantiques distincts, formulés en langage naturel générique et invariants selon le terrain. Ces préférences par objectif alimentent un modèle de scoring à plusieurs têtes, dont les sorties sont agrégées en récompense scalaire pour l'optimisation de politique. Sur quatre environnements de simulation quadrupède, les auteurs rapportent des performances comparables ou supérieures à des récompenses conçues par des experts du domaine. L'intérêt de MAPL tient à sa décomposition structurée des objectifs, là où les méthodes LLM existantes se limitent à un jugement global entre comportements. En robotique industrielle, la conception de fonctions de récompense reste un goulot d'étranglement reconnu, exigeant de longues itérations entre ingénieurs RL et spécialistes métier. Substituer ce travail par des descriptions en langage naturel, réutilisables sans réécriture d'équations, réduirait le coût d'adaptation à de nouvelles tâches. La décomposition en critères distincts offre aussi une meilleure interprétabilité : il devient possible d'identifier quels objectifs sont en tension, ce qui facilite le débogage comportemental. MAPL s'inscrit dans la vague d'automatisation de la conception de récompenses via LLM, initiée notamment par EUREKA (NVIDIA, 2023), qui générait directement du code de récompense via GPT-4, et par RL-VLM-F, qui exploite des modèles vision-langage pour évaluer les comportements. La locomotion quadrupède est un benchmark standard utilisé par des projets comme ANYmal (ETH Zurich) et les plateformes Unitree. Plusieurs limites méritent d'être signalées : l'article reste un preprint non relu par les pairs, les expériences sont menées uniquement en simulation sans validation physique, et le LLM utilisé pour générer les préférences n'est pas spécifié, ce qui complique la reproductibilité. Les extensions naturelles concernent la validation sur robot réel et l'application à des morphologies plus complexes, comme les humanoïdes, où l'ingénierie de récompense est particulièrement coûteuse.

RecherchePaper
1 source
MIL-LC : architecture robuste de localisation multimodale par fusion magnétomètre-inertiel-LiDAR
1731arXiv cs.RO 

MIL-LC : architecture robuste de localisation multimodale par fusion magnétomètre-inertiel-LiDAR

Une équipe de recherche publie sur arXiv (identifiant 2606.25796, juin 2026) un framework de localisation multimodale baptisé MIL-LC, qui fusionne trois sources de données : un magnétomètre, une centrale inertielle (IMU) et un LiDAR, montés sur une suite de capteurs conçue spécifiquement pour les robots mobiles autonomes (AMR). Le système cible les environnements où le GPS est absent et où les méthodes classiques échouent : parkings souterrains, hôtels, open-spaces à géométrie répétitive ou sans texture distinctive. MIL-LC est conçu pour maintenir une localisation fiable dans deux scénarios critiques : la dégénérescence géométrique du LiDAR (tunnels, couloirs uniformes), et l'évolution de la carte magnétique au fil du temps lors de déploiements longue durée. Les résultats présentés couvrent des tests en simulation et en environnement réel, sans chiffres de précision publiés dans le résumé disponible. L'intérêt industriel réside dans la promesse d'un déploiement sans infrastructure supplémentaire. Les solutions actuelles de localisation indoor pour AMR s'appuient soit sur des features géométriques ou visuelles (fragiles en environnement répétitif), soit sur des balises UWB, Wi-Fi ou QR (coût d'installation, maintenance, rigidité de déploiement). Le champ magnétique ambiant (AMF), lui, est omniprésent et ne nécessite aucun équipement terrain. L'apport de MIL-LC est de transposer cette idée, jusqu'ici explorée uniquement en contexte piéton avec des smartphones, à un AMR équipé d'une suite capteurs dédiée. Pour un intégrateur ou un COO industriel, cela signifie potentiellement réduire les prérequis d'installation dans des bâtiments complexes, un frein récurrent à l'adoption. La fusion magnétomètre-IMU pour la localisation piétonne a été explorée depuis plusieurs années par des laboratoires de robotique (notamment en Chine, en Europe et au Japon), mais son application aux AMR industriels restait largement ouverte. Les alternatives dominantes sur le marché AMR indoor incluent le SLAM LiDAR pur (Sick, Hokuyo, Livox), la vision (Boston Dynamics, Locus Robotics), et les systèmes hybrides LiDAR+vision. Côté français, des acteurs comme Exotec (logistique) ou Balyo déploient des AMR en entrepôts structurés, moins exposés aux environnements dégradés ciblés ici. MIL-LC reste pour l'instant une contribution académique en preprint, sans annonce de déploiement ni de partenariat industriel. Une soumission vers une conférence de référence (ICRA ou IROS) constituerait la prochaine étape naturelle avant toute validation à l'échelle.

UEImpact indirect pour les déployeurs français d'AMR (Exotec, Balyo) qui opèrent majoritairement en entrepôts structurés ; la contribution reste un preprint sans métriques publiées ni validation industrielle, à suivre si soumis à ICRA/IROS.

RecherchePaper
1 source
GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots
1732arXiv cs.RO 

GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots

GROVE (Grounded Robot-Oriented Vehicle Environment), présenté dans un preprint arXiv (2606.25504) déposé fin juin 2026, est un framework de simulation de piétons piloté par langage naturel, conçu pour entraîner et évaluer des robots de navigation sociale. Le système accepte des instructions textuelles pour générer des scénarios de simulation: trois presets préconfigurés couvrent les situations d'urgence, de file d'attente et de déplacement ordinaire, mais l'utilisateur peut aussi saisir un prompt libre pour obtenir un scénario entièrement personnalisé. Trois modules distincts gèrent respectivement le comportement humain à long horizon (trajectoires et intentions globales), la navigation piétonne à moyen horizon (évitement, flots de foule), et les interactions sociales à court horizon entre robot et individus. GROVE s'intègre nativement dans Isaac Sim (NVIDIA), Gazebo et RViz. Les scènes de validation couvrent des environnements résidentiels, hospitaliers et de bureau. Le principal verrou que GROVE cherche à lever est le coût de génération manuelle de données de simulation: aujourd'hui, produire un scénario crédible (couloir d'hôpital en heure de pointe, évacuation d'urgence) exige un travail de paramétrage fastidieux, répété à chaque variante. Déléguer cette configuration au langage naturel réduit la friction pour les équipes non-spécialistes et accélère la diversification des données d'entraînement. La sélection dynamique des algorithmes de l'état de l'art par module vise explicitement à comprimer le sim-to-real gap, défaillance structurelle qui pénalise le transfert des politiques apprises en simulation vers des robots déployés en milieu réel. Sur le papier, l'architecture modulaire permet aussi de mettre à jour chaque couche indépendamment quand un nouvel algorithme de navigation ou de prédiction de trajectoire devient disponible. La navigation sociale robotique est un champ actif depuis plus d'une décennie, avec des modèles fondateurs comme le Social Force Model et des outils de simulation existants (PedSim, pedsim\_ros, SEAN) qui imposaient des paramétrages rigides et manuels. GROVE s'inscrit dans une tendance plus large d'utilisation des LLM comme interface de configuration pour les pipelines de simulation, une direction explorée parallèlement dans la génération procédurale de scènes 3D. Important à noter: la validation présentée est uniquement qualitative, sans benchmark quantitatif sur des métriques standardisées comme celles de trajnet++ ou BARN. Les affirmations sur la "haute fidélité" de simulation restent donc à vérifier sur robot réel. Le preprint ne mentionne ni déploiement en production ni partenariat industriel.

RecherchePaper
1 source
AssemPlanner : un cadre de planification de tâches multi-agents pour les systèmes d'assemblage flexibles
1733arXiv cs.RO 

AssemPlanner : un cadre de planification de tâches multi-agents pour les systèmes d'assemblage flexibles

Une équipe de chercheurs a publié le 12 mai 2026 sur arXiv (référence 2605.08831) un framework de planification de tâches pour systèmes d'assemblage flexibles baptisé AssemPlanner. Le système prend en entrée des descriptions de tâches en langage naturel et les convertit automatiquement en séquences d'opérations de production exécutables. Son architecture repose sur plusieurs agents spécialisés : SchedAgent, qui joue le rôle de moteur de raisonnement central, KnowledgeAgent, chargé de fournir les connaissances métier, LineBalanceAgent, responsable de l'équilibrage des lignes, ainsi qu'un graphe de scène représentant l'état physique de l'environnement. Le code source et les jeux de données sont publiés en accès libre sur GitHub, ce qui facilite la reproductibilité des résultats. L'intérêt industriel de cette approche réside dans la réduction du temps de reconfiguration d'une ligne d'assemblage lors du passage à un nouveau produit. Dans les systèmes actuels, cette phase mobilise plusieurs experts pendant des périodes significatives, ce qui constitue un frein majeur à la flexibilité de la production. En substituant une interface en langage naturel à la configuration manuelle, AssemPlanner vise à abaisser la barrière d'entrée pour les intégrateurs et les responsables de production. Le recours à l'approche ReAct (Reasoning + Acting) permet à SchedAgent d'ajuster dynamiquement ses décisions en fonction des retours des autres agents, contrairement aux pipelines statiques traditionnels qui nécessitent une reprogrammation explicite dès que les contraintes du procédé changent. Cela pourrait réduire concrètement les délais de mise en production pour les PME industrielles et les intégrateurs spécialisés en automatisation. AssemPlanner s'inscrit dans la dynamique plus large des systèmes multi-agents LLM appliqués à l'automatisation industrielle, un champ en expansion rapide depuis 2023. L'architecture ReAct, introduite par des chercheurs de Google et Princeton en 2022, est ici transposée dans un contexte de manufacturing réel plutôt que symbolique. Les approches concurrentes incluent les systèmes experts classiques, la planification par jumeaux numériques, et des frameworks comme TaskMatrix ou AutoGen adaptés à des verticaux industriels. Il convient de souligner que le papier reste une contribution académique : aucun déploiement en environnement de production réel n'est documenté à ce stade, et les performances annoncées devront être validées hors contexte contrôlé.

RechercheActu
1 source
PISTO : inférence proximale pour l'optimisation stochastique de trajectoires
1734arXiv cs.RO 

PISTO : inférence proximale pour l'optimisation stochastique de trajectoires

Des chercheurs ont publié sur arXiv (arXiv:2605.07215) un algorithme de planification de trajectoires robotiques appelé PISTO (Proximal Inference for Stochastic Trajectory Optimization). Leur contribution centrale est de démontrer que STOMP, méthode stochastique classique, minimise implicitement une divergence KL par rapport à une distribution de trajectoires de Boltzmann, révélant une structure d'inférence variationnelle (VI) sous-jacente. PISTO exploite cette observation en ajoutant une régularisation KL entre propositions gaussiennes successives, ce qui stabilise les mises à jour et produit une interprétation de type trust-region. L'algorithme reste entièrement sans dérivées et s'appuie sur un échantillonnage Monte Carlo à pondération d'importance. Sur les benchmarks de planification de bras robotiques, PISTO atteint 89 % de taux de succès contre 63 % pour CHOMP et 68 % pour STOMP, tout en générant des trajectoires plus courtes et plus lisses, à deux fois la vitesse des méthodes stochastiques concurrentes. Des validations complémentaires sur des tâches de locomotion et manipulation contact-rich en simulation MuJoCo montrent des performances supérieures aux baselines CEM et MPPI en termes de récompense cumulée. Pour les intégrateurs et ingénieurs en planification de mouvement, l'absence totale de dérivées est une caractéristique décisive : elle permet de traiter des fonctions de coût non-différentiables ou discontinues, fréquentes dans les environnements industriels réels (détection de collisions, zones interdites, contraintes non paramétriques). Le gain de vitesse d'un facteur deux par rapport aux méthodes stochastiques existantes réduit directement les temps de cycle dans les applications de planification en ligne, point critique pour la robotique collaborative et les systèmes pick-and-place haute cadence. La validation sur MuJoCo avec contacts ouvre des perspectives vers la locomotion humanoïde et la manipulation dextre, bien que ces résultats restent pour l'instant entièrement simulés, sans validation sur matériel physique. PISTO s'inscrit dans la lignée de STOMP (développé chez Willow Garage et présenté à l'ICRA 2011) et de ses concurrents gradient-based tels que CHOMP, ainsi que des méthodes stochastiques modernes MPPI (popularisé par NVIDIA en 2017) et CEM. Soumis comme preprint arXiv sans révision par les pairs à ce stade, l'article n'annonce ni déploiement industriel ni partenariat commercial. Son impact pratique dépendra de la mise à disposition du code source et de validations expérimentales sur robot réel, étapes absentes de la publication actuelle.

RecherchePaper
1 source
DexSynRefine : synthèse et affinement des mouvements humain-objet pour des actions robotiques dextériques réalisables
1735arXiv cs.RO 

DexSynRefine : synthèse et affinement des mouvements humain-objet pour des actions robotiques dextériques réalisables

DexSynRefine est un framework de manipulation dextre présenté dans un preprint arXiv daté de mai 2026, conçu pour apprendre des gestes robotiques complexes à partir de données d'interaction humain-objet (HOI) plutôt que par téléopération. L'architecture repose sur trois composants couplés : HOI-MMFP, une extension des "motion manifold primitives" conditionnée par la tâche et l'état initial de l'objet, qui synthétise des trajectoires coordonnées main-objet à partir de démonstrations HOI éparses ; une politique de renforcement résiduelle dans l'espace de la tâche, qui ancre physiquement ces trajectoires de référence tout en héritant de leur structure cinématique ; et un module d'adaptation contact-dynamique qui exploite l'historique proprioceptif pour le transfert sim-to-réel. Le système a été évalué sur cinq tâches : saisie-dépôt, utilisation d'outils et réorientation d'objets. Sur le robot réel, il améliore les taux de succès de 50 à 70 points de pourcentage par rapport au retargeting cinématique classique, et réussit le transfert sur la totalité des cinq tâches. Ce résultat est notable pour les intégrateurs et décideurs industriels parce qu'il adresse simultanément deux verrous majeurs de la manipulation dextre : le mismatch d'embodiment (les mains humaines et les mains robotiques ont des cinématiques incompatibles) et le sim-to-real gap dans des tâches contact-rich. L'approche HOI comme source de données est une alternative à l'échelle à la téléopération, coûteuse en opérateurs qualifiés. La politique résiduelle RL préserve la structure des démos tout en corrigeant la physique, ce qui limite l'exploration RL brute dans des espaces à haute dimension. Le gain de 50-70 pp est annoncé sur des évaluations internes, les conditions de test n'étant pas encore détaillées dans ce preprint préliminaire, ce qui invite à une lecture prudente avant généralisation. DexSynRefine s'inscrit dans une ligne de travaux sur la manipulation dextre post-dexterous-RL qui cherchent à s'affranchir de la téléopération (Dexterous Imitation, AnyDexGrasp, RoboAgent). Les motion manifold primitives sur lesquels s'appuie HOI-MMFP sont un outil issu de la synthèse de mouvement humain adapté ici au domaine robotique. Les concurrents directs incluent les approches de retargeting cinématique pur, les politiques diffusion comme pi-zero et les méthodes VLA appliquées à la manipulation fine. Le papier n'annonce pas de déploiement industriel ni de partenariat commercial, et reste au stade de la démonstration académique en laboratoire. Les prochaines étapes probables concernent la généralisation à des objets non vus et l'intégration dans des pipelines de données HOI à grande échelle.

IA physiquePaper
1 source
Cadre de commande SDRE hors ligne en trois étapes pour reproduire le mouvement humain sur un robot bipède suspendu
1736arXiv cs.RO 

Cadre de commande SDRE hors ligne en trois étapes pour reproduire le mouvement humain sur un robot bipède suspendu

Une équipe de recherche a publié sur arXiv (réf. 2506.04680) une stratégie de contrôle en trois étapes permettant à un robot bipède suspendu de reproduire fidèlement des mouvements humains capturés par mocap, avec une erreur quadratique moyenne (RMSE) inférieure à 3 degrés sur l'ensemble des articulations testées. Le pipeline repose d'abord sur un contrôleur SDRE (State-Dependent Riccati Equation) qui génère des trajectoires de couple optimales à partir du modèle dynamique du système bipède. Une deuxième étape produit des séquences de commandes en vitesse et accélération articulaires via une optimisation paramétrée intégrant les contraintes des actionneurs. La troisième étape applique un contrôleur hybride PID-LQR piloté par les données pour minimiser l'écart entre le mouvement cible et celui effectivement exécuté. Le dispositif expérimental est un robot bipède suspendu conçu spécifiquement pour l'évaluation d'exosquelettes anti-gravité, validé sur deux tâches : squat répétitif et marche. L'enjeu est direct pour l'industrie de l'exosquelette : les protocoles d'homologation impliquent aujourd'hui des sujets humains, ce qui introduit des risques de sécurité et complique la reproductibilité des tests. Remplacer le porteur par un robot calibré sur ses propres données de capture de mouvement ouvre la voie à des bancs d'essai systématiques, automatisés et comparables entre laboratoires. La précision annoncée, moins de 3° de RMSE moyen, est suffisante pour valider des algorithmes d'assistance articulaire sur des cycles locomoteurs complets, même si les auteurs ne précisent pas les conditions de charge ni la fréquence de cycle, deux paramètres déterminants pour juger de la transférabilité à des exosquelettes industriels ou médicaux. Le problème de la reproduction de mouvement humain sur robot hétérogène est un verrou classique en robotique de rééducation, aggravé par les différences de cinématique et d'actionnement entre humain et machine. L'approche SDRE, plus flexible que le LQR classique sur systèmes non-linéaires, n'est pas nouvelle mais son association à un raffinement PID-LQR guidé par les données constitue une contribution méthodologique incrémentale. En France, Wandercraft développe l'exosquelette Atalante pour la rééducation neurologique et fait face aux mêmes problématiques de test reproductible ; Pollen Robotics et Enchanted Tools opèrent sur des segments adjacents. Au niveau international, les équipes de Boston Dynamics, Agility Robotics et Apptronik publient sur des défis similaires en sim-to-real pour bipèdes. La prochaine étape logique pour les auteurs serait de valider le framework sur une plateforme non suspendue, condition nécessaire pour que l'approche soit utilisable en certification exosquelette en conditions réelles.

UEWandercraft (Atalante) et d'autres acteurs français de l'exosquelette sont directement concernés : ce framework de test robotisé et reproductible pourrait informer les futurs protocoles d'homologation d'exosquelettes médicaux et industriels en Europe, réduisant le recours à des sujets humains lors des certifications.

ExosquelettesPaper
1 source
FUS3DMaps : cartographie sémantique à vocabulaire ouvert par fusion 3D de couches voxel et instance
1737arXiv cs.RO 

FUS3DMaps : cartographie sémantique à vocabulaire ouvert par fusion 3D de couches voxel et instance

Une équipe de recherche a publié le 6 mai 2026 sur arXiv (référence 2605.03669) FUS3DMaps, une méthode de cartographie sémantique 3D à vocabulaire ouvert conçue pour permettre à des robots de localiser spatialement des concepts arbitraires sans ensemble de classes prédéfini. Le système fonctionne en ligne et maintient simultanément deux couches sémantiques dans une même carte de voxels partagée : une couche dense, qui projette directement les embeddings de pixels sur la carte 3D, et une couche instance-level, qui segmente les vues, encode les régions correspondant à des objets distincts, puis les associe en 3D. Les expériences menées sur des benchmarks établis de segmentation sémantique 3D montrent que FUS3DMaps atteint une précision compétitive à l'échelle de bâtiments multi-étages, un niveau de scalabilité rarement démontré pour ce type d'approche sans entraînement supervisé. Le code et les données complémentaires sont annoncés en accès ouvert. Ce qui distingue FUS3DMaps des méthodes existantes est la fusion sémantique inter-couches (cross-layer fusion), qui combine les forces complémentaires des deux représentations : la couche dense couvre l'intégralité du champ visuel sans nécessiter de segmentation préalable, mais souffre d'un manque de précision à l'échelle ; la couche instance-level est précise sur les objets individuels mais dépend de l'association 2D-3D. En fusionnant les embeddings des deux couches au niveau voxel, la méthode améliore la qualité de chacune. Pour garantir la scalabilité, la fusion dense et inter-couches est restreinte à une fenêtre spatiale glissante, évitant l'explosion mémoire dans les grands environnements. Pour les intégrateurs de robotique mobile ou les développeurs de systèmes de navigation en environnement ouvert, c'est une piste concrète vers des robots capables de répondre à des requêtes en langage naturel sur des espaces non balisés. La cartographie sémantique à vocabulaire ouvert est un champ en plein essor depuis l'émergence des vision-language models (VLM) comme CLIP. Les approches actuelles se divisent en deux familles : les méthodes instance-level (LSeg, OpenScene, EmbodiedScan) et les méthodes dense (ConceptFusion, OpenFusion), chacune avec ses compromis entre précision et scalabilité. FUS3DMaps tente de réconcilier les deux dans un pipeline unifié, sans fine-tuning. À noter que l'article est une prépublication arXiv, sans validation par les pairs à ce stade, et que les démonstrations vidéo et le code sont encore annoncés comme "à venir". Aucune entreprise industrielle ou partenaire de déploiement n'est mentionné : il s'agit d'une contribution de recherche académique, pas d'un produit commercialisé.

RechercheActu
1 source
RoboAlign-R1 : alignement multimodal des récompenses pour les modèles du monde vidéo robotique
1738arXiv cs.RO 

RoboAlign-R1 : alignement multimodal des récompenses pour les modèles du monde vidéo robotique

Des chercheurs ont publié le 6 mai 2026 sur arXiv (arXiv:2605.03821) un framework baptisé RoboAlign-R1, conçu pour améliorer l'alignement des modèles vidéo du monde robotique avec les objectifs réels de prise de décision. Le coeur du travail repose sur un benchmark inédit, RobotWorldBench, qui rassemble 10 000 paires vidéo-instruction annotées issues de quatre sources de données robotiques, et sur un juge multimodal, RoboAlign-Judge, capable d'évaluer les vidéos générées selon six dimensions distinctes (instruction following, manipulation accuracy, plausibilité physique, entre autres). Ce juge enseignant est ensuite distillé en un modèle récompense léger pour un post-entraînement par renforcement. En parallèle, les auteurs introduisent une stratégie d'inférence sans entraînement supplémentaire, le Sliding Window Re-encoding (SWR), qui rafraichit périodiquement le contexte de génération pour limiter la dérive lors des prédictions à long horizon. Les gains mesurés sont de 10,1 % sur le score agrégé à six dimensions par rapport au meilleur baseline, dont 7,5 % en précision de manipulation et 4,6 % en suivi d'instructions. Le SWR apporte quant à lui une réduction de 9,8 % en LPIPS et une hausse de 2,8 % en SSIM, avec seulement environ 1 % de latence additionnelle. Ce travail pointe un problème structurel rarement nommé aussi clairement dans la littérature : les modèles vidéo robotiques sont généralement optimisés pour des métriques visuelles basses (reconstruction pixel, SSIM) qui ne corrèlent pas avec la performance réelle en manipulation ou en suivi d'instructions. Autrement dit, un modèle peut produire des vidéos visuellement cohérentes tout en étant inutilisable pour le contrôle d'un bras robotique. En transposant la logique du post-entraînement par récompense, inspirée du RLHF appliqué aux LLM, aux world models vidéo, RoboAlign-R1 propose une voie pour aligner simulation et tâche réelle. Pour les équipes qui utilisent ces modèles comme simulateurs de planification ou générateurs de données synthétiques, l'évaluation multi-dimensionnelle de RoboAlign-Judge pourrait devenir un protocole de référence, à condition que le benchmark soit publié et reproductible. Cette publication s'inscrit dans une dynamique plus large d'application des techniques d'alignement (post-training, distillation, RL) à la robotique incarnée, un domaine où des travaux comme UniSim, GROOT de NVIDIA ou IRASim ont posé les bases des world models vidéo. Le code et les données ne sont pas encore disponibles publiquement au moment de la publication, ce qui limite l'évaluation indépendante des résultats. La prochaine étape naturelle serait une validation sur robot physique en dehors du protocole in-domain utilisé ici, car les gains mesurés en simulation n'impliquent pas directement un transfert sim-to-real amélioré.

RechercheOpinion
1 source
FORMULA : MPC de formation avec apprentissage de barrières neuronales pour la garantie de sécurité
1739arXiv cs.RO 

FORMULA : MPC de formation avec apprentissage de barrières neuronales pour la garantie de sécurité

Une équipe de chercheurs propose FORMULA (FORmation MPC with neUral barrier Learning for safety Assurance), un framework de contrôle distribué pour systèmes multi-robots (MRS) publié sur arXiv (réf. 2604.04409v2). L'approche combine trois briques algorithmiques : du Model Predictive Control (MPC) pour la planification prédictive, des Control Lyapunov Functions (CLFs) pour garantir la stabilité de la formation, et des Control Barrier Functions (CBFs) implémentées sous forme de réseaux de neurones pour assurer la sécurité de manière décentralisée. L'objectif est de permettre à une flotte de robots de naviguer en formation dans des environnements encombrés et dynamiques, sans conception manuelle des contraintes de sécurité. Les résultats présentés sont issus de simulations uniquement ; aucun déploiement matériel n'est rapporté à ce stade. Le verrou technique adressé est réel : les approches MPC classiques pour la formation multi-robots peinent à passer à l'échelle, tandis que les CBFs, pourtant fondées mathématiquement pour l'enforcement de sécurité, sont difficiles à concevoir à la main pour des systèmes non-linéaires complexes. FORMULA automatise cette conception via l'apprentissage, ce qui réduit la charge de calcul en ligne et permet de résoudre les situations de blocage (deadlocks) en configuration dense. Pour un intégrateur ou un COO industriel, c'est le type de brique qui conditionne le passage de pilotes en cellule à des déploiements flotte réelle dans des entrepôts ou sur des sites logistiques. La formation en robotique mobile est un problème ouvert depuis les années 2000, et les approches MPC centralisées ont longtemps buté sur la scalabilité. Le contexte applicatif visé -- logistique entrepôt, transport de matériaux, réponse aux catastrophes -- est précisément celui où des acteurs comme Exotec (France) ou Locus Robotics opèrent avec des flottes d'AMR (Autonomous Mobile Robots) sans formation rigide. FORMULA se positionne donc sur un créneau de contrôle coordonné plus contraignant que les AMR classiques. La limite principale reste l'absence de validation sur hardware réel : le gap sim-to-real pour les CBFs neuronales, notamment en présence de bruit de capteurs et de latences réseau, n'est pas adressé dans ce preprint.

UESi les résultats se confirment sur hardware réel, des acteurs européens de la logistique robotisée (dont Exotec en France) pourraient intégrer ce type de brique de contrôle coordonné pour des flottes d'AMR en environnements denses, mais l'impact reste conditionnel à la validation sim-to-real.

RecherchePaper
1 source
Commande par échantillonnage via le transport optimal à régularisation entropique
1740arXiv cs.RO 

Commande par échantillonnage via le transport optimal à régularisation entropique

Une équipe de chercheurs a publié en mai 2026, sous la référence arXiv:2605.02147, un algorithme de contrôle prédictif par échantillonnage appelé OT-MPC. La méthode repose sur une formulation par transport optimal à régularisation entropique et cible les systèmes robotiques non linéaires nécessitant un contrôle temps réel : navigation autonome, manipulation d'objets et locomotion. Les mises à jour sont calculées en forme close via l'algorithme de Sinkhorn, sans aucun gradient, ce qui permet de traiter des dynamiques discontinues que les optimiseurs classiques basés sur la rétropropagation ne peuvent pas gérer. Les expériences rapportées montrent des taux de succès supérieurs aux méthodes de référence sur l'ensemble des trois catégories de tâches, bien que les chiffres absolus et les benchmarks précis ne soient pas détaillés dans l'abstract publié. L'intérêt pratique réside dans la résolution d'un problème structurel des deux algorithmes dominants du secteur, MPPI (Model Predictive Path Integral) et CEM (Cross-Entropy Method) : le comportement dit de "mode-averaging", où la mise à jour vers la moyenne pondérée des trajectoires candidates produit des solutions sous-optimales lorsque le paysage de coût est multimodal ou fortement non convexe. OT-MPC calcule un couplage optimal entre les séquences de contrôle candidates et les propositions à faible coût, coordonnant les mises à jour sur l'ensemble de l'échantillon pour préserver la couverture de l'espace des solutions tout en affinant chaque candidat vers ses voisins prometteurs. Pour un intégrateur ou un responsable technique, cela se traduit concrètement par une meilleure robustesse lors de transitions de contact, de saisies imprécises ou de mouvements en environnement encombré, sans surcoût de calcul différenciable. MPPI, développé initialement par Georgia Tech et popularisé par des frameworks comme Storm d'NVIDIA, et CEM, utilisé notamment dans les pipelines de planification de Boston Dynamics et de divers labos universitaires, sont aujourd'hui les deux références incontournables du contrôle par échantillonnage. Le transport optimal, formalisé dans un cadre robotique par des travaux antérieurs en imitation et en apprentissage de politiques, trouve ici une application directe au MPC sans nécessiter d'apprentissage préalable. OT-MPC reste à ce stade une contribution académique, sans déploiement annoncé ni partenariat industriel mentionné ; des validations sur hardware réel et des comparaisons de temps de cycle sur cibles embarquées constitueraient les prochaines étapes naturelles avant toute intégration produit.

RecherchePaper
1 source
Robo3R : amélioration de la manipulation robotique par reconstruction 3D précise en avance de phase
1741arXiv cs.RO 

Robo3R : amélioration de la manipulation robotique par reconstruction 3D précise en avance de phase

Robo3R est un modèle de reconstruction 3D présenté dans un preprint arXiv (2502.10101) qui vise à remplacer les capteurs de profondeur classiques dans les pipelines de manipulation robotique. Le système prend en entrée des images RGB et les états du robot, et prédit en temps réel la géométrie de la scène à l'échelle métrique, sans recours à un capteur ToF, LiDAR ou stéréo. Robo3R combine une tête de points masquée (masked point head) pour des nuages de points précis, et une formulation Perspective-n-Point (PnP) basée sur des keypoints pour aligner les poses de caméra dans un référentiel canonique robot. Le modèle a été entraîné sur Robo3R-4M, un dataset synthétique de 4 millions de frames annotées haute fidélité. Les auteurs rapportent des gains constants sur plusieurs tâches aval : imitation learning, transfert sim-to-real, synthèse de saisies (grasp synthesis) et planification de trajectoire sans collision. L'intérêt pratique est direct pour les intégrateurs : les capteurs de profondeur actuels (caméras stéréo, ToF, LiDAR structuré) présentent des limites bien documentées sur les surfaces réfléchissantes, transparentes ou sombres, et leur calibration reste coûteuse. Un module RGB-only à l'échelle métrique et en temps réel réduirait la dépendance au hardware de sensing. Les gains sur le transfert sim-to-real sont particulièrement significatifs : c'est précisément là que les politiques de manipulation, qu'il s'agisse d'ACT, de Diffusion Policy ou des VLA récents, perdent en robustesse lors du déploiement. Que Robo3R améliore cette étape charnière suggère qu'un meilleur module perceptif en entrée peut compenser une partie du reality gap sans toucher à l'architecture de la politique. Ce travail s'inscrit dans une dynamique de recherche active autour de la reconstruction 3D dense depuis le RGB, dominée ces deux dernières années par DUSt3R et MASt3R, développés par Naver Labs Europe à Grenoble, ainsi que par UniDepth et Depth Pro. Robo3R se différencie en ciblant explicitement les contraintes de la manipulation : précision métrique, cohérence du référentiel robot et latence compatible avec le contrôle en boucle fermée. Le dataset synthétique Robo3R-4M, bien que large, soulève la question classique du domaine gap entre simulation et réel, même si les résultats rapportés sur des tâches physiques restent positifs. Il s'agit pour l'instant d'un preprint non encore évalué par les pairs; une soumission à ICRA, CVPR ou RSS, couplée à une validation sur des plateformes robotiques variées au-delà des benchmarks internes, constituerait la prochaine étape naturelle.

UELes modèles DUSt3R et MASt3R développés par Naver Labs Europe à Grenoble constituent la référence comparative directe de Robo3R, signalant que la recherche européenne reste en pointe sur la reconstruction 3D dense appliquée à la manipulation robotique.

RecherchePaper
1 source
Filtre de Kalman neuronal à mécanisme d'attention pour l'estimation d'état des robots à pattes
1742arXiv cs.RO 

Filtre de Kalman neuronal à mécanisme d'attention pour l'estimation d'état des robots à pattes

Une équipe de chercheurs a publié sur arXiv (2601.18569v2) un filtre hybride baptisé AttenNKF (Attention-Based Neural-Augmented Kalman Filter), conçu pour améliorer l'estimation d'état sur les robots à pattes. Le glissement de pied constitue la principale source d'erreur dans ces systèmes : lorsqu'un pied glisse sur une surface, la mesure cinématique viole l'hypothèse de non-glissement et injecte un biais dans l'étape de mise à jour du filtre, dégradant l'estimation de position, vitesse et orientation. La solution augmente un InEKF (Invariant Extended Kalman Filter) avec un compensateur neuronal à mécanisme d'attention, qui infère l'erreur induite par le glissement en fonction de sa sévérité et l'applique en correction post-mise-à-jour sur l'état du filtre. Ce compensateur est entraîné dans un espace latent pour réduire la sensibilité aux échelles brutes des entrées et encourager des corrections structurées, tout en préservant la récursion mathématique de l'InEKF. L'enjeu est concret pour les équipes de locomotion et les intégrateurs industriels : l'estimation d'état est la brique fondamentale du contrôle d'un robot à pattes, et une erreur non corrigée se propage dans la boucle de contrôle jusqu'à provoquer des chutes ou des trajectoires aberrantes, notamment sur sols glissants, rampes ou surfaces variables en environnement d'usine. L'approche hybride filtres classiques plus réseau de neurones léger préserve les garanties mathématiques de l'InEKF tout en ajoutant une adaptabilité aux conditions non modélisées, sans reformuler entièrement le pipeline d'estimation. Les expériences montrent des performances supérieures aux estimateurs existants sous conditions de glissement, bien que les plateformes hardware testées ne soient pas précisées dans la version publiée, ce qui limite l'évaluation comparative. L'InEKF s'est imposé comme référence pour les robots à pattes grâce à des travaux de l'Université du Michigan vers 2019-2020 sur le bipède Cassie d'Agility Robotics, exploitant son invariance aux symétries de groupe de Lie. L'augmentation par réseaux neuronaux pour corriger les non-linéarités résiduelles est une direction active chez plusieurs groupes de recherche, dont ETH Zurich sur ANYmal, MIT et Carnegie Mellon. Les déploiements réels de Spot (Boston Dynamics), Digit (Agility Robotics) et Figure 02 font tous face au problème d'estimation sous glissement en conditions industrielles, ce qui donne à cette approche une pertinence directe pour le transfert sim-to-real vers des systèmes commerciaux. La prochaine étape naturelle sera une validation embarquée sous contraintes temps-réel sur des plateformes standardisées avec benchmarks publics.

RecherchePaper
1 source
Prise de décision enrichie par la causalité pour robots mobiles autonomes en environnements dynamiques
1743arXiv cs.RO 

Prise de décision enrichie par la causalité pour robots mobiles autonomes en environnements dynamiques

Des chercheurs ont publié sur arXiv (ref. 2504.11901, cinquième version) un framework de prise de décision basé sur l'inférence causale pour les robots mobiles autonomes (AMR) évoluant dans des environnements partagés avec des humains. Plutôt que de s'appuyer uniquement sur des corrélations statistiques, leur système apprend un modèle causal explicite des dynamiques d'environnement, notamment l'estimation de la consommation batterie et les risques d'obstruction par des passants, pour décider quand et comment exécuter une tâche. Pour valider leur approche, l'équipe a développé PeopleFlow, un simulateur basé sur Gazebo capable de générer des trajectoires réalistes de multiples agents (humains et robots) en tenant compte de facteurs contextuels comme l'heure, la configuration spatiale et l'état du robot. Le cas d'usage principal est un entrepôt en activité partagée, benchmark face à une baseline non-causale classique. L'apport principal est de déplacer la logique de décision de la corrélation vers la causalité, une distinction non triviale en robotique opérationnelle. Là où un système standard détecte qu'il y a "souvent du monde à 14h dans l'allée B" et l'évite, un modèle causal comprend pourquoi, ce qui lui permet d'anticiper des situations nouvelles et de planifier la minuterie d'une tâche logistique en conséquence. Pour un COO gérant une flotte d'AMR dans un entrepôt mutualisé avec des préparateurs de commandes, cela se traduit potentiellement par moins d'arrêts non planifiés, une meilleure gestion de la charge batterie, et une cohabitation plus fluide. Il convient toutefois de noter que les résultats présentés sont exclusivement issus de simulation, sans validation terrain, ce qui constitue une limite importante à ce stade. Ce travail s'inscrit dans un contexte de déploiement croissant d'AMR dans des espaces mixtes, des entrepôts e-commerce aux hôpitaux, où des acteurs comme MiR (Teradyne), Locus Robotics ou le français Exotec font face à des défis de navigation sociale de plus en plus complexes. La recherche en planification causale reste largement académique, mais elle trace une voie complémentaire aux approches par apprentissage par renforcement ou par règles explicites. La prochaine étape logique serait une validation sur robot physique en environnement réel, un passage sim-to-real que l'article n'adresse pas encore.

UELes opérateurs français d'AMR comme Exotec, confrontés à la navigation en entrepôts partagés avec des préparateurs humains, sont le public cible naturel de ce framework, mais l'absence de validation terrain limite l'applicabilité immédiate.

RecherchePaper
1 source
ImagineNav++ : piloter des modèles vision-langage comme navigateurs incarnés par imagination de scènes
1744arXiv cs.RO 

ImagineNav++ : piloter des modèles vision-langage comme navigateurs incarnés par imagination de scènes

Une équipe de chercheurs a publié ImagineNav++ (arXiv:2512.17435, décembre 2024, version 3 en mai 2025), un système de navigation visuelle pour robots d'assistance domestique fonctionnant sans carte préalable, à partir d'un flux RGB ou RGB-D embarqué uniquement. Plutôt que de planifier en texte pur comme les agents LLM classiques, le système génère des images futures depuis des positions candidates du robot, puis soumet ces vues synthétiques à un modèle vision-langage (VLM) qui sélectionne la trajectoire la plus prometteuse. Deux composants structurent l'approche : un module d'imagination de vues futures entraîné sur des préférences de navigation humaine pour produire des points de vue à fort potentiel exploratoire, et un mécanisme de mémoire par fovéation sélective (sparse-to-dense) maintenant la cohérence spatiale sur de longues séquences. Sur les benchmarks open-vocabulary d'object navigation et d'instance navigation, ImagineNav++ atteint l'état de l'art en configuration sans carte, surpassant la majorité des méthodes basées sur des cartes explicites. Ce résultat remet en question une hypothèse structurante du domaine : que la navigation autonome en intérieur requiert impérativement une cartographie préalable (SLAM, occupancy maps). Si des VLMs peuvent raisonner spatialement à partir de flux visuels bruts, le pipeline de déploiement se simplifie considérablement pour les intégrateurs d'AMR et de robots d'assistance en environnements non structurés comme des logements ou des établissements de soins. La reformulation du problème comme sélection de meilleure vue est aussi une contribution méthodologique notable : elle rend le raisonnement spatial interprétable et compatible avec les interfaces VLM standard, sans nécessiter d'architecture spécialisée coûteuse. Ce travail prolonge une séquence de recherches cherchant à dépasser les LLM de navigation purement textuels, dont SayNav et LM-Nav, en y intégrant une perception visuelle fine. Les concurrents directs sont les méthodes map-based via SLAM et les approches hybrides récentes comme ESC ou CoW. Architecturalement, ImagineNav++ se rapproche des paradigmes VLA (Vision-Language-Action) explorés par des équipes chez Google DeepMind, Physical Intelligence (pi-0) ou dans le cadre de GR00T N2 chez NVIDIA. Aucun déploiement industriel n'est annoncé à ce stade : il s'agit d'une publication académique évaluée sur simulateurs et benchmarks standardisés, dont la généralisation en conditions réelles reste à valider.

IA physiqueOpinion
1 source
HiPAN : navigation hiérarchique adaptative à la posture pour robots quadrupèdes en environnements 3D non structurés
1745arXiv cs.RO 

HiPAN : navigation hiérarchique adaptative à la posture pour robots quadrupèdes en environnements 3D non structurés

Des chercheurs proposent HiPAN (Hierarchical Posture-Adaptive Navigation), un framework de navigation pour robots quadrupèdes en environnements tridimensionnels non structurés, publié en préprint sur arXiv en avril 2026 (arXiv:2604.26504). L'architecture est hiérarchique : une politique de haut niveau génère des commandes de navigation (vitesse planaire et posture du corps), exécutées par un contrôleur de locomotion adaptatif de bas niveau. Le système opère directement sur des images de profondeur embarquées, sans pipeline de cartographie-planification préalable. Pour contrer les comportements myopes et étendre l'horizon de navigation, les auteurs introduisent le Path-Guided Curriculum Learning, qui entraîne progressivement la politique de l'évitement réactif jusqu'à la navigation stratégique longue distance. Les expériences couvrent simulations et environnements réels, incluant passages étroits et espaces à faible hauteur libre. Les résultats affichent des taux de réussite et une efficacité de trajectoire supérieurs aux planificateurs réactifs classiques et aux baselines end-to-end. L'intérêt pratique est double : le système tourne sur des plateformes à ressources contraintes, rendant la navigation autonome accessible sans GPU dédié sur des quadrupèdes comme l'Unitree B2 ou l'ANYmal C d'ANYbotics ; l'adaptation dynamique de posture ouvre par ailleurs des cas d'usage concrets en inspection industrielle, gestion de sinistres et exploration de bâtiments dégradés. L'approche contourne l'accumulation d'erreurs de perception inhérente aux pipelines SLAM-planification, un point de friction persistant dans les déploiements réels de quadrupèdes autonomes. La navigation sans carte dans des espaces tridimensionnels contraints reste l'un des verrous majeurs du secteur. Les approches dominantes s'appuient sur SLAM (simultaneous localization and mapping) couplé à un planificateur de trajectoire, au prix d'une latence élevée et d'une sensibilité aux erreurs cumulées. HiPAN s'inscrit dans un courant de recherche qui substitue des politiques apprises par renforcement hiérarchique à ces pipelines, en parallèle de travaux issus du groupe Hutter à ETH Zurich (ANYbotics) ou des laboratoires de locomotion de Carnegie Mellon et UC Berkeley. Il s'agit d'un préprint non encore soumis à peer review, sans partenaire industriel ni calendrier de déploiement annoncé. La prochaine étape critique sera de valider la robustesse hors distribution sur terrains déformables et face à des obstructions dynamiques, conditions que les benchmarks en simulation ne couvrent qu'imparfaitement.

RecherchePaper
1 source
Génération 3D pour l'IA incarnée et la simulation robotique : une synthèse
1746arXiv cs.RO 

Génération 3D pour l'IA incarnée et la simulation robotique : une synthèse

Une étude de synthèse publiée sur arXiv (2604.26509) propose le premier panorama systématique de la génération 3D appliquée à l'IA incarnée (embodied AI) et à la simulation robotique. Les auteurs organisent la littérature autour de trois rôles que joue la génération 3D dans les pipelines robotiques : la production d'assets de simulation (objets articulés, déformables, physiquement contraints), la construction d'environnements interactifs orientés tâche (génération de scènes avec conscience structurelle et capacités agentiques), et le pont sim-to-real, soit la reconstruction de jumeaux numériques, l'augmentation de données synthétiques et la génération de démonstrations pour l'apprentissage robot. Cette taxonomie en trois pôles structure un corpus jusqu'ici dispersé dans plusieurs sous-domaines cloisonnés. Le constat central est que le domaine bascule d'un objectif de réalisme visuel vers ce que les auteurs nomment l'"interaction readiness", soit la capacité d'un asset 3D à être utilisable dans une boucle de contrôle robot. Un objet généré peut être visuellement convaincant tout en étant physiquement invalide : masse incorrecte, articulations sans cohérence cinématique, propriétés de contact inexploitables. Les auteurs identifient quatre goulots d'étranglement concrets : la rareté des annotations physiques dans les datasets existants, l'écart entre qualité géométrique et validité physique, la fragmentation des protocoles d'évaluation (absence de benchmarks standardisés), et un sim-to-real divide qui reste ouvert malgré les progrès récents en diffusion 3D et 3D Gaussian Splatting. Cette publication s'inscrit dans l'accélération des modèles génératifs 3D que la communauté robotique cherche à exploiter pour alimenter des simulateurs comme NVIDIA Isaac ou Genesis. Créer manuellement des assets physiquement valides reste coûteux et lent ; la génération automatique promet de lever ce verrou, mais les compromis sur la validité physique freinent encore l'adoption à l'échelle industrielle. Google DeepMind, MIT CSAIL, CMU et plusieurs laboratoires académiques travaillent activement sur ce pipeline. La page projet associée (3dgen4robot.github.io) centralise la bibliographie de référence. La prochaine étape structurante pour le secteur sera la définition de benchmarks unifiés couvrant simultanément qualité géométrique, cohérence physique et performance en transfert sim-to-real, condition nécessaire pour que la génération 3D devienne une brique fiable de l'intelligence incarnée.

RecherchePaper
1 source
Planification VLA à horizon étendu par conditionnement sur traces
1747arXiv cs.RO 

Planification VLA à horizon étendu par conditionnement sur traces

Une équipe de chercheurs a publié en avril 2026 LoHo-Manip (arXiv:2604.21924), un cadre modulaire conçu pour étendre les politiques VLA (vision-language-action) aux tâches de manipulation longue durée. Le coeur du système repose sur une architecture découplée : un VLM gestionnaire de tâches et un VLA exécuteur distincts. Le gestionnaire opère selon un principe de planification à horizon glissant (receding-horizon) : à chaque étape, il prédit un plan résiduel combinant une séquence de sous-tâches avec une séparation explicite "fait / restant" comme mémoire légère en langage naturel, et une trace visuelle, une trajectoire 2D de points-clés indiquant au bras où se déplacer et quel objet approcher. L'exécuteur VLA est ensuite conditionné sur cette trace rendue pour produire ses commandes motrices. Les expériences couvrent la planification incarnée, le raisonnement longue portée, la prédiction de trajectoire et la manipulation bout-en-bout, à la fois en simulation et sur un robot Franka réel, avec des gains annoncés en taux de succès, robustesse et généralisation hors distribution. Les métriques précises ne sont pas communiquées dans le préprint. Ce qui distingue LoHo-Manip des approches VLA classiques, c'est le bouclage implicite sans logique de récupération codée en dur : lorsqu'une sous-tâche échoue, elle reste dans le plan résiduel prédit au pas suivant, et la trace visuelle se met à jour automatiquement. Les modèles VLA actuels comme pi0 (Physical Intelligence) ou OpenVLA peinent sur les séquences multi-étapes en raison de l'accumulation d'erreurs d'exécution ; LoHo-Manip traite ce problème en transformant la prise de décision longue portée en une série de contrôles locaux guidés par trace. Pour un intégrateur industriel, cela ouvre la voie à des chaînes de manipulation complexes (assemblage séquentiel, tri multi-objets) sans reprogrammation manuelle à chaque point de défaillance, ce que les approches purement symboliques ne permettent pas sans pipeline rigide. Le problème de la manipulation longue portée est un obstacle structurel de la robotique VLA depuis l'émergence des modèles fondationnels en action, notamment après les travaux RT-2 de Google DeepMind (2023) et pi0 de Physical Intelligence (2024). La plupart des solutions actuelles combinent un planificateur symbolique haut niveau avec des primitives de bas niveau, au prix d'une rigidité importante face aux perturbations. LoHo-Manip adopte une voie intermédiaire en ancrant le plan dans une modalité visuelle légère (la trace 2D) plutôt que dans des primitives figées, ce qui est comparable dans l'esprit aux travaux de trajecto-conditioned diffusion de chez Nvidia (GR00T) ou de Cobot Magic. Il s'agit pour l'instant d'un preprint non relu par les pairs, validé sur un seul robot académique (Franka 7 DOF), sans déploiement industriel ni pilote annoncé. Les prochaines étapes crédibles passeraient par une validation sur des manipulateurs à plus haute redondance et des environnements moins structurés.

IA physiqueOpinion
1 source
Estimation de la présence humaine par vision pour améliorer la sécurité et l'efficacité des AMR en entrepôt industriel
1748arXiv cs.RO 

Estimation de la présence humaine par vision pour améliorer la sécurité et l'efficacité des AMR en entrepôt industriel

Des chercheurs ont publié sur arXiv (référence 2604.18627) un système temps réel permettant à un robot mobile autonome (AMR) d'estimer, via une unique caméra RGB, si un opérateur humain à proximité a conscience de sa présence. La méthode combine deux modules : un estimateur de pose humaine 3D ("3D pose lifting") qui reconstruit la position du corps dans l'espace, et un module d'estimation d'orientation de la tête qui calcule le cône de vision du travailleur. Si l'humain est orienté vers le robot et se trouve dans ce cône, le système le catégorise comme "conscient de l'AMR" ; dans le cas contraire, le robot adopte un comportement de précaution. L'ensemble du pipeline a été validé sur données synthétiques dans NVIDIA Isaac Sim, sans validation sur environnement physique réel annoncée à ce stade. L'intérêt industriel de cette approche réside dans l'inefficacité chronique des systèmes actuels : les AMRs déployés aujourd'hui traitent tout humain comme un obstacle dynamique générique, ce qui entraîne des ralentissements ou détours systématiques, même lorsque l'opérateur a clairement vu le robot et s'est écarté de sa trajectoire. En distinguant les travailleurs attentifs des travailleurs inattentifs, le système permettrait théoriquement d'augmenter les cadences opérationnelles sans dégrader la sécurité. Pour les intégrateurs et les COO industriels, c'est une piste concrète pour réduire les temps de cycle dans des environnements à forte densité humaine. La validation reste cependant limitée à des données simulées, ce qui laisse entier le problème du sim-to-real gap pour les cas limites : occlusions partielles, éclairage variable, postures atypiques. Ce travail s'inscrit dans un contexte de forte croissance des flottes AMR dans la logistique mondiale, porté par des acteurs comme MiR (acquis par Teradyne), Locus Robotics, Geek+, ou côté français Exotec dont les robots Skypod évoluent dans des allées partagées avec des opérateurs humains. Les approches concurrentes misent généralement sur des systèmes LIDAR multicouche ou des zones de sécurité paramétrables conformes à la norme ISO 3691-4, sans modélisation explicite de l'attention humaine. La prochaine étape naturelle serait une validation sur données réelles et une intégration dans une stack de navigation type ROS 2 Nav2, mais ni timeline ni partenariat industriel ne sont mentionnés dans ce preprint.

UEDirectement pertinent pour Exotec (Skypod) qui opère des flottes AMR en allées partagées avec des opérateurs, mais aucune collaboration ni validation sur environnement réel n'est annoncée à ce stade.

IndustrielPaper
1 source
Actionnement par multiplexage temporel dans les bras à tendons : conception légère et tolérance aux pannes
1749arXiv cs.RO 

Actionnement par multiplexage temporel dans les bras à tendons : conception légère et tolérance aux pannes

Des chercheurs ont publié sur arXiv (référence 2504.16887) une architecture d'actionnement inédite pour bras robotiques à tendons, baptisée Time-Division Multiplexing Actuation (TDMA). Le principe emprunte au multiplexage temporel des télécommunications : plutôt que d'allouer un actionneur par degré de liberté, un seul groupe de moteurs commute séquentiellement entre les tendons via des embrayages électromagnétiques à engagement rapide, inférieurs à 0,1 seconde. Le prototype résultant, appelé MuxArm, affiche une masse propre de 2,17 kg pour une capacité de charge utile de 10 kg, soit un ratio payload/poids de structure supérieur à 4,6. La précision en bout d'effecteur est maintenue à 1 % de la longueur du bras, y compris en cas de défaillance partielle d'un servomoteur. Un réducteur à vis sans fin assure le maintien de charge en coupure d'alimentation (self-locking), et un double encodeur garantit la précision de positionnement sur le long terme. Des tests ont été conduits en espace libre, en environnement encombré et en espace confiné. Le TDMA s'attaque à un arbitrage fondamental des bras légers à tendons : réduire la masse embarquée oblige généralement à réduire le nombre d'actionneurs, ce qui compromet redondance et tolérance aux pannes. Ici, la mutualisation temporelle des moteurs permet de conserver un couple élevé tout en réduisant la charge sur les tendons jusqu'à 50 % par rapport aux méthodes conventionnelles, grâce à un algorithme de planification trajectoire en espace d'actionnement. Pour les intégrateurs industriels et les agences spatiales, c'est un argument sérieux : un bras pouvant continuer à opérer après une panne de servo partielle, sans masse supplémentaire, répond directement aux contraintes des environnements inaccessibles (orbite, inspection sous-marine, démantèlement nucléaire). Il reste à qualifier cette tolérance aux pannes sur des cycles longs et sous vibrations réelles, deux paramètres absents du papier. Le TDMA s'inscrit dans un courant de recherche sur les architectures d'actionnement à faible redondance physique, en complément des travaux sur les muscles artificiels pneumatiques (soft robotics) et les transmissions à câble tendus à moteurs déportés, popularisés par des bras comme le Kinova Gen3 ou les manipulateurs de l'ESA. La tendance de fond est de repousser la masse vers le bâti plutôt que vers les segments distaux, comme le fait aussi le projet Wandercraft sur ses exosquelettes. Ce travail, issu d'un laboratoire dont l'affiliation institutionnelle n'est pas précisée dans le préprint, n'est pour l'instant qu'une démonstration expérimentale : aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné.

RecherchePaper
1 source
GIST : extraction de connaissances multimodales et ancrage spatial par topologie sémantique intelligente
1750arXiv cs.RO 

GIST : extraction de connaissances multimodales et ancrage spatial par topologie sémantique intelligente

Des chercheurs ont publié GIST (Grounded Intelligent Semantic Topology), un pipeline de traitement multimodal capable de transformer un nuage de points 3D capturé avec un équipement grand public en une carte de navigation sémantiquement annotée. Le système construit d'abord une carte d'occupation 2D, en extrait la topologie spatiale, puis y superpose une couche sémantique légère par sélection intelligente de keyframes. Quatre modules sont démontrés en aval : un moteur de recherche sémantique capable d'inférer des alternatives catégorielles quand la correspondance exacte échoue, un localisateur one-shot atteignant 1,04 mètre d'erreur de translation moyenne (top-5), un classificateur de zones segmentant le plan de sol en régions sémantiques de haut niveau, et un générateur d'instructions de navigation en langage naturel ancré visuellement dans des repères contextuels. Une évaluation in situ sur cinq participants affiche un taux de succès de navigation de 80 % en s'appuyant uniquement sur des instructions verbales. L'intérêt pour les intégrateurs industriels réside dans l'approche bas coût : GIST ne requiert pas de LiDAR haute précision, mais exploite un nuage de points mobile grand public, ce qui abaisse significativement le seuil d'entrée pour des déploiements en entrepôt, hôpital ou grande surface. La robustesse à la distribution longue des sémantiques visuelles, problème classique dans les environnements retail denses où les rayonnages changent fréquemment, est explicitement adressée, là où les VLMs (Vision-Language Models) courants échouent sur le grounding spatial en environnement encombré. Cela dit, l'évaluation reste exploratoire (N=5), et les résultats ne constituent pas une validation à l'échelle industrielle. Le papier s'inscrit dans un courant de recherche actif autour de la navigation sémantique pour l'IA incarnée, en concurrence directe avec des approches comme les semantic maps dérivées de NeRF ou les pipelines SLAM enrichis par LLM. Côté Europe, des acteurs comme Enchanted Tools (robots hospitaliers) ou Exotec (systèmes AMR pour entrepôts) pourraient trouver dans ce type de représentation topologique une brique utile pour la localisation fine et la génération d'instructions opérateur. L'article est disponible en preprint sur arXiv (2604.15495) et n'a pas encore été soumis à évaluation par les pairs au moment de sa publication.

UEDes acteurs français comme Enchanted Tools (robots hospitaliers) et Exotec (AMR entrepôts) pourraient exploiter ce type de cartographie sémantique bas coût pour améliorer la localisation fine et la génération d'instructions opérateur, sans investissement LiDAR haute précision.

RecherchePaper
1 source