Aller au contenu principal

Dossier arXiv cs.RO — page 32

2842 articles · page 32 sur 57

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

Reflex : contrôle VLA en temps réel par inférence en continu
1551arXiv cs.RO IA physiqueActu

Reflex : contrôle VLA en temps réel par inférence en continu

Des chercheurs présentent Reflex, un framework permettant l'inférence en temps réel pour les modèles Vision-Language-Action (VLA) basés sur le flow matching, une technique de contrôle continu prisée pour sa précision mais jusqu'ici incompatible avec la robotique temps réel. Le problème identifié est structurel : l'injection globale du timestep dans le processus de débruitage itératif invalide le KV-caching classique, obligeant à choisir entre un recalcul coûteux en O(N²) ou une réutilisation de cache mathématiquement incorrecte. Reflex exploite ce que les auteurs nomment la "Timestep-Invariance Property", le fait que les encodeurs de perception fonctionnent indépendamment de la boucle de débruitage, pour partitionner le contexte d'attention en régions statique, glissante et dynamique, permettant des mises à jour de cache incrémentales en O(1) sans perte de précision sur les sorties d'attention. Une couche de normalisation adaptative baptisée AdaRMSNorm évite l'effondrement numérique en BFloat16 lors d'inférences continues à haute fréquence, en se calant sur la phase du flux. Un pipeline asynchrone découple encodage visuel et génération d'action, complété par de la fusion d'opérateurs pour réduire l'overhead des kernels. Sur les benchmarks LIBERO et Kinetix, Reflex atteint une accélération d'inférence de 2,58x et un streaming stable à 50Hz, avec une latence de réaction réduite jusqu'à 54%, sans dégradation de performance. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement rarement discuté publiquement : les modèles VLA à flow matching, malgré leurs résultats impressionnants en démonstration, peinent à tourner en boucle fermée à des fréquences compatibles avec un contrôle robotique réactif. Un déploiement stable à 50Hz sans compromis sur la qualité change la donne pour les intégrateurs qui cherchent à faire tourner ces politiques sur du matériel embarqué à budget de calcul limité, plutôt que de dépendre d'un GPU distant surdimensionné. C'est aussi une réponse concrète à l'écart fréquemment pointé entre les métriques de benchmark et la viabilité en conditions réelles de contrôle continu. Ce travail s'inscrit dans la lignée des politiques VLA à diffusion ou flow matching comme Pi-0 ou GR00T N2, qui ont démontré la faisabilité du contrôle continu appris mais restent contraintes par leur coût d'inférence. Reflex ne propose pas un nouveau modèle mais une couche d'infrastructure d'inférence, potentiellement transférable à d'autres architectures de flow matching. Publié sur arXiv (2607.14695), l'article ouvre la voie à des évaluations sur du matériel physique réel, au-delà des environnements simulés LIBERO et Kinetix utilisés pour la validation actuelle.

1 source
« Attraper, lancer, recommencer : la planification d'un robot partenaire de jonglage »
1552arXiv cs.RO 

« Attraper, lancer, recommencer : la planification d'un robot partenaire de jonglage »

Kai Ploeger et son équipe publient un article intitulé « Catch, Throw, Repeat: Planning for Human-Robot Partner Juggling » (arXiv:2607.15129), qui décrit une architecture de planification et de contrôle en temps réel permettant à un robot de rattraper et relancer des balles en synchronisation avec un partenaire humain, dans des figures de jonglage à plusieurs balles. Le système combine un suivi prédictif de trajectoire de balle, une optimisation de trajectoire en ligne adaptative basée sur une formulation multiple-shooting, et une logique de coordination pilotée par machine à états. Lors d'une étude utilisateur menée avec huit participants de niveaux variés, du débutant à l'expert, sur des sessions de test de 10 minutes, le robot est parvenu à maintenir des cascades à trois balles partagées avec l'humain. Tous les participants ont dépassé les meilleurs résultats précédemment publiés : l'un d'eux a porté le record de cascade partagée à trois balles à 20 rattrapages consécutifs du robot, soit cinq fois le précédent record, tandis qu'un autre a atteint un taux de réussite de 100% avec 40 rattrapages consécutifs en configuration lancer-rattraper à une seule balle. Une vidéo de démonstration est disponible sur kai-ploeger.com/partner-juggling. Ce résultat marque une avancée notable pour l'interaction physique homme-robot en contexte dynamique et riche en contacts, un registre bien plus exigeant que la manipulation statique ou le pick-and-place classique. Le jonglage partenaire impose une coordination temps réel sous incertitude de perception, de timing et de mouvement humain variable, ce qui en fait un banc d'essai pertinent pour l'autonomie partagée et la réactivité robotique. Multiplier par cinq un record antérieur sur un nombre aussi restreint de participants et de temps d'essai suggère que l'architecture proposée généralise mieux aux variations de style humain que les approches précédentes, plutôt qu'elle ne dépend d'un partenaire entraîné spécifiquement au système. Le jonglage robot-humain reste un problème de recherche de niche mais sert de démonstrateur pour des briques technologiques transférables : suivi prédictif d'objets en vol, replanification de trajectoire à haute fréquence, et logique de coordination robuste à l'incertitude temporelle, des composants directement pertinents pour la manipulation dynamique en robotique industrielle et collaborative au sens large.

RecherchePaper
1 source
Adaptation Adaptative de Robots à Articulations Flexibles Contrôlées en Position Moteur, avec Rigidité d'Articulation Incertaine
1553arXiv cs.RO 

Adaptation Adaptative de Robots à Articulations Flexibles Contrôlées en Position Moteur, avec Rigidité d'Articulation Incertaine

Une équipe de chercheurs propose une nouvelle approche de commande adaptative pour les robots à articulations flexibles pilotés en position moteur, publiée sur arXiv (2607.14177). Le problème visé est concret pour l'industrie robotique : la commande basée modèle de ces systèmes suppose une connaissance précise de la relation couple-déflexion (raideur) de chaque articulation élastique, mais cette caractéristique varie en pratique selon les conditions de fonctionnement et se dégrade lentement avec l'usure et le vieillissement des éléments élastiques physiques. La méthode proposée met à jour en continu une estimation de cette relation couple-déflexion non linéaire et incertaine, articulation par articulation. Contrairement aux approches classiques de commande adaptative conçues pour des robots rigides, les auteurs s'appuient sur une loi de commande implicite couplée à une matrice de régression dépendante de l'entrée de commande, spécifiquement pensée pour gérer l'incertitude sur la raideur. L'approche a été testée expérimentalement sur une articulation flexible présentant des caractéristiques de raideur non linéaires, avec une analyse de robustesse face aux erreurs induites par le contrôleur de position moteur. L'enjeu dépasse la seule prouesse académique. Les articulations élastiques (via actionneurs série-élastiques ou éléments compliants) équipent de plus en plus de robots collaboratifs, d'exosquelettes et de systèmes de locomotion, précisément parce qu'elles apportent sécurité d'interaction et absorption des chocs. Mais cette compliance a un coût : la précision du contrôle en couple dépend d'un modèle de raideur fiable, difficile à maintenir en production sur la durée de vie d'un robot industriel. Une méthode capable de s'adapter automatiquement au vieillissement des composants élastiques, sans recalibration manuelle répétée, réduirait un point de friction réel pour les intégrateurs qui déploient des robots compliants en environnement industriel, en particulier ceux nécessitant un contrôle de force fin et durable. Ce travail s'inscrit dans un champ de recherche plus large sur la commande adaptative en robotique, historiquement développée pour des manipulateurs rigides où l'incertitude porte sur la masse ou l'inertie plutôt que sur l'élasticité. L'extension aux robots à articulations flexibles est plus complexe en raison du couplage dynamique entre moteur et charge à travers l'élément élastique. Les auteurs ne précisent pas d'application industrielle ni de partenaire commercial dans le résumé : il s'agit à ce stade d'une validation expérimentale sur banc de test, dont la suite logique serait une extension à des architectures multi-articulations et une comparaison directe avec les méthodes de commande adaptative existantes pour robots rigides.

RecherchePaper
1 source
Sécurité de nuit VLA : détecter l'invisible grâce à des modèles vision-langage-action à perception thermique pour la manipulation critique
1554arXiv cs.RO 

Sécurité de nuit VLA : détecter l'invisible grâce à des modèles vision-langage-action à perception thermique pour la manipulation critique

Des chercheurs présentent Safe-Night VLA, un framework de manipulation robotique qui ajoute la perception thermique infrarouge longue longueur d'onde à un modèle vision-langage-action (VLA) pré-entraîné, publié en version corrigée sur arXiv (2603.05754v2). Contrairement aux VLA classiques qui reposent uniquement sur des caméras RGB, ce système fait remonter un raisonnement sémantique fondé sur les propriétés thermodynamiques des objets et des surfaces, ce qui lui permet de percevoir des signaux invisibles pour une caméra couleur standard. Pour limiter la fragilité connue des politiques génératives face à des scénarios hors distribution d'entraînement, les auteurs ajoutent un filtre de sécurité basé sur des fonctions de barrière de contrôle (control barrier functions), garantissant un respect déterministe des contraintes de l'espace de travail pendant l'exécution. Les tests ont été menés sur un bras manipulateur Franka, avec un protocole d'évaluation inédit combinant manipulation conditionnée par la température, localisation de cibles sous une surface opaque, et désambiguïsation de reflets visuels. Résultat annoncé: le système surpasse les baselines RGB seules sur ces trois tâches, tout en maintenant l'exécution sous contrainte de sécurité. L'intérêt pour l'industrie tient moins à la démo qu'au principe qu'elle teste: peut-on faire dire à un modèle fondation pré-entraîné sur du RGB des choses pertinentes sur une modalité physique qu'il n'a jamais vue à l'entraînement, simplement en injectant un flux thermique dans son backbone vision-langage. Si ce principe se généralise, cela ouvre la voie à des VLA capables de manipuler dans le noir, de détecter des objets chauds ou cachés sous une surface, ou de distinguer un vrai objet d'un reflet trompeur, des cas d'usage utiles en logistique nocturne, en environnements industriels à faible visibilité ou en inspection. L'ajout d'un filtre de sécurité formel plutôt que purement appris répond aussi à une critique récurrente des politiques VLA end-to-end: l'absence de garanties dures sur les collisions ou les dépassements de zone de travail, un point sensible pour tout déploiement en environnement partagé avec des humains. Le travail s'inscrit dans la vague actuelle des VLA généralistes (type GR00T N2, Pi-0, Helix) qui cherchent à étendre la perception au-delà du RGB pour combler l'écart entre démonstrations en laboratoire et robustesse réelle. Il reste à ce stade une validation académique sur un seul bras fixe en conditions contrôlées, sans indication de déploiement industriel ni de partenaire commercial, et les auteurs eux-mêmes ne revendiquent qu'une preuve de concept sur l'exploitation de modalités physiques non visibles.

RecherchePaper
1 source
DiMaS : mise en correspondance des distributions pour piloter les modèles vision-langage-action
1555arXiv cs.RO 

DiMaS : mise en correspondance des distributions pour piloter les modèles vision-langage-action

Des chercheurs presentent DiMaS (Distribution-Matching Steering), une methode pour orienter finement le comportement des modeles vision-langage-action (VLA) bases sur le flow matching, sans reentrainement complet. Publie sur arXiv sous la reference 2607.14280, le travail s'attaque a un manque identifie dans le controle comportemental fin des robots: la capacite d'intervenir directement sur les representations internes d'un modele pour modifier la maniere dont il execute une tache. Le "representation steering" est un outil deja bien etabli en interpretabilite pour les grands modeles de langage et les modeles vision-langage, ou les traits comportementaux s'encodent generalement comme des directions lineaires dans l'espace latent. Les auteurs montrent que ces methodes classiques echouent sur les VLA. DiMaS remplace le simple decalage le long d'une direction fixe par un transport entre distributions de representations, et l'equipe demontre son efficacite sur deux VLA de pointe non nommes dans le resume. Elle etudie aussi la generalisation de la methode a mesure que les taches d'apprentissage et d'evaluation divergent, en cartographiant ou le controle comportemental se transfere et ou il s'affaiblit. Code et resultats, avec des videos de demonstration, sont disponibles publiquement sur GitHub (pegah-kh/dimas) et sur une page projet dediee. Pour les equipes qui developpent ou integrent des politiques robotiques generatives, cette avancee ouvre une piste de personnalisation fine et peu couteuse: ajuster un comportement (prudence, vitesse d'execution, style de prehension) sans reentrainer le modele complet. L'apport le plus significatif est cependant diagnostique. En montrant que les traits comportementaux de l'"action expert", le module qui genere les trajectoires du robot, sont lineairement decodables mais pas lineairement pilotables, l'etude remet en question une hypothese importee telle quelle des LLM: qu'un concept identifiable lineairement peut aussi etre manipule lineairement. Une nuance utile face a l'engouement actuel pour les VLA generalistes dans la lignee de Pi-0 ou GR00T N2, ou expliquer une decision robotique ne garantit pas la capacite a la corriger simplement. Ces travaux s'inscrivent dans la montee en puissance des politiques VLA a base de flow matching pour la manipulation, une famille de modeles qui a progressivement supplante des architectures de clonage comportemental plus rigides. Le champ de l'interpretabilite dont s'inspirent les auteurs est bien documente cote texte et vision, avec des methodes de steering deja utilisees pour orienter le ton ou la securite des grands modeles de langage; DiMaS transpose cette logique au domaine visuomoteur, ou elle n'avait pas encore ete validee rigoureusement. Aucun acteur francais ou europeen de la robotique (Wandercraft, Pollen Robotics, Enchanted Tools) n'est implique: il s'agit d'un travail de recherche fondamentale, pas d'une annonce produit. Les auteurs annoncent vouloir etendre l'etude de generalisation a des taches encore plus eloignees, pour mieux cerner les limites du transfert comportemental entre contextes.

RecherchePaper
1 source
Au-delà de la saisie visuelle : évaluer la préhension complexe, de la détection à l'exécution
1556arXiv cs.RO 

Au-delà de la saisie visuelle : évaluer la préhension complexe, de la détection à l'exécution

Une équipe de chercheurs publie sur arXiv (référence 2607.14341) GCA-Bench, un nouveau benchmark destiné à évaluer les systèmes de préhension robotique sur des tâches complexes, au-delà de la simple détection visuelle de pose de saisie. Contrairement aux benchmarks existants, centrés sur la détection isolée d'un point de préhension à partir d'une image, GCA-Bench introduit des scénarios de "grasping with complex action" qui exigent un raisonnement au niveau de la scène et la prise en compte de contraintes sémantiques, c'est à dire comprendre non seulement où saisir un objet mais pourquoi et comment, selon le contexte. Les auteurs ont testé une gamme de méthodes de référence, des pipelines classiques de détection de préhension jusqu'aux approches d'apprentissage de bout en bout intégrant de grands modèles de fondation. Résultat marquant: les taux de réussite chutent sous les 70% dès que les scénarios de préhension deviennent complexes. Ce chiffre est significatif pour l'industrie robotique car il vient contredire le récit dominant selon lequel les modèles de fondation à grande échelle (type VLA) auraient déjà résolu la préhension robotique en conditions réelles. La plupart des démonstrations commerciales actuelles portent sur des objets isolés dans des environnements contrôlés; GCA-Bench montre que dès qu'un raisonnement multi-étapes ou une contrainte sémantique s'ajoute (choisir le bon objet selon une instruction, adapter la prise selon l'usage prévu), la fiabilité des systèmes s'effondre. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent la maturité réelle de ces technologies avant déploiement industriel ou logistique. Le papier s'inscrit dans une lignée de benchmarks robotiques (type GraspNet ou YCB) qui se limitaient jusqu'ici à l'évaluation visuelle pure de la pose de préhension. En proposant de nouvelles métriques d'évaluation et une analyse des modes d'échec critiques, les auteurs cherchent à orienter la recherche vers des stratégies de préhension plus robustes et généralisables. Il s'agit pour l'instant d'une prépublication arXiv non revue par les pairs, sans indication de déploiement industriel ni de partenaire commercial associé.

RecherchePaper
1 source
Fire as a Service : dynamique du feu thermiquement et visuellement précise pour simulateurs de robots
1557arXiv cs.RO 

Fire as a Service : dynamique du feu thermiquement et visuellement précise pour simulateurs de robots

Cette étude, publiée sur arXiv (2603.19063v2, version révisée), présente Fire as a Service (FaaS), un framework de co-simulation asynchrone conçu pour ajouter des dynamiques d'incendie réalistes aux simulateurs robotiques existants. Contrairement aux simulateurs classiques centrés sur la dynamique des corps rigides et le rendu photoréaliste, FaaS modélise des transferts de chaleur thermodynamiques multi-espèces et une fumée volumétrique visuellement cohérente, tout en préservant les boucles de contrôle haute fréquence des robots. Le pipeline fonctionne en parallèle du moteur de simulation robotique principal, sans le ralentir, et permet de générer des données perceptuelles multimodales représentatives de conditions d'incendie réelles. Les auteurs indiquent que le système tourne en temps réel, ce qui autorise la téléopération humaine en boucle fermée pour entraîner des politiques réactives par clonage comportemental (Behavioral Cloning). L'enjeu visé est l'évaluation et l'entraînement de robots pompiers avant tout déploiement en environnement dangereux, un cas d'usage où les simulateurs actuels échouent faute de modéliser la chaleur et la fumée avec fidélité. En comblant ce manque, FaaS ouvre la voie à des benchmarks de risques thermiques standardisés pour comparer différentes plateformes robotiques, et à la génération de données d'entraînement synthétiques à grande échelle sans exposer de robots réels au feu. C'est un signal notable pour un secteur qui peine encore à faire le lien entre démonstrations en simulation et fiabilité sur le terrain, en particulier pour des scénarios à haut risque où l'itération réelle est coûteuse voire impossible. Le papier ne nomme pas de plateforme robotique ni de simulateur commercial précis: il s'agit d'un travail de recherche générique, pensé pour s'intégrer à divers moteurs de simulation existants plutôt que de constituer un produit fermé. Aucun chiffre de performance détaillé (précision thermique, latence de co-simulation, taille des jeux de données collectés) n'apparaît dans le résumé, ce qui limite pour l'instant l'évaluation de la robustesse réelle de l'approche. Il s'agit donc d'une brique méthodologique publiée en preprint, à suivre pour vérifier si elle sera reprise par des laboratoires ou fabricants travaillant sur la robotique d'intervention en environnement à risque, plutôt que d'un déploiement ou d'un produit disponible aujourd'hui.

RecherchePaper
1 source
La Direction d'Impact Non Lisse (NSID) des Systèmes Robotiques
1558arXiv cs.RO 

La Direction d'Impact Non Lisse (NSID) des Systèmes Robotiques

Une nouvelle étude théorique publiée sur arXiv (2607.13768) s'attaque à un problème central de la dynamique des robots à liaisons rigides : la modélisation des collisions avec l'environnement. Les auteurs y introduisent le concept de "direction d'impact non lisse" (NSID, nonsmooth impact direction), une direction caractéristique des vitesses avant et après impact qui reste largement indépendante des propriétés de contact (frottement, élasticité, rigidité de surface). Le travail couvre plusieurs cas de figure : systèmes à joints non élastiques et à joints flexibles, robots contraints et non contraints, et démontre que la direction d'approche par rapport à la NSID détermine directement l'orientation de la force impulsive lors d'impacts frictionnels et inélastiques. L'analyse théorique s'appuie sur une validation expérimentale, appliquée aux grandes classes de systèmes robotiques rétro-entraînables (backdrivable) à liaisons rigides. L'enjeu n'est pas un produit ou une démo, mais un outil mathématique fondamental pour la planification et le contrôle des robots en contact avec leur environnement, un problème notoirement difficile car les impacts sont modélisés comme des événements instantanés générant des discontinuités de vitesse. Pour les concepteurs de contrôleurs de locomotion humanoïde, disposer d'une direction caractéristique d'impact indépendante des propriétés du contact simplifie considérablement la conception d'algorithmes robustes face à des sols aux frictions variables (carrelage, surface glissante, gravier). Cela intéresse aussi les tâches répétitives à choc, comme le martelage industriel ou certaines opérations d'assemblage en robotique de manipulation, où la prévisibilité de la force d'impact conditionne la précision et l'usure mécanique. Ce travail s'inscrit dans une longue lignée de recherches en dynamique des systèmes hybrides et en modélisation des impacts rigides, un domaine qui bute depuis des décennies sur des paradoxes classiques (comme le paradoxe de Painlevé) et des formulations approximatives peu généralisables. Contrairement aux annonces produit du secteur humanoïde, il s'agit ici d'une contribution purement académique, sans chiffres de déploiement ni promesse commerciale : les auteurs présentent leur cadre comme une fondation pour de futurs algorithmes de planification et de contrôle, sans indiquer de calendrier d'intégration dans des plateformes robotiques existantes.

RecherchePaper
1 source
Fusion des modalités tactiles pour les modèles vision-langage-action (VLA)
1559arXiv cs.RO 

Fusion des modalités tactiles pour les modèles vision-langage-action (VLA)

Il s'agit d'un article de recherche académique (préprint arXiv, version révisée), donc sans annonce commerciale ni chiffres de performance détaillés dans le résumé fourni, je reste factuel sur ce point plutôt que d'inventer des métriques. TacFiLM est une méthode de fusion de modalités proposée dans un préprint arXiv (2603.14604v2, version révisée) qui intègre des signaux tactiles aux modèles vision-langage-action (VLA) utilisés en robotique manipulatrice. Le constat de depart est simple: les VLA actuels, bien qu'efficaces pour generaliser des politiques de controle a partir d'instructions semantiques, reposent presque exclusivement sur la perception visuelle, incapable de capturer les dynamiques d'interaction propres aux taches de manipulation en contact étroit, comme les forces de contact, le frottement de surface, la compliance ou le cisaillement. Plutot que de concatener des tokens tactiles ou de reentrainer massivement le modele, ce qui alourdit considerablement le cout de calcul, les auteurs proposent un finetuning post-entrainement leger: les caracteristiques visuelles intermediaires sont conditionnees par des representations tactiles pre-entrainees via une modulation lineaire par caracteristique (FiLM). La methode a ete testee sur des taches d'insertion et d'ouverture de tiroir, en distribution et hors distribution, avec des ameliorations rapportees sur le taux de reussite, la performance directe, le temps d'execution et la stabilite des forces appliquees. L'interet pour le secteur tient moins a la performance brute qu'a la strategie d'integration: la plupart des architectures VLA deployees (dans la lignee de Pi-0, GR00T N2 ou Helix) tournent deja a la limite du budget de calcul embarque, ce qui rend les approches de fusion tactile lourdes difficilement viables en production. Une methode de finetoning legere, greffee apres coup sur un modele deja entraine, ouvre la voie a l'ajout de retour tactile sur des politiques existantes sans reentrainement complet ni explosion du cout d'inference, un point cle pour les integrateurs qui visent des taches d'assemblage ou de manipulation fine ou le seul retour visuel echoue regulierement. Cette publication s'inscrit dans une tendance de fond de la recherche VLA: apres avoir demontre la generalisation semantique et le controle multitache, le champ se heurte desormais au probleme specifique de la manipulation en contact, un angle mort connu depuis les debuts de l'apprentissage par imitation en robotique. Le fait qu'il s'agisse d'une version "replace" du preprint suggere une iteration apres retours de relecture. Les auteurs renvoient vers une page de projet dediee pour le code et les demonstrations, sans toutefois annoncer de deploiement industriel ou de partenariat avec un fabricant de robots a ce stade.

IA physiqueOpinion
1 source
Robot industriel d'évaluation de dextérité : une plateforme matérielle et logicielle pour le benchmarking de la manipulation dextre industrielle
1560arXiv cs.RO 

Robot industriel d'évaluation de dextérité : une plateforme matérielle et logicielle pour le benchmarking de la manipulation dextre industrielle

La revue arXiv a publié ce 14 juillet un article intitulé "Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation" (référence 2607.14021v1), qui propose un nouveau cadre de test pour l'automatisation industrielle fine. Les auteurs introduisent trois éléments : une série de plateaux de test baptisés Industrial Dexterity Benchmark (IDB), conçus pour reproduire trois scénarios concrets, le câblage de datacenters, les harnais de câbles automobiles et l'assemblage de boîtes de vitesses ; un framework d'apprentissage par imitation nommé DAG-ROS ; et une politique de contrôle basée sur la diffusion, AG-iDP3, qui fusionne images RGB, nuages de points, positions articulaires et données de force au poignet. Les tests se concentrent sur une tâche précise, le nettoyage d'un câble unique sur le plateau datacenter, évaluée sur 48 essais par configuration. La meilleure configuration, une Diffusion Policy multimodale combinant plusieurs caméras RGB via un encodeur R3M, atteint 78% de réussite combinée sur la prise et l'insertion, contre 36% pour la version à caméra unique. Chaque configuration n'a nécessité qu'environ 100 démonstrations téléopérées par phase de tâche. Ce résultat intéresse directement les intégrateurs industriels parce qu'il touche un point resté largement non résolu malgré des décennies de recherche en robotique : le câblage, l'insertion de connecteurs et l'assemblage de précision continuent de dépendre du travail manuel. L'écart de performance entre la version mono-caméra et la version multi-vues suggère que la robustesse des politiques apprises tient autant à la richesse des capteurs qu'à l'algorithme lui-même, un point utile pour quiconque évalue des solutions VLA ou d'apprentissage par imitation pour des lignes à haute disponibilité. Reste que l'échantillon de validation demeure limité, une seule tâche testée sur 48 essais par configuration, ce qui invite à la prudence avant d'extrapoler ces chiffres à d'autres cas d'usage. Ce travail s'inscrit dans une transition plus large observée dans la recherche en robotique industrielle, celle du passage des pipelines modulaires classiques, perception puis planification puis contrôle codés séparément, vers des architectures de bout en bout entraînées par imitation. Les benchmarks IDB visent à combler un manque identifié par les auteurs : l'absence de plateformes standardisées pour comparer objectivement les méthodes de manipulation dextre en environnement industriel. Aucun calendrier de déploiement commercial n'est mentionné à ce stade, l'article reste un travail de recherche publié en prépublication, sans partenariat industriel ni date de mise en production annoncés.

RecherchePaper
1 source
Understanding le champ de radiation thermique du feu pour les robots mobiles
1561arXiv cs.RO 

Understanding le champ de radiation thermique du feu pour les robots mobiles

Une équipe de chercheurs présente dans un article publié sur arXiv (2602.19108) une méthode permettant à des robots mobiles de cartographier en temps réel les champs de rayonnement thermique générés par un incendie, afin de naviguer sans danger dans un environnement affecté par le feu. Le système fusionne des images de profondeur et des images thermiques pour construire un nuage de points 3D annoté en température. À partir de ces données, l'algorithme identifie les foyers d'incendie et applique la loi de Stefan-Boltzmann pour estimer le rayonnement thermique dans les espaces vides environnants, produisant ainsi un champ thermique continu sur l'ensemble de la scène. Ce champ est ensuite intégré comme contrainte dans la carte de coûts utilisée pour la planification de trajectoire, ce qui permet de calculer des chemins évitant à la fois les collisions et les zones thermiquement dangereuses. La méthode a été validée sur un robot quadrupède Spot de Boston Dynamics, en conditions expérimentales contrôlées, où le robot a démontré sa capacité à contourner les régions à risque tout en atteignant ses objectifs de navigation. Pour le secteur de la robotique de secours, cette approche s'attaque à un problème concret : la plupart des systèmes de navigation autonome évitent les obstacles physiques mais ignorent les dangers invisibles comme le rayonnement thermique, qui peut endommager les capteurs ou l'électronique d'un robot bien avant tout contact direct avec les flammes. En transformant une grandeur physique (le flux thermique) en contrainte exploitable par un planificateur de trajectoire classique, les auteurs proposent une brique potentiellement réutilisable pour les plateformes de recherche-sauvetage et d'intervention en milieu dangereux, sans nécessiter de capteur de flux thermique dédié coûteux. Il s'agit toutefois d'un travail de recherche académique, testé en environnement contrôlé et non lors d'un incendie réel, ce qui limite pour l'instant sa portée à une preuve de concept. Le texte, republié dans une version révisée (v2) sur arXiv, ne mentionne ni partenariat industriel ni feuille de route de déploiement. Les auteurs situent leurs travaux dans la lignée plus large des efforts de robotique pour la réponse aux catastrophes, aux côtés des plateformes comme Spot déjà employées par des pompiers et équipes d'urgence pour l'inspection à distance.

RecherchePaper
1 source
Modèle vision-langage-action, développé pour la robotique, capable de généraliser à des tâches inédites
1562arXiv cs.RO 

Modèle vision-langage-action, développé pour la robotique, capable de généraliser à des tâches inédites

Les chercheurs à l'origine de cette étude, publiée sur arXiv le 13 juillet 2026, ont développé un nouveau type d'actionneur pour exosquelettes de membre inférieur baptisé Limb-Encircling Actuator (LEA). Contrairement aux exosquelettes classiques, dont les moteurs sont placés sur le côté de la jambe ou déportés à la taille ou dans le dos, ce composant encercle directement le membre dans un plan perpendiculaire à son axe. L'équipe a construit un banc d'essai dédié pour caractériser les propriétés électromécaniques du dispositif, qui intègre également une nouvelle configuration de roulement radial pensée comme alternative plus légère et moins coûteuse aux roulements de grand diamètre habituellement utilisés. Résultat mesuré : une densité de couple continue de 7,5 Nm/kg pour une masse de 894 grammes. Cette architecture s'attaque à un frein connu à l'adoption des exosquelettes : l'encombrement. Les designs actuels dépassant souvent de l'enveloppe naturelle du corps, ils restent intrusifs au quotidien et peu compatibles avec un usage grand public, en particulier pour l'assistance à la mobilité hors contexte médical ou industriel lourd. Un actionneur capable de conserver une forte densité de couple tout en épousant mieux la jambe ouvrirait la voie à des exosquelettes plus discrets, potentiellement intégrables dans des vêtements du quotidien plutôt que dans des harnais visibles, un enjeu commercial autant que technique pour le secteur. Le travail reste toutefois à un stade de caractérisation en laboratoire, pas de produit fini : malgré la densité de couple obtenue, les auteurs reconnaissent que le système demeure difficile à contenir près du corps, révélant des limites persistantes dans le dimensionnement et la géométrie de l'actionneur. L'étude se positionne ainsi comme une exploration de piste architecturale plutôt qu'une solution aboutie, dans un domaine où la miniaturisation et la conformité corporelle des actionneurs restent un verrou majeur, aux côtés d'autres approches déjà explorées comme les actionneurs déportés ou les transmissions à câble.

ExosquelettesPaper
1 source
STITCHER : Planification de trajectoires contraintes en environnements complexes par recherche en temps réel de primitives de mouvement
1563arXiv cs.RO 

STITCHER : Planification de trajectoires contraintes en environnements complexes par recherche en temps réel de primitives de mouvement

Un article de recherche publié sur arXiv (2510.14893v4, version révisée) présente STITCHER, un nouveau cadre de planification de trajectoires pour drones qui se passe totalement d'optimisation numérique. Contrairement aux planificateurs modernes qui calculent des trajectoires par optimisation sous contraintes, STITCHER assemble de courts segments de trajectoire préexistants via une recherche sur graphe, pour produire des trajectoires longues portées, quasi optimales et exploitables en temps réel. En simulation, sur deux environnements complexes de 50 mètres sur 50, l'algorithme génère des trajectoires sûres et complètes en quelques millisecondes seulement, un résultat que les auteurs comparent favorablement à trois planificateurs d'optimisation de référence. Des essais matériels ont ensuite été menés sur un quadricoptère personnalisé, capable de suivre les trajectoires calculées en respectant des contraintes non convexes strictes, comme les limites d'angle d'inclinaison et de force des moteurs, tout en atteignant des vitesses de vol jusqu'à 63 km/h. L'enjeu dépasse la prouesse technique isolée. La navigation autonome à grande vitesse dans des environnements encombrés impose des calculs de trajectoire en temps réel, dynamiquement réalisables et sans collision, un problème où les méthodes d'optimisation classiques restent vulnérables aux délais de calcul et à l'instabilité numérique dès que les scénarios deviennent critiques pour la sécurité. En démontrant qu'une approche sans optimisation, fondée sur la recherche de primitives de mouvement, peut égaler voire dépasser la qualité des trajectoires optimisées tout en garantissant des temps de calcul déterministes, STITCHER apporte un argument concret dans le débat entre optimisation et recherche combinatoire pour la planification robotique embarquée, un enjeu direct pour les drones d'inspection, de secours ou de course évoluant en environnement GPS-dénié. La planification de trajectoires agiles s'appuie depuis plusieurs années presque exclusivement sur l'optimisation numérique, jugée seule capable de produire des trajectoires expressives satisfaisant des contraintes complexes d'état et d'actionneurs. Cette dépendance a toutefois un coût en robustesse temporelle, que STITCHER cherche à contourner en revenant à une logique de bibliothèques de primitives de mouvement couplées à une recherche sur graphe, une approche plus ancienne en robotique mobile mais repensée ici pour le vol agile. Il s'agit d'une quatrième révision du travail sur arXiv, signe d'un développement itératif; les auteurs annoncent des tests matériels supplémentaires comme prochaine étape, mais aucun calendrier de déploiement commercial ni partenaire industriel n'est mentionné à ce stade.

RecherchePaper
1 source
Vers un cadre modulaire de bin-picking pour gérer l'incertitude de pose des objets
1564arXiv cs.RO 

Vers un cadre modulaire de bin-picking pour gérer l'incertitude de pose des objets

Une équipe de chercheurs propose un framework modulaire pour le bin-picking robotique, la tâche qui consiste à saisir des objets en vrac dans un bac, capable de gérer simultanément deux sources d'erreur jusqu'ici traitées séparément: l'incertitude sur l'estimation de la pose de l'objet et les erreurs de préhension elles-mêmes. Le système repose sur une estimation de distribution de pose plutôt qu'une pose unique, utile quand l'observation est ambiguë et qu'aucune orientation correcte ne peut être déterminée avec certitude. Un module de second point de vue calcule une distribution complémentaire, fusionnée avec la première pour réduire l'incertitude globale, complété par deux modules indépendants de compensation des erreurs de préhension. L'architecture modulaire permet de combiner ces briques ou de les utiliser isolément selon la configuration physique du poste. Les tests, menés en conditions réelles sur trois objets différents et sans erreurs induites artificiellement, montrent que chaque module améliore l'efficacité du système. Précision utile: le framework est pour l'instant limité aux rotations dans le plan (SO(2)) et n'aborde pas encore les six degrés de liberté complets (SE(3)). Pour l'industrie du bin-picking, la promesse n'est pas un gain de précision brut mais une meilleure gestion du cas le plus fréquent en usine: l'ambiguïté de pose sur des objets partiellement occlus ou symétriques, là où la plupart des pipelines de vision se contentent de retourner une pose unique, souvent fausse en silence. En raisonnant sur des distributions de probabilité plutôt que sur des estimations ponctuelles, l'approche s'attaque à un vrai point de friction pour les intégrateurs, qui doivent aujourd'hui compenser ces erreurs par des capteurs de force, des reprises de saisie ou un sur-dimensionnement des pinces. La preuve de concept reste toutefois modeste, trois objets, un environnement contrôlé, et l'extension annoncée à SE(3) conditionne largement l'intérêt industriel réel du framework. Le travail s'inscrit dans une littérature déjà fournie sur la robustesse du bin-picking, où les approches existantes traitent généralement soit l'incertitude de pose, soit les erreurs de préhension, rarement les deux ensemble selon les auteurs. La contribution revendiquée est précisément cette unification dans une architecture à modules interchangeables, pensée pour absorber de futurs blocs sans réécriture complète. Les auteurs évoquent des extensions possibles vers la 3D complète (SE(3)) et l'ajout d'autres modules correctifs, sans calendrier ni partenaire industriel mentionné à ce stade: il s'agit pour l'instant d'un résultat de recherche publié sur arXiv, pas d'un système déployé ou commercialisé.

RecherchePaper
1 source
Représentation des préférences humaines déployable en robotique : apprendre des récompenses représentatives à partir de préférences humaines diverses
1565arXiv cs.RO 

Représentation des préférences humaines déployable en robotique : apprendre des récompenses représentatives à partir de préférences humaines diverses

Une équipe de recherche a publié sur arXiv (2607.12466v1) un nouveau framework baptisé PREC (Preference-based REward Clustering), conçu pour aligner les politiques de contrôle robotique sur les préférences humaines lors du déploiement auprès d'utilisateurs finaux variés. Le problème que les auteurs cherchent à résoudre est concret : quand chaque utilisateur fournit un retour de préférence binaire (trajectoire A préférée à trajectoire B), ce signal est souvent trop rare et bruité pour apprendre une politique individualisée fiable, tandis qu'une politique unique partagée entre tous les utilisateurs écrase les préférences minoritaires. PREC contourne ce dilemme en mettant de côté les labels de préférence dans un premier temps pour apprendre un encodeur de trajectoires au niveau de la population entière, puis en regroupant les utilisateurs en clusters cohérents selon leurs préférences et en entraînant un modèle de récompense représentatif par cluster, à partir duquel une politique dédiée est optimisée. Les tests, menés sur des environnements de locomotion simulés, montrent que PREC identifie mieux les groupes d'utilisateurs aux préférences divergentes que les méthodes de référence, même avec un retour humain sparse et bruité. Pour l'industrie robotique, l'enjeu dépasse la simple curiosité académique : c'est un problème de scalabilité du déploiement. Multiplier les politiques individualisées pour chaque client rend la validation de sécurité intraitable avant mise en production, alors qu'une politique générique déçoit une partie des utilisateurs et nuit à l'adoption. En réduisant le nombre de politiques à un jeu de clusters gérable tout en couvrant les préférences hétérogènes, PREC propose un compromis directement pertinent pour les intégrateurs qui doivent certifier et maintenir un nombre limité de comportements robotiques plutôt qu'une politique par client. Ce travail s'inscrit dans la lignée des recherches sur l'alignement par préférences humaines (RLHF appliqué à la robotique), un champ qui a longtemps oscillé entre alignement individuel coûteux et alignement collectif appauvri. Les auteurs positionnent explicitement PREC face aux approches d'alignement par utilisateur et à l'alignement par politique unique partagée, sur lesquelles il montre des gains sur trois métriques de bien-être social. L'étude reste pour l'instant limitée à des environnements de locomotion simulés, sans validation sur robots physiques ni indication de partenaires industriels ou de calendrier de déploiement.

RecherchePaper
1 source
Recherche vision-based pour dribble au football humanoïde par apprentissage de représentation privilégiée
1566arXiv cs.RO 

Recherche vision-based pour dribble au football humanoïde par apprentissage de représentation privilégiée

Une équipe de recherche propose une nouvelle méthode d'apprentissage par renforcement pour le dribble de ballon chez les robots humanoïdes, appliquée en simulation à un Booster T1. Publiée le 12 juillet 2026 sur arXiv, l'approche intègre un encodeur de profondeur temporel directement dans la politique de contrôle via une couche de projection spécifique à la tâche, permettant au robot d'apprendre à dribbler uniquement à partir d'images de profondeur embarquées, sans estimation d'état explicite ni information privilégiée sur la scène. Les résultats chiffrés sont précis : 100% de réussite en dribble nominal vers une cible fixe, 96% avec un obstacle statique unique sur le trajet, mais seulement 46% de réussite face à un adversaire mobile qui tente activement de intercepter le ballon. Cet écart de performance entre scénarios statiques et dynamiques est en soi la donnée la plus intéressante pour l'industrie robotique : il illustre concrètement le fossé qui sépare les démonstrations contrôlées des conditions réelles d'usage, un problème récurrent chez les humanoïdes commerciaux (Figure 03, Optimus, ou les plateformes utilisant des architectures VLA comme Pi-0 ou GR00T N2). Pour les intégrateurs et décideurs qui évaluent la maturité de la locomotion-manipulation embarquée, ce travail confirme qu'apprendre la perception et le contrôle de façon conjointe, plutôt que de les traiter comme deux modules séparés, améliore la robustesse face aux occlusions et aux mouvements rapides du ballon. Mais le taux de succès de 46% contre un adversaire actif montre que la gestion d'interactions dynamiques et imprévisibles reste un problème ouvert, loin d'être résolu à l'échelle. Le travail s'inscrit dans la lignée des recherches sur le soccer humanoïde comme banc d'essai pour l'agilité robotique, un domaine où les approches classiques séparaient historiquement perception et contrôle moteur, au prix d'une fragilité en conditions réelles. Les auteurs positionnent leur méthode comme une base pour aborder des scénarios encore plus complexes impliquant des adversaires mobiles multiples, sans toutefois annoncer de calendrier de transfert vers un robot physique, l'ensemble des expériences restant à ce stade purement simulé.

RecherchePaper
1 source
UR-VC : correction non supervisée de la valeur robotique pour proxys de progression dérivés du temps
1567arXiv cs.RO 

UR-VC : correction non supervisée de la valeur robotique pour proxys de progression dérivés du temps

Des chercheurs ont présenté UR-VC (Unsupervised Robotic Value Correction), une méthode hors ligne et sans entraînement pour corriger les signaux de progression utilisés en apprentissage robotique, dans un preprint arXiv publié en juillet 2026 (arXiv:2607.12892). Le problème visé : l'usage courant du temps normalisé au sein d'une démonstration comme proxy de la progression réelle d'une tâche, où une image plus tardive est jugée plus proche de l'accomplissement. Or en manipulation à contact riche, un bras peut avancer puis régresser (glissement, échec de préhension, pli partiellement défait) sans que ce label temporel, strictement monotone, n'en tienne compte. UR-VC corrige ce biais en recherchant des états similaires dans d'autres épisodes puis en agrégeant leurs propres labels temporels, sans annotation manuelle ni modèle de valeur additionnel. La méthode a été testée sur une tâche réelle bimanuelle de pliage de linge, un cas de manipulation d'objet déformable à horizon long où la progression intermédiaire reste visible à l'œil. Pour l'entraînement de politiques vision-langage-action (VLA), la qualité du signal de progression conditionne directement l'apprentissage par avantage (advantage-conditioned policy learning) : un signal insensible aux régressions locales pousse le modèle à ignorer les échecs partiels, un angle mort classique des pipelines de démonstration à grande échelle. En construisant des labels d'avantage à partir des estimations corrigées d'UR-VC, les auteurs rapportent une tendance positive du taux de succès en tâche réelle, à données, modèle et protocole d'entraînement égaux. Ce résultat conforte une hypothèse déjà répandue dans le secteur : le temps écoulé reste un proxy commode mais fragile de la progression physique, un point sensible pour tout intégrateur cherchant à industrialiser l'apprentissage par démonstration sans multiplier les annotations coûteuses. Le travail s'inscrit dans la lignée des méthodes de policy learning conditionné par l'avantage, où le signal de progression sert de fondation à l'entraînement plutôt que la seule structure séquentielle des démonstrations. UR-VC ne nécessite ni ré-entraînement d'un modèle de valeur ni annotation additionnelle, ce qui le rend directement applicable aux jeux de données déjà collectés. Il s'agit pour l'instant d'un preprint de recherche, sans acteur industriel ni intégrateur nommé, et sans calendrier de déploiement annoncé ; la validation reste limitée au pliage de linge en laboratoire, laissant ouverte la question de sa généralisation à d'autres familles de manipulation en contact riche.

RechercheActu
1 source
GaitSpan : de la marche à la course, l'évolution progressive de la locomotion humanoïde
1568arXiv cs.RO 

GaitSpan : de la marche à la course, l'évolution progressive de la locomotion humanoïde

GaitSpan est un nouveau framework d'apprentissage presente dans un preprint arXiv (2607.12114v1, publie en juillet 2026) qui permet a une politique de controle humanoide pretrainee sur la marche de s'etendre vers des allures plus rapides, jogging et course, sans reapprentissage complet. Le systeme traite la marche comme une "competence germe" (seed skill), c'est a dire une structure motrice reutilisable pour l'equilibre, le support, la coordination du corps et les transitions de contact, qui est ensuite regeneree a de nouveaux rythmes, etendue en foulees plus longues et plus hautes, puis corrigee par une adaptation residuelle. La methode combine trois mecanismes: une generation de rythme qui module la politique de marche figee via plusieurs horloges internes et apprend des combinaisons conditionnees par des commandes de vitesse; un faconnage de foulee qui recompense des schemas de locomotion dynamique adaptes aux vitesses elevees, inspire de la dynamique du pendule inverse a ressort (spring-loaded inverted pendulum); et une adaptation residuelle qui capture les details de mouvement non couverts par les deux premiers mecanismes. Selon les auteurs, GaitSpan est la premiere politique humanoide unique, conditionnee par commande, a couvrir un spectre continu allant de la marche au jogging jusqu'a des regimes proches de la course, tout en se transferant a differentes morphologies de robots et en se deployant en zero-shot sur des terrains simules inedits comme sur des terrains reels. Pour l'industrie de la robotique humanoide, cela repond a une limite recurrente des approches actuelles: les strategies existantes de diversification des allures, qu'elles reposent sur des calendriers de demarche predefinis, l'imitation de clips de mouvement humain, l'entrainement d'experts specialises ou la distillation de plusieurs competences en une seule politique, restent rigides face a des commandes de vitesse continues, des terrains varies et des changements de morphologie. Une politique capable de generaliser la course a partir d'une base de marche deja maitrisee reduirait le cout d'ingenierie et accelererait le deploiement sur des plateformes variees. Comparee aux approches de reference utilisant plusieurs experts ou l'imitation de demonstrations humaines, GaitSpan apprend plus vite et obtient de meilleures performances de demarche, selon les tests rapportes par les auteurs. Le papier s'inscrit dans la lignee des travaux recents sur les politiques VLA et d'apprentissage par renforcement pour la locomotion humanoide, ou la question du transfert sim-to-real et de la generalisation entre vitesses et terrains reste un enjeu central de robustesse avant deploiement industriel a grande echelle.

RecherchePaper
1 source
Directives d'exploration efficace dans l'apprentissage par renforcement sûr
1569arXiv cs.RO 

Directives d'exploration efficace dans l'apprentissage par renforcement sûr

Ce papier de recherche, publié sur arXiv le 15 juillet 2026, présente ATACOM Directional Constraints (ATACOM-DC), une extension du framework ATACOM (safety layer) destinée à l'apprentissage par renforcement sûr pour la robotique. Le problème de départ est connu du secteur : en simulation, le RL permet d'apprendre des comportements robotiques complexes, mais un déploiement réel en environnement ouvert exige des garanties de sécurité fortes pour éviter tout geste dangereux. Les méthodes de Safe RL existantes imposent des contraintes de sécurité issues de la connaissance du système ou apprises depuis les données, mais cette contrainte ralentit généralement l'apprentissage et dégrade les performances de la tâche, l'agent devant résoudre un problème d'optimisation contraint plus complexe qu'en configuration non contrainte. L'innovation proposée introduit des contraintes directionnelles qui distinguent les actions s'approchant d'une frontière de sécurité de celles qui s'en éloignent, n'activant l'enforcement de la contrainte que lorsque c'est réellement nécessaire. Les auteurs évaluent leur méthode sur plusieurs tâches de contrôle robotique complexes en simulation, en mesurant à la fois le coût de violation des contraintes et les performances de tâche obtenues. Code et matériel supplémentaire disponibles sur atacom-dc.robot-learning.net. Pour l'industrie robotique, l'enjeu dépasse la seule performance académique : le compromis sécurité/performance est justement ce qui bloque aujourd'hui le passage de nombreux systèmes RL de la simulation au déploiement réel, notamment pour des bras manipulateurs ou des robots mobiles opérant en environnement humain. Une méthode qui réduit ce compromis sans sacrifier les garanties de sécurité intéresse directement les intégrateurs et les équipes R&D qui cherchent à industrialiser des politiques apprises plutôt que programmées à la main. Cela dit, il s'agit ici de résultats en simulation uniquement, sur un ensemble de tâches de contrôle choisies par les auteurs, sans validation sur robot physique ni déploiement industriel : le gap sim-to-real reste entier, et la portée réelle du gain de performance annoncé demande à être confirmée hors laboratoire. ATACOM-DC s'inscrit dans la lignée d'ATACOM, une safety layer déjà reconnue comme référence pour intégrer des contraintes de sécurité à des algorithmes de RL existants sans les reconcevoir entièrement. Le positionnement se fait ainsi moins face à des concurrents commerciaux que face aux autres approches académiques de Safe RL, généralement critiquées pour leur coût en vitesse d'apprentissage. Aucun acteur français ou européen n'est associé à ces travaux. Les auteurs annoncent la mise à disposition du code et de matériel complémentaire en ligne, ce qui ouvre la voie à une reproduction et une extension par d'autres équipes de recherche en robotique et RL sûr, sans toutefois qu'un calendrier de tests sur systèmes réels ne soit mentionné à ce stade.

RecherchePaper
1 source
SLIDER : recherche de cible pour robot aérien guidée par historique clairsemé, utilisant des cartes locales glissantes
1570arXiv cs.RO 

SLIDER : recherche de cible pour robot aérien guidée par historique clairsemé, utilisant des cartes locales glissantes

Des chercheurs présentent SLIDER, un nouveau framework logiciel pour la recherche de cibles par drone en environnement inconnu à grande échelle, publié le 14 juillet 2026 sur arXiv (2607.10553v1). Le système abandonne l'approche classique de cartographie dense globale au profit d'une carte locale glissante combinée à un historique global épars. Il embarque une méthode d'évaluation de la qualité d'observation qui exploite les poses historiques et les modèles de capteurs pour analyser les nuages de points en temps réel, ce qui accélère la détection des zones frontières à explorer. Une stratégie de clustering incrémental des points de vue s'adapte dynamiquement aux mises à jour locales, réduisant fortement le nombre de cibles candidates et la charge de calcul. Une carte topologique globale, maintenue de façon incrémentale et éparse, sert de support à la planification et à l'évaluation des coûts de trajectoire. Les auteurs rapportent des résultats supérieurs à l'état de l'art en simulation comme en conditions réelles, sur les critères d'usage mémoire, de latence de décision et d'efficacité de recherche. L'enjeu dépasse la seule prouesse académique : l'exploration autonome de zones inconnues (recherche et sauvetage, inspection industrielle, cartographie de sites difficiles d'accès) reste limitée par le compromis entre couverture spatiale large et perception fine en temps réel, un goulot d'étranglement classique pour les drones embarquant une puissance de calcul contrainte. En réduisant l'empreinte mémoire et la latence de décision par rapport aux méthodes à cartographie dense, SLIDER répond directement à une limite pratique de déploiement : la plupart des algorithmes de pointe en exploration robotique fonctionnent bien en simulation mais deviennent inutilisables sur du matériel embarqué à ressources limitées. Si les gains annoncés se confirment hors du cadre contrôlé des tests des auteurs, cela ouvrirait la voie à des essaims de drones autonomes plus légers, capables d'opérer en temps réel sans liaison permanente vers une station de calcul déportée. Le papier s'inscrit dans une lignée de recherche active sur l'exploration frontière ("frontier-based exploration") et la planification de trajectoire pour robots aériens, un champ où la tension entre richesse de la représentation cartographique et contraintes de calcul embarqué reste un problème ouvert depuis plusieurs années. Contrairement aux approches à carte globale dense, souvent citées comme référence mais coûteuses en mémoire à mesure que l'environnement s'agrandit, SLIDER mise sur la parcimonie pour rester scalable. L'article ne précise pas d'affiliation industrielle ni de calendrier de transfert vers un produit commercial ; il s'agit à ce stade d'une contribution de recherche, validée par simulation et expérimentation réelle, dont la reproductibilité et l'adoption par d'autres équipes détermineront l'impact réel sur le secteur de la robotique aérienne autonome.

RecherchePaper
1 source
Robo-ValueRL : une estimation fiable de la valeur pour l'apprentissage par renforcement hors ligne vers en ligne
1571arXiv cs.RO 

Robo-ValueRL : une estimation fiable de la valeur pour l'apprentissage par renforcement hors ligne vers en ligne

Des chercheurs publient Robo-ValueRL, un framework d'apprentissage par renforcement offline-to-online pour la manipulation robotique, décrit dans un article arXiv (2607.09866v1) diffusé cette semaine. Le système entraîne un estimateur de valeur conditionné par l'historique des actions, dont la fiabilité est mesurée via deux métriques, la progression globale et la préférence locale. Ces estimations de valeur alimentent ensuite deux étapes : un pré-entraînement de politique par cohérence conditionnée à la qualité des données, puis un module d'adaptation résiduelle appliqué lors des déploiements en ligne. Les expériences s'appuient sur un volume conséquent, 240 heures de démonstrations hors ligne et plus de 3 000 trajectoires de rollout en ligne. Sur deux tâches de précision, l'insertion de puces électroniques au millimètre près et le désassemblage générique de blocs, le système atteint respectivement 86% et 84% de taux de réussite. L'apport principal ne se situe pas dans un nouveau record de performance mais dans la démonstration d'un lien direct entre la fiabilité de la fonction de valeur et la qualité de la politique finale. Concrètement, un estimateur de valeur fiable permet de prioriser les données de meilleure qualité parmi un ensemble hétérogène de démonstrations, ce qui bat le clonage comportemental classique, indifférent à la qualité des données, et stabilise la phase d'amélioration en ligne. Pour les équipes qui construisent des pipelines de RL robotique à partir de données de téléopération ou de simulation de qualité inégale, ce résultat justifie d'investir dans le diagnostic de la fonction de valeur plutôt que de simplement augmenter le volume de données ou la taille des modèles de politique. Le travail s'inscrit dans la tendance actuelle du secteur à combiner pré-entraînement hors ligne sur de larges jeux de démonstrations et affinage en ligne par rollouts réels, une approche jugée prometteuse pour la manipulation robotique généralisable mais dont la complexité technique rend la reproduction et le diagnostic difficiles, un point que les auteurs soulignent explicitement comme motivation de leur étude. Robo-ValueRL se positionne comme un banc d'essai unifié plutôt qu'un produit fini, destiné à isoler l'effet de la fiabilité de l'estimation de valeur des autres composants du pipeline. L'article ne précise pas de suite industrielle ni de partenaire de déploiement identifié à ce stade, le travail restant à un niveau de recherche académique.

RecherchePaper
1 source
SUREFlow : appariement de flux résiduel adapté à l'incertitude dans l'espace d'états pour une manipulation robotique robuste
1572arXiv cs.RO 

SUREFlow : appariement de flux résiduel adapté à l'incertitude dans l'espace d'états pour une manipulation robotique robuste

Des chercheurs publient sur arXiv (2607.10504v1) SUREFlow, une nouvelle politique de manipulation robotique fondée sur le state-space model Mamba plutôt que sur les architectures Transformer habituelles. Le nom complet, State-space Uncertainty-aware REsidual Flow matching, résume l'idée centrale: le modèle prédit conjointement les vitesses d'action et une incertitude résiduelle dépendant de l'entrée, ce qui lui permet de raffiner sélectivement les dimensions d'action jugées peu fiables, sans retour de l'environnement, tout en gardant un coût de calcul contenu. Sur le benchmark de simulation LIBERO, SUREFlow atteint un taux de réussite moyen de 92,5%, contre un score inférieur de 34,2 points pour MaIL, l'autre politique bâtie sur Mamba. Sur la variante plus difficile LIBERO-PRO, il obtient environ 49% de réussite avec seulement 179 millions de paramètres, un résultat que les auteurs présentent comme comparable à celui de grands modèles VLA (vision-langage-action) pesant entre 3 et 7 milliards de paramètres. Le code source est publié sur GitHub. L'enjeu dépassé le simple gain de score: les politiques génératives par diffusion ou flow matching, aujourd'hui dominantes pour piloter des bras robotiques à partir d'images et de langage, souffrent d'instabilité lors de rollouts longs, où de petites erreurs de vitesse s'accumulent et dégradent l'exécution. La plupart des approches existantes supposent une incertitude homogène et ne la modélisent pas explicitement pendant la génération d'action. En ciblant ce point précis, SUREFlow s'attaque directement au fossé entre démonstration en simulation et fiabilité en conditions réelles, un problème central pour les intégrateurs qui cherchent des politiques VLA robustes sans devoir recourir à des modèles massifs coûteux à faire tourner en embarqué. Le travail s'inscrit dans la lignée des politiques de manipulation compactes inspirées de Mamba, alternative aux Transformers pour réduire la complexité de calcul sur des séquences longues, après des tentatives comme MaIL. Il se positionne aussi face aux grands VLA généralistes tels que Pi-0 ou GR00T N2, en misant sur l'efficacité paramétrique plutôt que sur l'échelle. À ce stade, il s'agit d'une publication de recherche évaluée uniquement en simulation sur LIBERO et LIBERO-PRO, sans validation annoncée sur robot physique ni partenariat industriel identifié.

RechercheActu
1 source
Le défi ERR@HRI 3.0 : détection multimodale des erreurs et anticipation dans les interactions homme-robot
1573arXiv cs.RO 

Le défi ERR@HRI 3.0 : détection multimodale des erreurs et anticipation dans les interactions homme-robot

Détecter en temps réel qu'un robot vient de se tromper, ou qu'un humain à proximité va bientôt subir un échec, reste un problème ouvert pour l'interaction homme-robot. La troisième édition du challenge ERR@HRI, présentée dans un article déposé sur arXiv le 14 juillet 2026, propose deux jeux de données inédits pour faire avancer ce sujet. Le premier, Bystander Affect Detection (BAD), rassemble des enregistrements webcam de 45 participants réagissant spontanément à des scénarios d'échec robotique ou humain. Le second, Bad Idea, contient les réactions faciales anticipatoires de 29 participants tentant de prédire l'issue d'une action avant qu'un échec ne survienne. Les deux corpus, collectés par crowdsourcing avec des vidéos brutes non anonymisées, capturent la variabilité de conditions réelles plutôt que des données contrôlées en laboratoire. Trois pistes étaient proposées aux participants: détection des réactions de témoins (Track 1), prédiction anticipatoire d'issue (Track 2), et une piste optionnelle de généralisation cross-dataset (Track 3). Trois équipes ont soumis des modèles valides, tous supérieurs aux baselines à réseaux convolutifs (CNN) des organisateurs. L'enjeu dépasse la simple compétition académique: la plupart des systèmes de détection d'erreur actuels fonctionnent sur des contextes restreints, des environnements contrôlés ou des caractéristiques pré-extraites, ce qui limite fortement leur transfert vers des déploiements réels. En forçant les équipes à travailler sur de la vidéo brute multimodale et des scénarios naturalistes, ERR@HRI 3.0 teste directement si les approches actuelles tiennent face à l'écart classique entre démonstration en laboratoire et usage terrain. Pour les intégrateurs et concepteurs de robots sociaux ou collaboratifs, la capacité à anticiper un échec avant qu'il ne se produise, et pas seulement à le constater après coup, conditionne la confiance des utilisateurs et l'acceptabilité au quotidien de ces systèmes. Le fait qu'il s'agisse d'une troisième édition traduit un effort continu de la communauté recherche en interaction homme-robot pour structurer ce champ encore jeune, à travers des benchmarks partagés plutôt que des évaluations isolées propres à chaque laboratoire. Seules trois équipes ayant soumis des modèles valides, malgré le dépassement des baselines, l'article souligne que la détection et l'anticipation d'erreurs en conditions réelles restent un domaine en construction, avec des perspectives explicites vers des systèmes plus généralisables et conscients du contexte.

RecherchePaper
1 source
Navigation dans la foule : commande prédictive non linéaire avec dynamique des forces sociales pour la navigation robotique tenant compte des humains
1574arXiv cs.RO 

Navigation dans la foule : commande prédictive non linéaire avec dynamique des forces sociales pour la navigation robotique tenant compte des humains

Une équipe de chercheurs publie sur arXiv (arXiv:2607.10374v1, dépôt du 14 juillet 2026) un nouveau cadre de contrôle baptisé SFM-NMPC, pour Social Force Model based Non-linear Model Predictive Control. L'idée consiste à intégrer directement le Social Force Model, un modèle physique classique de la dynamique des foules, dans la boucle d'optimisation d'un contrôleur prédictif non linéaire (NMPC) pilotant la navigation d'un robot mobile. Concrètement, le contrôleur prédit simultanément les trajectoires futures des humains environnants et celle du robot sur tout l'horizon de prédiction, et s'appuie sur un ensemble de fonctions de coût sociales dédiées pour orienter la planification vers des comportements jugés conformes aux normes sociales, au-delà du simple évitement de collision. Malgré la complexité accrue du modèle, les auteurs annoncent un fonctionnement temps réel à 20 Hz, validé par des tests simulés extensifs en environnements encombrés, ainsi qu'une étude d'ablation isolant la contribution de la dynamique SFM et des termes de coût social. Pour l'industrie de la robotique mobile et les intégrateurs de robots destinés à des environnements partagés avec des humains, entrepôts, hôpitaux, espaces commerciaux, ce travail s'attaque à un point de friction connu: les méthodes classiques d'évitement d'obstacles traitent les piétons comme des obstacles dynamiques sans anticiper leur comportement, ce qui produit une navigation perçue comme intrusive ou erratique. En démontrant qu'un modèle de prédiction humaine sophistiqué peut être embarqué dans la boucle de contrôle sans casser la contrainte temps réel, l'étude apporte un argument concret contre l'hypothèse selon laquelle précision sociale et efficacité computationnelle seraient nécessairement antagonistes en MPC. Reste que les résultats, à ce stade, ne reposent que sur de la simulation: la validation sur robot physique en environnement humain réel, avec ses incertitudes de perception et de suivi de trajectoire, constitue l'étape suivante indispensable avant toute conclusion sur l'applicabilité terrain. Le Model Predictive Control s'est imposé ces dernières années comme alternative robuste aux approches classiques de planification et aux méthodes purement data-driven pour la navigation robotique, mais sa performance dépend étroitement de la qualité des modèles de prédiction humaine qu'il embarque. Le Social Force Model, formalisé dans les années 1990 pour modéliser les dynamiques de foule, offre une base physique interprétable que plusieurs travaux récents cherchent à coupler à des contrôleurs optimaux. SFM-NMPC s'inscrit dans cette lignée et se compare à des méthodes de référence de l'état de l'art sur des métriques de conformité sociale, sans toutefois se positionner face à des acteurs industriels ou des systèmes commerciaux déployés, le travail restant à ce stade de nature académique et exploratoire.

RecherchePaper
1 source
Tactile Genesis : explorer les capteurs tactiles à grande échelle pour l'apprentissage de tâches dextériques
1575arXiv cs.RO 

Tactile Genesis : explorer les capteurs tactiles à grande échelle pour l'apprentissage de tâches dextériques

Il n'a pas fait la démo de manipulation dextre à l'ancienne, à base de captures vidéo triées sur le volet et de communiqués enjolivés : une équipe de recherche a publié Tactile Genesis, une plateforme de simulation tactile parallélisée sur GPU capable de faire tourner plus de 20 000 environnements simultanés avec jusqu'à 1 000 taxels (points de contact) par simulation sur un seul GPU, soit un débit 3 à 20 fois supérieur aux simulateurs tactiles précédents. L'outil simule sous une interface commune sept types de retour tactile : contact binaire, profondeur de contact, force/couple cinématique par taxel, déplacement des marqueurs d'élastomère, proximité géométrique, audio de contact, et un champ de température voxelisé, une première dans les plateformes de simulation physique pour l'apprentissage robotique. Un modèle de bruit réaliste (dérive, hystérésis, taxels morts, diaphonie) complète le dispositif. Les chercheurs ont entraîné des politiques élève-professeur sur trois tâches de manipulation dextre, testé différentes configurations de capteurs, placements, résolutions et niveaux de bruit, puis vérifié le transfert sur une main robotique réelle, la XHand1. Les résultats livrent des indications concrètes pour les concepteurs de matériel tactile et les équipes qui définissent les observations des politiques d'apprentissage. La proprioception seule s'avère insuffisante sur toutes les tâches testées, confirmant la nécessité du retour tactile pour la manipulation en contact riche. Fait notable pour l'industrie : le placement des capteurs compte bien plus que leur type. Une couverture limitée au bout des doigts reste largement en retrait par rapport à une couverture de toute la main, tandis que l'ajout de capteurs sur la paume et les phalanges proximales comble l'essentiel de l'écart avec un professeur "privilégié" disposant d'informations complètes. La résolution, elle, importe beaucoup moins que la couverture : 200 taxels répartis sur l'ensemble de la main suffisent pour toutes les tâches étudiées. Le capteur de force/couple par taxel ressort comme le type d'information le plus utile, devant les autres modalités testées. Pour les intégrateurs et fabricants de mains robotiques, ce sont des arbitrages coûts/bénéfices directement exploitables avant d'investir dans du matériel tactile haute résolution. Ce travail s'inscrit dans un problème méthodologique connu du secteur : chaque capteur tactile définit de facto un robot différent, rendant impossible la reproduction d'une même expérience d'apprentissage à travers tous les capteurs existants en laboratoire physique. Tactile Genesis répond à ce verrou en offrant un banc d'essai simulé commun, dans la lignée d'autres plateformes de simulation à grande échelle utilisées pour l'apprentissage de politiques robotiques (type Isaac Gym ou MuJoCo). L'article, une version révisée déposée sur arXiv, ne précise pas de calendrier de commercialisation ni de partenariat industriel ; il s'agit d'une contribution de recherche méthodologique plutôt que d'un produit prêt à déployer. La suite logique pointe vers une adoption par d'autres laboratoires travaillant sur la manipulation dextre, ainsi que vers une possible influence sur les choix de conception des futures générations de mains robotiques équipées de capteurs tactiles denses.

RecherchePaper
1 source
Mono-shot d'apprentissage multimodal par démonstration avec cartes élastiques à contrainte de force
1576arXiv cs.RO 

Mono-shot d'apprentissage multimodal par démonstration avec cartes élastiques à contrainte de force

Une équipe de robotique publie sur arXiv (2607.09515v1) une méthode d'apprentissage par démonstration capable d'encoder simultanément le mouvement et les forces de contact à partir d'une seule démonstration. Le système repose sur deux briques techniques : un algorithme de segmentation probabiliste multimodale qui pondère dynamiquement les signaux spatiaux et les signaux de force pour extraire automatiquement des primitives de mouvement conscientes du contact, et une extension de la représentation dite "elastic maps" intégrant des contraintes de force externes, résolue via une optimisation convexe pour produire des trajectoires cohérentes avec les forces démontrées. Les auteurs valident l'approche sur cinq tâches de manipulation réelles et deux configurations matérielles distinctes : un bras UR5e équipé d'une pince Robotiq 2f-85 avec capteur de force au poignet, et un Kinova Gen3 avec une pince Openhand Model O dotée de capteurs de force aux doigts. Les résultats montrent une segmentation multimodale robuste, une reproduction fidèle des profils de force, et une généralité constatée sur les deux plateformes. L'enjeu dépasse la curiosité académique. La plupart des méthodes de Learning from Demonstration actuelles ne modélisent que la trajectoire spatiale, ignorant les forces de contact, ce qui pose problème dès qu'un robot doit insérer, essuyer, polir ou assembler des pièces avec un contact physique contraint. Pour les intégrateurs industriels, cette lacune se traduit par des gestes appris en simulation ou en démonstration pure qui deviennent dangereux ou inconsistants une fois transposés à des tâches de contact réel. Une méthode qui apprend le bon profil de force dès la première démonstration, sans réglage manuel ni multiples essais, réduirait le coût de programmation des cobots pour des tâches d'assemblage fin, un frein connu à l'adoption du LfD en production. Le travail s'inscrit dans la lignée des elastic maps, une représentation déjà utilisée pour encoder des trajectoires à partir de démonstrations, ici étendue aux contraintes physiques plutôt que purement géométriques. Il se positionne comme alternative aux approches classiques de type DMP ou GMM/GMR, généralement limitées au domaine spatial. Aucun calendrier de transfert industriel n'est annoncé ; il s'agit à ce stade d'une validation en laboratoire sur bras collaboratifs standards du marché.

RecherchePaper
1 source
B-spline Policy : accélérer les politiques de manipulation via des représentations d'action B-spline
1577arXiv cs.RO 

B-spline Policy : accélérer les politiques de manipulation via des représentations d'action B-spline

Des chercheurs viennent de publier sur arXiv (référence 2607.09648v1) une nouvelle méthode baptisée B-spline Policy, ou BSP, conçue pour accélérer l'exécution des politiques de manipulation robotique apprises par imitation. Contrairement à l'approche dominante qui consiste à prédire des séquences d'actions discrètes dans le temps ("action chunks"), BSP paramètre les actions du robot sous forme de courbes B-spline continues, définies par un ensemble de noeuds et de points de contrôle. Cette représentation produit des trajectoires lisses et continues dans le temps, qui peuvent ensuite être mises à l'échelle temporellement et exécutées par les contrôleurs bas niveau à des fréquences et des vitesses plus élevées. Les auteurs montrent que ces paramètres B-spline peuvent être prédits directement par des architectures de policy learning existantes, sans refonte majeure du pipeline d'entraînement. Les expériences, menées à la fois en simulation et sur des tâches de manipulation réelles, indiquent une réduction significative du temps d'exécution des tâches par rapport aux méthodes de référence, tout en conservant des taux de réussite comparables. L'enjeu est concret pour les équipes qui déploient des politiques de manipulation en usine ou en entrepôt: le goulot d'étranglement des approches par chunks discrets vient souvent de la fréquence de commande limitée et des à-coups introduits entre segments d'actions, ce qui oblige à ralentir l'exécution pour rester stable. En rendant la trajectoire continue et rééchelonnable dans le temps, BSP permettrait de gagner en vitesse de cycle sans changer de modèle de perception ni de politique d'apprentissage, un argument qui parle directement aux intégrateurs cherchant à rapprocher les démonstrations en laboratoire des cadences industrielles réelles. Cette contribution s'inscrit dans la lignée des travaux sur les représentations d'actions pour l'apprentissage par imitation, où des méthodes comme les chunks d'actions ou les politiques de diffusion ont dominé ces deux dernières années sans toujours résoudre le compromis entre vitesse d'exécution et fluidité des mouvements. En proposant une alternative paramétrique compatible avec les pipelines existants, les auteurs ouvrent une piste d'optimisation orthogonale, potentiellement combinable avec d'autres avancées récentes en manipulation robotique. Des résultats supplémentaires et le code sont disponibles sur b-spline-policy.github.io.

RecherchePaper
1 source
ReinforceGen : politiques de compétences hybrides avec génération automatisée de données et apprentissage par renforcement
1578arXiv cs.RO 

ReinforceGen : politiques de compétences hybrides avec génération automatisée de données et apprentissage par renforcement

Une équipe de recherche en robotique publie ReinforceGen, un système combinant décomposition de tâches, génération automatisée de données, apprentissage par imitation et planification de mouvement, le tout affiné par apprentissage par renforcement. Le principe consiste à segmenter une tâche de manipulation longue en plusieurs compétences localisées, reliées entre elles par un planificateur de mouvement. Ces compétences sont d'abord entraînées par imitation à partir d'un jeu de données généré depuis seulement 10 démonstrations humaines, puis affinées via adaptation en ligne et renforcement. Sur le benchmark Robosuite, ReinforceGen atteint 80% de taux de réussite sur l'ensemble des tâches en contrôle visuomoteur, dans la configuration la plus exigeante de réinitialisation des positions de départ. Des études d'ablation montrent que les étapes de fine-tuning apportent un gain de performance moyen de 89%. Le système a également été testé en conditions réelles, avec des améliorations significatives rapportées après affinage. Vidéos et résultats complémentaires sont disponibles sur le site du projet. La manipulation longue durée reste l'un des obstacles majeurs en robotique manipulative: enchaîner plusieurs sous-tâches sans dérive d'erreur cumulative est difficile pour l'imitation pure, tandis que le renforcement seul peine à converger sur des horizons longs sans démonstration initiale. En combinant les deux, ReinforceGen s'inscrit dans un mouvement plus large cherchant à réduire la dépendance aux données humaines coûteuses (ici seulement 10 démonstrations) tout en conservant une robustesse comparable à des méthodes plus gourmandes. Le passage réussi vers des évaluations réelles, au-delà de la simulation, est le point le plus significatif pour les acteurs industriels: il suggère que l'écart simulation-réel, souvent le talon d'Achille des politiques visuomotrices, peut être réduit par cette architecture hybride plutôt que par du pur scaling de données. Le papier, publié sur arXiv (version révisée, v2), s'appuie sur le benchmark Robosuite, référence standard pour comparer les politiques de manipulation robotique en simulation. Le score de 80% est annoncé dans le réglage le plus difficile testé, un détail à garder en tête: les performances dans des configurations moins contraignantes ne sont pas précisées dans le résumé. Aucun acteur commercial ni institution n'est nommé dans l'abstract, ce travail relevant pour l'instant de la recherche académique plutôt que d'un produit destiné à un déploiement industriel immédiat.

RecherchePaper
1 source
Analyse différentielle d'images multispectrales pour l'identification du terrain
1579arXiv cs.RO 

Analyse différentielle d'images multispectrales pour l'identification du terrain

Une équipe de recherche présente DRIFT, un framework léger d'analyse multispectrale pour l'identification de terrain destiné à la navigation robotique autonome, décrit dans un article publié le 13 juillet 2026 sur arXiv (2607.09319). Le système combine deux flux de traitement dans une architecture résiduelle à double branche : les bandes spectrales brutes captées par la caméra, et des ratios de bandes conçus pour neutraliser les variations d'éclairage et de gain capteur. Une branche de fusion différentielle vient ensuite comparer les signaux bruts et les ratios pour repérer les incohérences, ce qui renforce la robustesse face à des mesures spectrales bruitées ou partiellement fiables. Les chercheurs ont testé DRIFT sur deux scénarios concrets : un nouveau jeu de données de pétrole répandu sur sol, acquis par drone équipé d'une caméra MicaSense RedEdge-P, et une étude contrôlée d'eau sur herbe avec variations d'éclairage et de température (eau chaude et froide) pour isoler les effets sensibles au proche infrarouge (NIR). L'enjeu dépasse le cadre académique. La perception RGB classique, dominante dans la navigation robotique, échoue régulièrement en faible luminosité, sous des ombres portées ou face à des matériaux visuellement ambigus, des angles morts critiques pour des robots mobiles ou des drones opérant en extérieur, sur des chantiers ou en contexte industriel. En démontrant des gains constants sur des baselines solides tout en restant compatible avec un déploiement embarqué (edge), DRIFT s'inscrit dans une tendance vers des capteurs multispectraux abordables et exploitables en temps réel, plutôt que réservés à des applications de télédétection lourdes. Pour les intégrateurs travaillant sur des AMR (robots mobiles autonomes) en environnements extérieurs ou semi-structurés, cela ouvre la voie à une détection de terrain plus fiable sans dépendre uniquement de caméras RGB ou de LiDAR. Le travail s'inscrit dans la lignée des recherches en imagerie multispectrale appliquée à la robotique de terrain, un domaine encore largement expérimental comparé à la perception RGB ou LiDAR déjà industrialisée. L'article ne mentionne pas de partenaire industriel ni de calendrier de commercialisation : il s'agit à ce stade d'une contribution méthodologique et d'un nouveau jeu de données, pas d'un produit prêt à déployer.

RecherchePaper
1 source
CoDiMAD : distillation privilégiée par diffusion pour la coordination multi-robots sans communication
1580arXiv cs.RO 

CoDiMAD : distillation privilégiée par diffusion pour la coordination multi-robots sans communication

Des chercheurs proposent CoDiMAD (Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination), une méthode pour coordonner des robots en essaim sans qu'ils communiquent entre eux. Le principe repose sur trois étapes : d'abord entraîner un "oracle" privilégié qui voit l'état global du système via MAPPO, un algorithme d'apprentissage par renforcement multi-agents ; ensuite construire un jeu de données hors ligne associant observations locales de chaque robot et actions décidées par cet oracle ; enfin distiller ces connaissances dans des politiques décentralisées, chaque robot n'ayant accès qu'à ses propres capteurs, en les paramétrant comme des modèles de diffusion (DDPM, denoising diffusion probabilistic models) conditionnels plutôt que des réseaux déterministes classiques. Testée sur trois tâches coopératives, l'approche surpasse à la fois l'apprentissage multi-agents purement local et la distillation déterministe classique, avec une analyse théorique à l'appui. Le code doit être publié après acceptation de l'article, qui reste pour l'instant un preprint arXiv non encore évalué par les pairs. L'enjeu technique central est le problème du "mode-averaging" : une même observation locale (par exemple, voir un obstacle et un autre robot à proximité) peut correspondre à plusieurs configurations globales exigeant des actions coopératives très différentes. Une distillation déterministe classique moyenne ces possibilités et produit des actions invalides ou hésitantes, un défaut connu de l'apprentissage par imitation en environnement multimodal. En échantillonnant directement dans le processus inverse de diffusion, CoDiMAD choisit une action cohérente au lieu de la moyenner, ce qui est directement pertinent pour les flottes de robots mobiles autonomes (AMR) en entrepôt, les essaims de drones ou tout système devant rester fonctionnel en cas de perte de communication réseau. Cette approche s'inscrit dans deux lignées de recherche déjà établies : la distillation privilégiée enseignant-élève, popularisée en locomotion robotique pour transférer un savoir "avec triche" (accès à l'état complet) vers une politique embarquée limitée aux capteurs réels, et les politiques de diffusion en robotique, initialement développées pour la manipulation mono-robot (Diffusion Policy) et ici étendues au cas multi-agents décentralisé. Le travail reste à ce stade purement expérimental, sans déploiement sur robots physiques mentionné dans le résumé.

RecherchePaper
1 source
Re³Sim : générer des données de simulation photoréalistes en 3D par transfert réel-vers-simulation pour la manipulation robotique
1581arXiv cs.RO 

Re³Sim : générer des données de simulation photoréalistes en 3D par transfert réel-vers-simulation pour la manipulation robotique

Cette annonce arrive du côté recherche académique plutôt que de l'industrie commerciale : une équipe présente RE³SIM, un système de simulation photoréaliste en 3D destiné à combler l'écart entre entraînement simulé et déploiement réel en robotique manipulatrice. Publié sur arXiv (version 4, remplaçant une précédente), le papier décrit un pipeline qui reconstruit fidèlement des scènes réelles grâce à des techniques avancées de reconstruction 3D et de rendu neuronal, permettant un rendu en temps réel de caméras virtuelles multi-angles au sein d'un simulateur physique. En s'appuyant sur des informations privilégiées pour générer efficacement des démonstrations expertes en simulation, puis en entraînant des politiques robotiques par apprentissage par imitation, les chercheurs rapportent un taux de réussite moyen supérieur à 58% en transfert "zero-shot" vers le réel, c'est-à-dire sans aucune donnée réelle utilisée pour l'entraînement, uniquement des données simulées. Ils ont aussi constitué un jeu de données de simulation à grande échelle pour tester la généralisation des politiques apprises sur des objets variés. Le résultat compte parce qu'il s'attaque directement à l'un des goulots d'étranglement les plus coûteux du secteur : la collecte de données réelles pour entraîner des robots manipulateurs, qui exige des opérateurs qualifiés et du matériel onéreux. Si le fossé sim-to-real (géométrique et visuel) peut être réduit de manière fiable grâce à des reconstructions photoréalistes plutôt qu'à des environnements simulés génériques, cela change la donne pour les intégrateurs et les équipes de R&D qui cherchent à multiplier les scénarios d'entraînement sans multiplier les essais physiques. Un taux de 58% en zero-shot reste toutefois modeste comparé aux standards de fiabilité industrielle, et mérite d'être lu comme une preuve de concept académique plutôt qu'une solution prête à l'emploi pour la production. RE³SIM s'inscrit dans la lignée des travaux récents sur les politiques vision-langage-action (VLA) et les pipelines d'apprentissage par imitation, un axe de recherche également poursuivi par des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T). La démarche real-to-sim-to-real, où l'on capture d'abord le monde réel avant de simuler dessus, distingue cette approche des simulateurs purement synthétiques et pourrait influencer les futurs outils de génération de données pour l'entraînement de robots. Le code et des démonstrations sont disponibles sur le site du projet (re3sim.github.io), signe que l'équipe cherche une adoption élargie par la communauté robotique plutôt qu'une simple publication isolée.

RecherchePaper
1 source
ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts
1582arXiv cs.RO 

ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts

Wiping a board, sitting on a chair ou pousser un meuble : ces tâches semblent réussies dès que le robot atteint la bonne posture, mais sans contact physique réel avec l'objet, elles échouent en pratique. C'est le constat de départ de CONTACTMIMIC, un framework d'apprentissage présenté dans un article publié le 10 juillet sur arXiv (2607.08742). L'équipe y ajoute aux trajectoires de points-clés classiques (keypoint tracking) des commandes de contact binaires, définies au niveau de chaque partie du corps. La politique résultante s'appuie sur deux ingrédients : des récompenses qui suivent explicitement le contact et un schéma d'augmentation de trajectoires conçu pour casser la corrélation entre géométrie des points-clés et étiquettes de contact. Résultat, le robot peut produire ou supprimer un contact à la demande, indépendamment de sa pose. Sur 10 mouvements d'interaction homme-objet testés en simulation, CONTACTMIMIC dépasse les trackers uniquement basés sur les points-clés, sans recourir à des récompenses spécifiques à chaque tâche. Le transfert sim-to-real a été validé sur 5 mouvements réels. L'enjeu dépasse la démonstration technique : la plupart des pipelines d'imitation de mouvement pour humanoïdes optimisent la fidélité cinématique, pas l'interaction physique effective, un angle mort qui limite l'utilité pratique des politiques de manipulation whole-body déployées sur des plateformes comme Figure 03, Optimus ou des architectures VLA type GR00T N2, Pi-0 ou Helix. Découpler contact et géométrie ouvre la voie à des contrôleurs capables d'exécuter des tâches ménagères ou industrielles réelles (essuyer, pousser, s'asseoir) sans réentraînement par tâche, un prérequis pour que les humanoïdes sortent de la démonstration scriptée. Le travail s'inscrit dans la lignée des méthodes de suivi de points-clés pour le contrôle corps entier des humanoïdes, dont il expose les limites via des ablations confirmant la nécessité de l'augmentation de trajectoires. Aucun partenaire industriel n'est mentionné : il s'agit pour l'instant d'une contribution de recherche en simulation et validation restreinte en réel, dont les vidéos sont disponibles en ligne, sans calendrier de déploiement annoncé.

RecherchePaper
1 source
SeFA-Policy : apprentissage rapide et précis de politiques visuomotrices par alignement de flux sélectif
1583arXiv cs.RO 

SeFA-Policy : apprentissage rapide et précis de politiques visuomotrices par alignement de flux sélectif

Une équipe de recherche a publié SeFA-Policy (Selective Flow Alignment), une nouvelle méthode d'apprentissage de politiques visuomotrices par imitation pour la robotique, décrite dans une version révisée sur arXiv (2511.08583v2) et accompagnée d'un code source disponible sur GitHub (RongXueZoe/SeFA). Le problème ciblé concerne les approches récentes de "rectified flow", qui accélèrent la génération d'actions robotiques mais souffrent d'un défaut connu : après distillation itérative, les actions générées finissent par dévier des actions réelles associées à l'observation visuelle en cours, ce qui accumule l'erreur au fil des cycles de reflow et déstabilise l'exécution des tâches. SeFA introduit un mécanisme de correction de cohérence qui réaligne sélectivement les actions générées sur les démonstrations expertes, tout en conservant la capacité du modèle à représenter plusieurs solutions possibles (multimodalité). Sur des tâches de manipulation simulées et réelles, les auteurs annoncent une précision et une robustesse supérieures aux politiques de référence basées sur la diffusion ou sur le flow, avec une latence d'inférence réduite de plus de 98%. Pour l'industrie robotique, l'enjeu dépasse la performance académique brute : le goulot d'étranglement des politiques par diffusion a toujours été le nombre d'étapes de débruitage nécessaires à chaque décision, incompatible avec du contrôle temps réel sur bras manipulateurs ou robots mobiles. Les méthodes à un seul pas d'inférence promettent de lever ce verrou, mais au prix, jusqu'ici, d'une fidélité dégradée aux observations réelles. En traitant explicitement ce compromis précision/vitesse plutôt qu'en l'ignorant, SeFA apporte un signal utile aux intégrateurs qui évaluent si les politiques de type flow sont mûres pour un déploiement embarqué, au-delà des démonstrations en laboratoire. Ce travail s'inscrit dans la lignée des Diffusion Policy puis des politiques par rectified flow, apparues ces deux dernières années comme alternative aux architectures de type transformer pour l'apprentissage par imitation en robotique. Il se positionne explicitement contre les méthodes de diffusion et de flow "state of the art" existantes, sans toutefois nommer d'acteur industriel ni annoncer de déploiement commercial : il s'agit d'une contribution de recherche, publiée en v2 après une première soumission, avec code ouvert pour reproduction par la communauté.

RechercheActu
1 source
SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche
1584arXiv cs.RO 

SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche

Voici l'article en français, sans titres ni séparateurs : Une équipe de recherche présente SPEAR (Simulator for Photorealistic Embodied AI Research), un nouveau simulateur conçu pour entraîner des agents incarnés (embodied agents) et générer des données visuelles synthétiques photoréalistes. Publié sur arXiv début juillet 2026, SPEAR se présente comme une bibliothèque Python capable de se connecter à n'importe quelle application Unreal Engine (UE) et de la piloter via une architecture de plugins modulaires. Elle expose plus de 14 000 fonctions UE uniques à Python, soit un gain d'un ordre de grandeur en fonctionnalités programmables par rapport aux simulateurs UE existants. Côté performance, une seule instance de SPEAR peut rendre des images photoréalistes en 1920x1080 directement dans un tableau NumPy à 73 images par seconde, également dix fois plus rapide que les plugins UE existants, tout en fournissant des modalités de vérité terrain inédites, comme la décomposition intrinsèque non diffuse, les IDs de matériaux ou les paramètres de shading physiquement basé (PBR). Pour un ingénieur en robotique ou en IA incarnée, l'enjeu dépasse la simple prouesse technique : la plupart des simulateurs photoréalistes actuels souffrent d'un compromis entre réalisme visuel et vitesse de rendu, ou entre flexibilité de programmation et généralité. En combinant vitesse élevée, richesse des modalités de sortie et contrôle programmatique fin de scènes UE complexes, SPEAR vise à réduire l'écart entre simulation et réalité (sim-to-real) pour l'entraînement d'agents visuels, un point critique pour la robotique mobile, les véhicules autonomes et les modèles vision-langage-action (VLA). Les chercheurs démontrent l'outil sur des cas variés : contrôle de multiples agents aux espaces d'action distincts (humains, voitures, robots) dans des projets UE existants, rendu d'environnements urbains à grande échelle, manipulation des systèmes de génération procédurale de contenu d'UE, rendu multi-vues synchronisé de visages humains détaillés, co-simulation avec le moteur physique MuJoCo, et édition de scènes en langage naturel via un assistant de code IA. SPEAR s'inscrit dans la lignée des simulateurs bâtis sur Unreal Engine comme AirSim ou CARLA, mais cherche à en dépasser les limites de généralité et de vitesse.

RecherchePaper
1 source
Multi-agent : contrôle robotique par modèles vision-langage embarqués
1585arXiv cs.RO 

Multi-agent : contrôle robotique par modèles vision-langage embarqués

Une équipe de recherche présente, dans un article publié sur arXiv (arXiv:2607.07403v1), une architecture multi-agents (MAS) pour le contrôle robotique conçue pour fonctionner entièrement en local, sans dépendre d'une infrastructure de calcul externe. Le système pilote un manipulateur mobile autonome polyvalent dans un entrepôt industriel simulé, où il exécute cinq catégories de tâches : inspection de sécurité, maintenance de l'entrepôt, recherche d'objets, vérification de la qualité des colis, et réponse aux demandes humaines. L'architecture s'appuie sur des modèles vision-langage (VLM) compacts, entre 3 et 20 milliards de paramètres, avec un fine-tuning appliqué spécifiquement pour améliorer la précision de l'inspection des colis. Un agent d'orchestration baptisé "Megamind" a été conçu pour limiter les pertes de contexte que subissent les petits modèles sur des tâches de planification à long horizon. Le système a été validé en configuration hardware-in-the-loop, sur un mini PC AMD Ryzen AI, combinant simulation et matériel embarqué réel. Ce travail s'attaque à trois limites récurrentes des VLM et des modèles vision-langage-action (VLA) appliqués à la robotique : l'explicabilité, la généralisation et les besoins en calcul. En s'appuyant sur des modèles compacts exécutés localement plutôt que sur des VLA massifs hébergés dans le cloud, l'approche promet une réduction des coûts d'infrastructure et une latence moindre, deux critères déterminants pour les intégrateurs industriels qui veulent déployer des robots autonomes sans dépendre d'une connectivité permanente. Les auteurs présentent leurs résultats comme une preuve qu'une architecture multi-agents entièrement embarquée constitue une alternative viable et économique aux déploiements dépendants du cloud, avec un potentiel de transfert vers le réel. Ces résultats restent toutefois obtenus en environnement simulé ; le passage à un robot physique en conditions réelles d'entrepôt demeure l'étape déterminante pour confirmer la promesse. L'essor de VLA comme Pi-0, GR00T N2 ou Helix a mis en évidence la dépendance de nombreux systèmes robotiques à des clusters de calcul distants, un frein pour les déploiements industriels à grande échelle. En misant sur des modèles plus petits orchestrés collectivement plutôt que sur un modèle monolithique unique, cette recherche se distingue des approches dominantes centrées sur des VLA de grande taille. Les chercheurs ont publié l'environnement de simulation en open source sous licence Apache 2.0, ouvrant la voie à des extensions et comparaisons par la communauté robotique. Les prochaines étapes attendues concernent la validation sur robot physique en entrepôt réel ainsi que l'élargissement des catégories de tâches couvertes par le système.

RecherchePaper
1 source
VOTE : optimisation vision-langage-action par vote d'ensemble de trajectoires
1586arXiv cs.RO 

VOTE : optimisation vision-langage-action par vote d'ensemble de trajectoires

Le papier VOTE ("Vision-Language-Action Optimization with Trajectory Ensemble Voting"), publié sur arXiv sous la référence 2507.05116, propose une nouvelle méthode d'entraînement pour les modèles Vision-Language-Action (VLA) utilisés en robotique manipulatrice. Les auteurs, dont le code est disponible sur GitHub (LukeLIN-web/VOTE), s'attaquent à deux limites des VLA actuels : la génération de tokens d'action très nombreux, qui alourdit la latence d'inférence et le coût d'entraînement, et une exploitation insuffisante des actions déjà générées, qui dégrade les performances. Leur framework finetune les modèles pour produire beaucoup moins de tokens d'action, en parallélisant fortement le décodage, puis combine les prédictions courantes et passées via une stratégie de vote d'ensemble au moment de l'inférence. Résultat annoncé : des taux de réussite supérieurs à l'état de l'art, avec une inférence 39 fois plus rapide qu'OpenVLA et un débit de 46 Hz sur plateformes embarquées. Ce gain de vitesse cible directement le principal frein au déploiement réel des VLA : leur latence, souvent incompatible avec un contrôle robotique en temps réel sur du matériel embarqué à ressources limitées. Si les chiffres se confirment en dehors des benchmarks propriétaires des auteurs, cela renforcerait l'idée qu'on peut réduire drastiquement la latence sans changer d'architecture ni ajouter de puissance de calcul, simplement en repensant le nombre de tokens générés et leur exploitation post-inférence. C'est un argument concret pour les intégrateurs qui cherchent à faire tourner des politiques VLA sur des bras robotiques ou plateformes mobiles sans GPU serveur. Le travail s'inscrit dans une course plus large à l'efficacité des VLA, où OpenVLA sert de référence open source largement citée, aux côtés d'approches comme Pi-0 (Physical Intelligence), GR00T (NVIDIA) ou Helix (Figure), toutes confrontées au même compromis entre richesse de représentation et vitesse d'exécution. VOTE se positionne comme une optimisation d'inférence complémentaire à ces modèles plutôt qu'un concurrent direct, avec pour prochaine étape l'adoption par la communauté via son code publié.

IA physiqueActu
1 source
Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels
1587arXiv cs.RO 

Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels

Une équipe de recherche propose une nouvelle architecture pour piloter des robots de morphologies très différentes avec un seul contrôleur, dans un article intitulé "Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control" (arXiv:2506.08630, version 3, republiée en cross-listing début juillet 2026). Le système repose sur une architecture transformer combinée à une récurrence modulaire partagée entre les composants du robot (bras, jambes, articulations), conçue pour reconstruire des informations contextuelles sur les propriétés physiques d'un robot même quand ces données ne sont que partiellement disponibles au départ. Les chercheurs l'ont testé sur un large ensemble de robots simulés dans MuJoCo, le moteur physique open source largement utilisé en apprentissage par renforcement, à travers quatre environnements distincts. Résultat clé: le modèle affiche un gain net en généralisation zero-shot, c'est-à-dire sa capacité à piloter correctement des robots aux dynamiques, cinématiques et topologies jamais rencontrées pendant l'entraînement, sans réglage additionnel. Cette avancée s'inscrit dans un enjeu central pour l'industrie robotique: réduire le coût d'entraînement et de déploiement de contrôleurs spécifiques à chaque morphologie de robot. Un contrôleur universel capable de généraliser à de nouveaux designs mécaniques réduirait drastiquement les besoins en données et en calcul pour chaque nouveau modèle de robot, un problème que rencontrent aujourd'hui les fabricants de robots humanoïdes et de bras manipulateurs multiples. C'est aussi une contribution au débat sur la viabilité des architectures de type VLA (vision-language-action) et des politiques génériques à grande échelle: ici, la généralisation ne vient pas d'un volume massif de données mais d'une architecture qui exploite explicitement la structure modulaire du robot. L'approche s'inscrit dans une lignée de travaux en RL contextuel et en contrôle multi-robots qui exploitent déjà des informations sur la morphologie pour entraîner des agents partagés, mais qui peinaient jusqu'ici à généraliser à des morphologies fortement dissimilaires. Le fait que cet article soit republié en tant que "replace-cross" sur arXiv suggère une révision après retours de la communauté, un signe que le sujet suscite un intérêt actif en apprentissage par renforcement appliqué à la robotique. Les prochaines étapes attendues concernent une validation sur robots physiques réels, au-delà des simulations MuJoCo, pour confirmer le transfert sim-to-real.

RecherchePaper
1 source
RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique
1588arXiv cs.RO 

RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique

Des chercheurs (l'article ne precise pas d'affiliation institutionnelle dans le resume) publient sur arXiv, le 7 juillet 2026, RynnWorld-4D, un modele generatif de monde en 4D pour la manipulation robotique. Le systeme produit simultanement, a partir d'une seule image RGB-D et d'une instruction en langage naturel, des images RGB futures, des cartes de profondeur et des flux optiques, le tout dans un unique processus de diffusion. Son architecture a trois branches combine attention cross-modale et RoPE 3D image par image pour que l'apparence visuelle, la geometrie et le mouvement evoluent de maniere coherente. Pour l'entrainer, les auteurs ont constitue Rynn4DDataset 1.0, un jeu de donnees de plus de 254,4 millions d'images issues de videos de manipulation, a la fois humaines en vue egocentrique et robotiques, avec des pseudo-etiquettes de profondeur et de flux optique. Un module derive, RynnWorld-4D-Policy, exploite directement les representations internes du modele en un seul passage avant, sans les etapes couteuses de debruitage iteratif, pour generer des actions robotiques en boucle fermee. L'interet de cette approche tient a l'hypothese qu'elle teste: en combinant RGB, profondeur et flux optique plutot qu'en travaillant sur de simples pixels 2D, la representation obtenue se rapprocherait davantage des commandes bas niveau de l'effecteur, reduisant l'ecart classique entre prediction du monde et apprentissage de politique. Sur des taches reelles de manipulation bimanuelle dexterite, les auteurs rapportent des resultats a l'etat de l'art, en particulier sur les taches exigeant precision spatiale et coordination temporelle, deux points ou les approches VLA generalistes butent souvent en conditions reelles. Il s'agit pour l'instant d'un travail de recherche publie en preprint, sans deploiement industriel ni produit commercialise. Il s'inscrit dans la lignee des modeles de monde appliques a la robotique, aux cotes d'approches comme GR00T N2 ou Pi-0, mais mise sur une fusion multimodale plus riche et un passage a l'echelle des donnees d'entrainement. Les prochaines etapes attendues concernent la generalisation a d'autres plateformes robotiques et la validation hors des benchmarks controles du laboratoire.

IA physiqueActu
1 source
ThorArena : évaluation de l'interaction physique humanoïde à partir de démonstrations humaines de mouvement et de force
1589arXiv cs.RO 

ThorArena : évaluation de l'interaction physique humanoïde à partir de démonstrations humaines de mouvement et de force

Des chercheurs présentent sur arXiv (2607.06052) ThorArena, un nouveau benchmark pour évaluer l'interaction physique des robots humanoïdes en tenant compte des forces de contact, et non plus seulement du mouvement. L'équipe a constitué un jeu de données réel synchronisant le mouvement corporel complet d'un humain et les forces exercées par ses deux mains, sur six tâches d'interaction physique représentatives. À partir de ces démonstrations, elle propose le Force-Aware Tracking Score (FATS), une métrique qui évalue conjointement la précision du suivi corps entier, la robustesse à différents niveaux de force, l'effort de contrôle et la survie de l'épisode (le robot garde-t-il son équilibre sans échouer). Le protocole rejoue ensuite en simulation les forces d'interaction enregistrées, offrant une interface d'évaluation standardisée pour comparer différentes politiques de contrôle whole-body. Jusqu'ici, les jeux de données et benchmarks d'imitation de mouvement humanoïde se concentraient presque exclusivement sur la cinématique, laissant de côté les forces d'interaction synchronisées. Résultat : les évaluations existantes ne captaient pas comment les forces externes affectent la précision du suivi, la stabilité et la robustesse du contrôle, un angle mort critique dès qu'un robot humanoïde doit manipuler un objet, ouvrir une porte ou interagir physiquement avec un humain. Les expériences menées sur des politiques de contrôle whole-body représentatives montrent que l'évaluation sensible aux forces révèle des écarts de performance substantiels, invisibles dans les évaluations classiques sans force. Autrement dit, des politiques qui paraissent solides sur des métriques purement cinématiques peuvent s'avérer fragiles dès qu'elles rencontrent une résistance physique réelle, ce qui interroge la fiabilité des benchmarks actuels pour juger de la maturité réelle des humanoïdes destinés aux tâches à fort contact. ThorArena s'inscrit dans la lignée des travaux récents sur l'imitation de mouvement humanoïde et le contrôle corps entier, un domaine qui a rapidement progressé sur la précision du tracking mais restait largement évalué hors contexte de contact physique. En proposant un protocole unifié et reproductible, appuyé sur des démonstrations humaines synchronisant mouvement et force sur six tâches, les auteurs visent un standard d'évaluation partagé par la communauté robotique, à l'image de ce que les benchmarks de manipulation ont apporté à l'apprentissage par renforcement. Le travail ouvre la voie à des comparaisons plus rigoureuses entre politiques de contrôle issues de différents laboratoires, et pourrait orienter les prochaines générations de robots humanoïdes vers une robustesse accrue en interaction physique réelle, un prérequis pour des déploiements industriels ou domestiques crédibles.

RecherchePaper
1 source
Planifier puis évaluer : la planification multi-cibles améliore les pipelines de préhension par apprentissage
1590arXiv cs.RO 

Planifier puis évaluer : la planification multi-cibles améliore les pipelines de préhension par apprentissage

La préhension multi-doigts autonome reste un défi central en manipulation robotique. Les approches par optimisation directe donnent de bons résultats mais sont sensibles à l'initialisation et coûteuses en temps de calcul. Le cadre alternatif dit "generator-evaluator-planner" fonctionne en trois étapes : un générateur propose des candidats de prise, un évaluateur les classe par probabilité de succès, puis un planificateur de trajectoire tente d'atteindre la prise la mieux classée. En cas d'échec, le processus recommence avec la prise suivante, multipliant les calculs. Une équipe de recherche propose désormais d'inverser la logique dans un article publié sur arXiv (2509.07162v2, version révisée) : plutôt que d'évaluer les prises avant de planifier, le système planifie d'abord des trajectoires vers plusieurs cibles de préhension générées, puis l'évaluateur estime la probabilité de succès directement à la configuration terminale réellement atteinte par chaque trajectoire. Le robot exécute ensuite celle jugée la plus prometteuse. Les tests montrent une amélioration par rapport au cadre traditionnel, sur différents objets, générateurs et planificateurs de mouvement, avec une généralisation validée en conditions réelles, notamment sur des étagères et hauteurs de table variées. Ce changement d'ordre entre planification et évaluation s'attaque à un compromis structurel qui pénalise les pipelines de préhension actuels : évaluer une prise dans sa configuration idéale, non garantie atteignable, oblige soit à relancer coûteusement l'optimisation de trajectoire sur des candidats moins bons avec une probabilité de succès plus faible, soit à assouplir les seuils de précision du planificateur, ce qui dégrade la fiabilité de l'estimation. Pour les intégrateurs et les équipes travaillant sur le bin-picking, l'automatisation d'entrepôt ou la manipulation industrielle, ce goulot d'étranglement se traduit concrètement par des cycles plus lents ou des taux d'échec plus élevés. En évaluant la prise réellement atteignable plutôt qu'une cible théorique, l'approche vise à rapprocher les métriques de succès en simulation de la performance effective sur le terrain, un enjeu classique de l'écart entre démonstration et réalité en robotique apprenante. Le travail s'inscrit dans la lignée des recherches sur la préhension dextre par apprentissage, où les cadres générateur-évaluateur-planificateur se sont généralisés ces dernières années comme alternative aux méthodes d'optimisation pure. Les auteurs mettent à disposition un site dédié au projet (martinmatak.github.io/fpte) présentant leurs résultats expérimentaux. La validation en environnements réels et non simulés, sur du matériel varié, distingue cette contribution des nombreux travaux restant cantonnés à la simulation, même si l'ampleur du déploiement industriel de cette méthode reste à démontrer au-delà du cadre académique.

RecherchePaper
1 source
Thor : vers des réactions corporelles globales de niveau humain dans des environnements intenses à fort contact
1591arXiv cs.RO 

Thor : vers des réactions corporelles globales de niveau humain dans des environnements intenses à fort contact

Des chercheurs présentent Thor, un framework de contrôle par apprentissage par renforcement permettant aux robots humanoïdes de maintenir leur stabilité corps entier lors d'interactions physiques intenses avec leur environnement. Le système a été déployé sur la plateforme Unitree G1 et repose sur deux innovations : une fonction de récompense dite "force-adaptive torso-tilt" (FAT2), qui incline le buste du robot pour reproduire une réaction humaine naturelle face à un effort de traction, et une architecture qui découple le contrôle du haut du corps, de la taille et du bas du corps tout en partageant les observations globales entre ces trois modules. Les résultats chiffrés sont significatifs : le G1 atteint un pic de force de traction de 167,7 N en reculant, soit environ 48 % de son propre poids, et 145,5 N en avançant, des progressions respectives de 68,9 % et 74,7 % par rapport à la meilleure méthode de référence testée. Le robot est également capable de tirer un chariot chargé de 130 N et d'ouvrir une porte coupe-feu à une main en exerçant 60 N. Ce travail s'attaque à un angle mort persistant de la robotique humanoïde : la plupart des démonstrations publiques montrent de la marche, de l'équilibre ou de la manipulation légère d'objets, rarement des interactions à force soutenue comme tirer un objet lourd ou pousser contre une résistance. Or ces gestes sont précisément ceux attendus dans les usages industriels, logistiques ou de secours visés par les intégrateurs. En démontrant qu'une architecture de contrôle découplée permet de gérer la haute dimensionnalité du corps humanoïde sans perdre la coordination globale, Thor apporte un élément de réponse concret au problème du contrôle force-adaptatif, souvent relégué au second plan derrière la locomotion pure. Il s'agit d'une publication de recherche arXiv (version révisée), sans annonce commerciale ni communiqué d'entreprise associé : aucun calendrier de déploiement produit n'est évoqué. Le choix du Unitree G1, plateforme chinoise à bas coût largement utilisée dans la recherche académique en robotique humanoïde, en fait un banc d'essai représentatif plutôt qu'un produit fini. Les comparaisons sont faites face à des baselines de contrôle RL existantes, sans mention d'acteurs français ou européens dans ce travail.

RecherchePaper
1 source
Apprentissage d'a priori géométriques 4D pour des modèles d'action du monde efficaces en inférence
1592arXiv cs.RO 

Apprentissage d'a priori géométriques 4D pour des modèles d'action du monde efficaces en inférence

Des chercheurs publient MECo-WAM (Multi-Expert Co-Training World Action Model), une nouvelle architecture de "World Action Model" (WAM) concue pour la manipulation robotique, decrite dans un papier reference arXiv:2607.05468v1. L'idee est d'injecter des a priori geometriques 4D dans les representations video-action pendant l'entrainement, sans alourdir le graphe d'inference au moment du deploiement. Le systeme combine trois experts durant l'entrainement : un expert video, un expert action, et un expert 4D leger supervise par des cibles relationnelles issues d'un encodeur VGGT gele. Une visibilite asymetrique entre experts empeche les raccourcis non causaux entre geometrie auxiliaire et generation d'actions. Deux mecanismes assurent le transfert des connaissances geometriques vers le chemin video-action reellement deploye : une attention a masque de lecture 4D a decroissance progressive, qui fournit un guidage geometrique restreint en debut d'entrainement puis le retire par etapes, et une distillation geometrique temporelle orientee action, qui aligne les relations geometriques intra-image et leur evolution en priorisant les zones visuelles pertinentes pour l'action du robot. Au deploiement, tous les composants 4D auxiliaires sont supprimes. Sur les benchmarks LIBERO et RoboTwin 2.0, le modele atteint respectivement 98,2% et 92,6% de reussite, avec des gains confirmes sur des taches de manipulation reelles. Ce travail cible une limite connue des WAMs actuels : l'entrainement conjoint video-action optimise generalement des latents orientes apparence, qui capturent mal la geometrie evolutive necessaire a une manipulation precise. En montrant qu'un gain de precision est possible sans surcout d'inference, MECo-WAM repond a une tension centrale pour les integrateurs et les equipes de recherche appliquee : les modeles VLA (vision-language-action) les plus performants deviennent souvent trop lourds pour un deploiement temps reel embarque. La methode illustre une tendance de fond dans la recherche en manipulation robotique, celle de deporter la complexite geometrique et multimodale vers la phase d'entrainement pour ne conserver au runtime qu'un pipeline leger, une piste directement pertinente pour les fabricants de bras robotiques et de systemes AMR qui cherchent a industrialiser des politiques apprises. MECo-WAM s'inscrit dans la lignee des World Action Models qui cherchent a unifier prediction video future et generation de sequences d'actions executables, une approche deja explorée par des architectures VLA comme Pi-0 ou GR00T N2. La reference a VGGT, encodeur de geometrie 4D reconnu en vision par ordinateur, situe le papier a l'intersection de la reconstruction 3D/4D et de l'apprentissage de politiques robotiques. Les auteurs evaluent leur approche sur deux benchmarks de simulation standards, LIBERO et RoboTwin 2.0, ainsi que sur des taches reelles, mais ne donnent pour l'instant aucun calendrier de deploiement industriel ni de partenariat avec des integrateurs : le travail reste, a ce stade, une contribution de recherche publiee sur arXiv.

RecherchePaper
1 source
DSWAM : un modèle fondation à double système pour la manipulation robotique fine
1593arXiv cs.RO 

DSWAM : un modèle fondation à double système pour la manipulation robotique fine

Des chercheurs publient sur arXiv (référence 2607.04927v1) DSWAM, un nouveau modèle "Dual-System World Action Model" destiné à la manipulation robotique fine. Le système combine deux composants : un exécuteur System 1 basé sur un World Action Model (WAM), qui reste le chemin de contrôle par défaut, et un planificateur System 2 de type vision-langage, activé seulement quand une tâche nécessite une décomposition en sous-tâches. Ce planificateur prédit des sous-tâches exécutables à partir d'un court historique visuel et d'une consigne globale, tandis que l'exécuteur WAM génère les actions en tenant compte du contexte du monde observé. Contrairement aux WAM classiques, DSWAM ne génère pas de vidéo future à l'inférence : il prédit directement des séquences d'actions ("action chunks"), tout en étant entraîné avec une co-supervision vidéo. Pour un déploiement temps réel sur robot physique, les auteurs ajoutent une accélération TensorRT, une exécution asynchrone et un mécanisme de "real-time chunking" (RTC) afin que les requêtes du modèle ne bloquent pas le contrôle moteur. Le système est évalué sur le protocole DeMaVLA, dédié à la manipulation d'objets déformables, avec plateforme robotique, données de pré-entraînement et post-entraînement identiques à celles utilisées pour comparer aux politiques VLA. L'intérêt principal de ce travail est méthodologique autant que technique : jusqu'ici, la comparaison entre approches VLA (Vision-Language-Action) et WAM souffrait d'un manque de protocole équitable, chaque camp utilisant ses propres données, robots et critères d'évaluation. En imposant un cadre contrôlé (DeMaVLA), DSWAM cherche à trancher un débat central du secteur robotique : les modèles WAM, réputés plus ancrés physiquement mais moins doués pour planifier des instructions complexes en langage naturel, peuvent-ils combler cet écart via un module de planification optionnel, sans sacrifier la vitesse d'exécution nécessaire au contrôle temps réel ? Ce travail s'inscrit dans la lignée des VLA génériques comme Pi-0 ou GR00T N2, qui ont démontré la viabilité de politiques apprises à grande échelle mais peinent parfois sur des tâches multi-étapes complexes typiques des environnements domestiques. En positionnant explicitement le System 2 comme optionnel plutôt que systématique, DSWAM propose une architecture hybride que d'autres laboratoires pourraient reprendre pour arbitrer entre réactivité et capacité de planification, un compromis clé pour la manipulation fine à l'approche de déploiements domestiques réels.

RechercheActu
1 source
XS-VLA : associe distillation spatiale à gros grain et appariement de flux latent pour un contrôle robotique léger
1594arXiv cs.RO 

XS-VLA : associe distillation spatiale à gros grain et appariement de flux latent pour un contrôle robotique léger

Des chercheurs publient sur arXiv (juillet 2026) XS-VLA, un modele Vision-Language-Action en deux etapes concu pour le controle robotique embarque a faible cout de calcul. La premiere etape distille les connaissances spatiales d'un grand modele, Qwen3-VL-4B, vers un squelette leger SmolVLM2 de seulement 0,25 milliard de parametres, via un fine-tuning sur des descriptions spatiales grossieres. La seconde etape conditionne ce squelette enrichi avec une politique de Latent Flow Matching, qui combine un autoencodeur variationnel conditionnel (CVAE) et une dynamique de flow matching pour modeliser des distributions d'actions multimodales, plutot qu'un controleur deterministe classique. Sur le benchmark de simulation LIBERO, XS-VLA atteint l'etat de l'art parmi les modeles de moins de 0,5 milliard de parametres, avec un gain de taux de reussite moyen allant jusqu'a 7,2 points par rapport a la base SmolVLA 0,25B, dont 23 points sur la tache LIBERO-Long, et depasse meme la version SmolVLA a 2,2 milliards de parametres, pres de neuf fois plus grosse. Les auteurs revendiquent aussi une acceleration de 3,2 fois du temps d'execution de mission face a la precedente politique de flow matching legere. Le resultat cible un probleme concret pour l'industrie robotique: les grands modeles vision-langage comprennent bien l'espace mais sont trop lourds pour du controle temps reel embarque, tandis que les modeles legers souffrent generalement de "cecite spatiale". Si les chiffres se confirment au-dela de la simulation, cela suggere qu'un entrainement cible, distillation spatiale puis generation d'actions par flow matching, peut compenser un manque de parametres, ce qui interesse directement les integrateurs cherchant a deployer des VLA sur du materiel edge limite plutot que sur des clusters GPU. Ce travail s'inscrit dans la vague de modeles VLA ouverts lancee par des politiques comme Pi-0, GR00T N2 ou Helix, et prolonge specifiquement la lignee SmolVLA d'Hugging Face en visant l'efficacite plutot que la taille. Il reste toutefois a un stade de recherche: les resultats sont mesures sur LIBERO, un benchmark simule standard mais eloigne des conditions reelles, et aucune validation sur robot physique n'est mentionnee a ce stade.

IA physiqueActu
1 source
SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)
1595arXiv cs.RO 

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)

Une équipe de recherche publie SEAM (Smooth Execution of Action-Chunked Motion), une méthode d'inférence sans entraînement destinée aux politiques Vision-Language-Action (VLA) à appariement de flux (flow matching), décrite dans un article déposé sur arXiv (2607.04609). Testée sur le benchmark de simulation LIBERO-10 avec le modèle pi0.5 de Physical Intelligence, la méthode réduit de 28% les à-coups (jerk) aux frontières entre segments de trajectoire et de 27% la discontinuité de transition entre ces segments, tout en préservant le taux de réussite des tâches et en ajoutant un coût de calcul quasi nul par rapport à la version non guidée. Son mécanisme central, le Velocity-guided Loss Steering (VLS), exploite le fait que la fin non exécutée du segment précédent reste disponible comme référence de cohérence une fois le préfixe consommé par le robot, et applique une correction analytique après chaque étape d'Euler sans rétropropager dans le réseau. Le problème visé, la bifurcation multimodale, touche toutes les architectures VLA qui découpent leurs actions en segments de longueur fixe pour limiter la fréquence d'inférence, une approche partagée par des modèles comme pi0, GR00T N2 ou Helix. Quand deux segments adjacents, générés à partir de latents gaussiens indépendants, convergent vers des modes de trajectoire incompatibles, le robot produit des à-coups brusques aux jonctions, un symptôme visible de l'écart entre démonstration et exécution réelle. Les solutions existantes, rétropropagation à chaque étape de débruitage, échantillonnage par rejet ou réentraînement complet, imposaient toutes un compromis entre coût de calcul et fiabilité des tâches. Une correction déployable à l'inférence, sans toucher aux poids du modèle, intéresse directement les intégrateurs qui opèrent des politiques VLA figées sur du matériel de production. L'évaluation reste toutefois cantonnée à la simulation LIBERO-10, un banc d'essai standard mais éloigné des conditions réelles d'un bras ou d'un humanoïde en usine. La validation sur matériel physique et l'extension à d'autres politiques que pi_0.5 constituent les étapes naturelles avant toute adoption industrielle.

RechercheActu
1 source
MOSAIC : planification de manipulation centrée sur les compétences par simulation physique
1596arXiv cs.RO 

MOSAIC : planification de manipulation centrée sur les compétences par simulation physique

Le fossé entre le nombre potentiellement infini de compétences robotiques disponibles et l'incapacité des robots à les enchaîner de façon fiable sur des tâches longues reste un problème central en robotique. Une équipe de chercheurs présente MOSAIC, une méthode de planification centrée sur les compétences qui s'appuie sur la simulation physique pour estimer, avant exécution, la probabilité de succès de chaque compétence dans un contexte donné. Plutôt que d'explorer pas à pas un espace de séquences quasi infini, comme le font les méthodes incrémentales classiques, ou de raisonner sur des représentations symboliques simplifiées mais fragiles et coûteuses à construire à la main, MOSAIC combine deux familles complémentaires de compétences: les Générateurs, qui identifient des « îlots de compétence », c'est-à-dire des zones où une action donnée réussit de façon démontrable, et les Connecteurs, qui relient ces trajectoires entre elles en résolvant des problèmes aux limites. L'équipe a testé l'approche sur des tâches de manipulation longues et complexes, en simulation comme sur un robot réel, en mobilisant un ensemble hétérogène d'outils: modèles de diffusion génératifs, algorithmes classiques de planification de mouvement et modèles spécialisés en manipulation. Le papier, une version révisée publiée sur arXiv, est accompagné d'un site de démonstrations (skill-mosaic.github.io). L'enjeu dépasse la seule performance algorithmique. Le planning long-horizon par composition de compétences est considéré depuis des années comme un verrou pour des robots véritablement généralistes, capables d'assembler des briques génériques pour résoudre des tâches nouvelles sans reprogrammation dédiée. En concentrant l'effort de recherche sur les régions où chaque compétence est réellement fiable, plutôt que de faire confiance à une couverture uniforme de l'espace des possibles, MOSAIC apporte une réponse concrète à la fragilité chronique des approches symboliques et à l'explosion combinatoire des méthodes purement incrémentales, un sujet sensible à l'heure où l'industrie mise massivement sur les modèles vision-langage-action pour la généralisation. Cette contribution s'inscrit dans la lignée des travaux de planification tâche-et-mouvement (TAMP), où la tension entre robustesse symbolique et flexibilité des méthodes apprises est documentée de longue date. L'essor récent des politiques de diffusion et des modèles génératifs comme briques de bas niveau change la donne: MOSAIC propose justement un cadre capable d'orchestrer ce type d'outils hétérogènes sans passer par une couche symbolique rigide. La publication d'une troisième version sur arXiv suggère un travail encore en cours de révision, avec des démonstrations concrètes disponibles pour les équipes de recherche souhaitant évaluer la méthode sur leurs propres bancs d'essai.

RecherchePaper
1 source
Transition de phase de nuée et réponses aux menaces dans des essaims de drones autonomes bio-inspirés
1597arXiv cs.RO 

Transition de phase de nuée et réponses aux menaces dans des essaims de drones autonomes bio-inspirés

Ce document technique arXiv présente un algorithme de vol en essaim tridimensionnel inspiré du comportement animal, où chaque drone n'interagit qu'avec un nombre minimal de voisins influents, en s'appuyant uniquement sur des règles locales d'alignement et d'attraction, sans coordination centralisée ni partage global de position. En faisant varier systématiquement ces deux paramètres de gain, les chercheurs ont établi un diagramme de phase révélant des transitions nettes entre comportement de type essaim dispersé et banc compact façon poisson, ainsi qu'une zone critique où la susceptibilité du système, les fluctuations de polarisation et la capacité de réorganisation atteignent leur maximum. Des essais en extérieur avec un essaim réel de dix drones, couplés à des simulations reposant sur un modèle calibré de dynamique de vol, montrent que faire fonctionner l'essaim près de cette transition critique améliore sa réactivité aux perturbations externes. Confronté à un intrus, l'essaim exécute des virages collectifs rapides, des expansions transitoires, puis retrouve un alignement élevé en quelques secondes seulement. Ce résultat est significatif car il démontre que des règles d'interaction purement locales et minimales suffisent à générer plusieurs phases collectives distinctes, sans nécessiter d'architecture de contrôle centralisée coûteuse en calcul ou en communication, un frein habituel au passage à l'échelle des essaims de drones. La modulation de deux simples gains offre ainsi un mécanisme efficace pour ajuster stabilité, flexibilité et résilience selon le contexte opérationnel. Pour les intégrateurs de systèmes multi-drones, cela ouvre une voie vers des essaims capables de basculer dynamiquement entre un mode compact et économe en énergie et un mode dispersé et réactif, une propriété recherchée pour la surveillance, l'inspection d'infrastructures ou les applications de sécurité type détection d'intrusion, sans complexifier l'architecture logicielle embarquée. Cette approche s'inscrit dans une longue tradition de modélisation du mouvement collectif animal, des premiers modèles de boids aux travaux sur les bancs de poissons et les nuées d'étourneaux, transposée ici à la robotique aérienne réelle plutôt qu'à la seule simulation, ce qui reste rare dans ce champ de recherche. La validation en extérieur avec dix drones physiques, et non uniquement en environnement contrôlé, constitue une contribution notable face à la littérature dominée par les simulations numériques. Les prochaines étapes attendues concernent le passage à l'échelle vers des essaims plus larges et l'évaluation de la robustesse de ces transitions de phase face à des perturbations environnementales plus variées, notamment pour des usages en défense anti-drones ou en recherche et sauvetage.

RecherchePaper
1 source
Arbres de croyance gaussiens en temps continu pour la planification de mouvement
1598arXiv cs.RO 

Arbres de croyance gaussiens en temps continu pour la planification de mouvement

Un article de recherche publié sur arXiv (2607.02884) propose une nouvelle méthode de planification de trajectoire pour robots évoluant sous incertitude, en temps continu plutôt qu'en temps discret. Les auteurs modélisent la dynamique du robot comme une équation différentielle stochastique linéaire à temps continu, tandis que les mesures des capteurs n'arrivent qu'à des instants discrets. Ils construisent un modèle de propagation de croyance ("belief") hybride : entre deux mesures, la croyance évolue selon des équations différentielles ordinaires, puis subit une mise à jour brusque par filtre de Kalman à chaque nouvelle mesure. Pour garantir la sécurité, l'équipe introduit un vérificateur basé sur des fonctions barrières de croyance, capable de certifier la sécurité sur des segments entiers de trajectoire plutôt que seulement aux points d'échantillonnage. La méthode a été intégrée aux planificateurs RRT et SST et testée sur plusieurs environnements de référence, avec des taux de réussite élevés et un respect robuste des contraintes probabilistes, notamment dans des passages étroits. L'enjeu concret est la fiabilité des robots mobiles et manipulateurs en environnement incertain, un point critique pour les intégrateurs qui déploient des AMR ou des bras robotiques en usine. Les approches classiques de planification, qui ne vérifient la sécurité qu'à des nœuds discrets du chemin, peuvent laisser passer des violations de contraintes entre deux points d'échantillonnage, un angle mort particulièrement dangereux dans les couloirs étroits ou les zones à forte densité d'obstacles. En traitant l'incertitude et la vérification de sécurité en temps continu, cette approche comble une lacune connue des méthodes de planification sous incertitude, sans changer la nature probabiliste du problème. Ce travail s'inscrit dans la lignée des méthodes de planification sous incertitude basées sur des arbres de croyance, où les mises à jour par filtre de Kalman servent depuis longtemps à estimer l'état d'un robot à partir de mesures bruitées. En combinant cette estimation continue avec les planificateurs RRT et SST, largement utilisés en robotique mobile, les auteurs proposent une extension directement compatible avec les pipelines de planification existants, plutôt qu'un cadre entièrement nouveau à réimplémenter.

RecherchePaper
1 source
Robots à bras multiples : apprentissage neuronal de l'accessibilité Hamilton-Jacobi pour la planification décentralisée de trajectoires sûres
1599arXiv cs.RO 

Robots à bras multiples : apprentissage neuronal de l'accessibilité Hamilton-Jacobi pour la planification décentralisée de trajectoires sûres

Une équipe de chercheurs propose NeHMO, une méthode d'apprentissage par réseau de neurones basée sur la réductibilité de Hamilton-Jacobi (HJR) pour la planification de mouvement multi-bras en sécurité et de façon décentralisée. Le papier, publié sur arXiv (arXiv:2507.13940, version 2), s'attaque au problème de la coordination de plusieurs bras robotiques évoluant dans un espace de configuration couplé et de haute dimension. Plutôt que de s'appuyer sur un planificateur centralisé qui coordonne tous les bras mais peine à passer à l'échelle en temps réel, ou sur des méthodes décentralisées existantes qui supposent un comportement prévisible des autres bras, les auteurs entraînent une fonction de valeur de sécurité qui capture les contraintes de collision inter-bras dans le pire des cas. Cette représentation apprise alimente ensuite un module d'optimisation de trajectoire décentralisé, exécutable en temps réel sur chaque bras indépendamment. L'enjeu dépasse l'exercice académique: la planification multi-bras sûre est un goulot d'étranglement concret pour les cellules de fabrication et les postes d'assemblage où plusieurs manipulateurs partagent un espace de travail restreint. Les approches centralisées classiques deviennent impraticables dès que le nombre de bras augmente, tandis que les méthodes décentralisées à base d'apprentissage profond échouent dès qu'un bras voisin dévie d'un comportement anticipé, c'est à dire exactement le scénario que redoutent les intégrateurs industriels en environnement non coopératif. En garantissant une sécurité dans le pire des cas plutôt qu'une prédiction probable de comportement, NeHMO répond à une limite reconnue des architectures actuelles: la fragilité face à l'imprévisibilité, sans sacrifier le passage à l'échelle. La réductibilité de Hamilton-Jacobi est un outil classique de la théorie du contrôle pour la vérification formelle de sécurité, historiquement trop coûteux en calcul pour des systèmes multi-bras à haute dimension. L'apport ici est de le rendre tractable via une approximation neuronale, généralisable à différentes configurations de manipulateurs sans réentraînement complet. Selon les auteurs, la méthode surpasse les références de l'état de l'art sur des tâches de planification multi-bras jugées difficiles. Il s'agit toutefois d'un résultat de recherche publié en preprint, sans partenaire industriel ni déploiement annoncé à ce stade.

RecherchePaper
1 source
« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »
1600arXiv cs.RO 

« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »

Des chercheurs proposent une nouvelle méthode de sécurité pour les modèles Vision-Language-Action (VLA), les systèmes d'IA qui pilotent de plus en plus de robots humanoïdes et bras manipulateurs. Publiée sur arXiv (référence 2607.01378), l'étude cible spécifiquement les VLA basés sur le flow matching, une technique qui prédit non pas une seule action mais une trajectoire complète via un processus itératif de débruitage neuronal, à l'image de Pi-0, GR00T N2 ou Helix. Le problème identifié: les garde-fous de sécurité actuels ne bloquent que l'action immédiate du robot, sans anticiper les collisions à venir. La méthode proposée, baptisée guidage neuro-symbolique, reformule la sécurité comme un problème d'optimisation sous contrainte à norme minimale, appliqué directement pendant le débruitage des trajectoires intermédiaires bruitées. Testée sur le benchmark SafeLIBERO, elle atteint 82,8% d'évitement de collision et 81,6% de réussite des tâches, soit des gains de 6,3 et 19,8 points par rapport aux méthodes à une seule étape, les progrès les plus marqués apparaissant sur les tâches longues où les erreurs de trajectoire s'accumulent. Pour l'industrie robotique, cette avancée s'attaque à un angle mort réel du déploiement des VLA en usine ou en entrepôt: la plupart des systèmes actuels réagissent après coup plutôt que d'anticiper. Une correction en amont, intégrée au cœur du processus génératif plutôt qu'ajoutée en filtre externe, pourrait réduire les arrêts d'urgence et les interventions humaines sur les lignes où ces modèles pilotent des bras ou des robots mobiles autonomes (AMR). Le gain le plus significatif sur les tâches longues est particulièrement pertinent pour les intégrateurs, puisque c'est précisément sur ces séquences que les architectures VLA actuelles échouent le plus souvent en conditions réelles. Ce travail s'inscrit dans une littérature grandissante sur la sécurité des VLA, alors que ces modèles passent rapidement du stade de démonstration à des déploiements pilotes chez plusieurs acteurs de la robotique humanoïde. Les auteurs comparent leur approche aux méthodes de sécurité "single-step" existantes et proposent des démonstrations vidéo sur leur page de projet dédiée. Reste à voir si cette approche neuro-symbolique, validée pour l'instant en simulation sur SafeLIBERO, tiendra la route sur du matériel physique et à des cadences de production industrielles.

RecherchePaper
1 source