Aller au contenu principal

Recherche — page 2

2522 articles · page 2 sur 51

Publications scientifiques en robotique : arXiv cs.RO, ICRA, IROS, Humanoids, CoRL — nouveaux algorithmes, benchmarks et datasets.

IA incarnée et prédictive : le contrôle par apprentissage sûr pour les systèmes robotiques ego-monde
51arXiv cs.RO RecherchePaper

IA incarnée et prédictive : le contrôle par apprentissage sûr pour les systèmes robotiques ego-monde

Des chercheurs proposent SOWL-MPC, une méthode de contrôle prédictif sûr conçue pour un nouveau scénario baptisé "ego-world robotic framework": un robot ego doit naviguer aux côtés d'un autre robot ("world robot") dont la politique de contrôle est totalement inconnue. Plutôt que de supposer un comportement prévisible chez l'autre agent, comme le font la plupart des méthodes existantes, l'approche combine un mécanisme d'apprentissage en ligne basé sur des processus gaussiens variationnels épars (SVGP) avec un schéma de contrôle à horizon glissant. À partir de simples mesures d'état bruitées, le système infère une distribution postérieure sur la politique latente du robot tiers, mise à jour en continu via un conditionnement variationnel en ligne (OVC), puis propagée dans la dynamique non linéaire du système via un schéma approché de propagation des moments, avant d'alimenter un contrôleur prédictif (MPC) sensible à l'incertitude. La méthode a été testée lors de campagnes Monte Carlo en simulation sous ROS 2, puis validée sur du matériel robotique réel dans une arène intérieure. Il s'agit d'un article de recherche déposé sur arXiv (2607.22225v1), pas d'un produit commercialisé. L'enjeu dépasse l'exercice académique: dans les entrepôts, les usines ou les espaces partagés où circulent plusieurs robots mobiles (AMR) ou humanoïdes issus de flottes ou de fabricants différents, un robot ne connaît généralement pas la politique de contrôle exacte des autres agents évoluant autour de lui. Les méthodes de navigation sûre reposent le plus souvent sur des hypothèses simplificatrices, modèles cinématiques fixes, comportements connus à l'avance, qui s'effondrent dès que l'environnement devient hétérogène. Une approche capable d'apprendre en ligne le comportement d'un agent inconnu tout en garantissant des marges de sécurité formelles répond directement à ce point de friction, potentiellement utile pour l'intégration de flottes multi-fournisseurs. Le travail s'inscrit dans la lignée des recherches combinant processus gaussiens et contrôle prédictif pour la navigation sûre, un axe actif depuis plusieurs années en robotique mobile et en interaction homme-robot. La validation reste toutefois limitée à une arène intérieure contrôlée: le passage à des environnements réels plus complexes, avec davantage d'agents ou des dynamiques plus rapides, constitue la prochaine étape logique avant tout usage industriel.

1 source
Aviation autonome : évaluation zéro-shot des agents MLLM au niveau mission
52arXiv cs.RO 

Aviation autonome : évaluation zéro-shot des agents MLLM au niveau mission

Des chercheurs ont présenté MissionBench, un benchmark évaluant des agents pilotés par des modèles multimodaux de grande taille (MLLM) sur des missions aériennes complètes, à partir d'une seule instruction de haut niveau. Le corpus comprend 120 missions réparties sur cinq environnements 3D simulés et quatre familles de tâches. Les agents doivent planifier, naviguer et rendre compte du résultat en s'appuyant uniquement sur des observations égocentriques et leur historique d'actions, sans aucun fine-tuning spécifique au domaine aérien. Sur 22 MLLM testés, open source et propriétaires, le meilleur modèle ne réussit que moins de 35% des missions, contre 84,4% pour des opérateurs humains. Les auteurs notent des écarts de performance importants entre familles de modèles, mais aussi un effet d'échelle: les modèles plus grands montrent de meilleures capacités zéro-shot en environnement incarné. Ce résultat vient objectiver un doute déjà répandu chez les intégrateurs de systèmes autonomes: la capacité d'un modèle de langage à raisonner sur du texte ou des images isolées ne garantit pas sa compétence sur une tâche longue et multi-étapes en conditions réelles. L'écart de près de 50 points entre humains et meilleur modèle rappelle que la promesse d'un agent "donnez-lui une consigne, il se débrouille" reste largement prématurée pour les missions de drones ou de robots mobiles nécessitant planification adaptative, mémoire d'actions et correction d'erreurs en cours de route. Pour les décideurs évaluant des offres d'autonomie embarquée, c'est un signal à ne pas confondre démonstration isolée et fiabilité en conditions de mission complète. Le travail s'inscrit dans la tendance à utiliser des MLLM généralistes comme module de raisonnement central d'agents incarnés, plutôt que des modèles vision-langage-action spécialisés type Pi-0 ou GR00T N2. Les benchmarks existants évaluaient surtout la perception ou des sous-tâches isolées; MissionBench vise l'évaluation de bout en bout, en boucle fermée. Les auteurs appellent explicitement à davantage d'évaluations en boucle fermée pour mesurer si les gains obtenus par simple mise à l'échelle des modèles se traduisent réellement en fiabilité opérationnelle, plutôt qu'en performance de façade sur des benchmarks statiques.

RecherchePaper
1 source
Impédance de manipulateurs embarqués sur navire via dynamique inverse dans l'espace des tâches basée sur l'optimisation
53arXiv cs.RO 

Impédance de manipulateurs embarqués sur navire via dynamique inverse dans l'espace des tâches basée sur l'optimisation

Des chercheurs proposent un nouveau système de contrôle pour bras robotiques embarqués sur des navires, confrontés aux mouvements erratiques de la houle. Le framework combine une commande au niveau couple, basée sur la dynamique inverse en espace tâche (task-space inverse dynamics, TSID), résolue par programmation quadratique, avec un contrôle d'impédance permettant de gérer à la fois le suivi précis de trajectoire et les tâches de manipulation en contact. Pour compenser dynamiquement les perturbations liées au mouvement de la base, un filtre de Kalman à état d'erreur (ESKF) estime en temps réel la position de la base en fusionnant les données inertielles avec le retour de pose de l'effecteur terminal. Testée en simulation puis en conditions réelles sur un bras manipulateur à 7 degrés de liberté (DOF) monté sur une plateforme Stewart à 6 DOF simulant le tangage et le roulis d'un navire, la méthode réduit l'erreur de suivi de position de l'effecteur de plus de 25,7% par rapport à la meilleure référence testée. Elle permet aussi une insertion dynamique de type peg-in-hole avec seulement 1 mm de jeu, tout en réduisant de 45% les forces de contact moyennes. Cette avancée s'attaque à un verrou technique concret pour la robotique maritime et offshore: la manipulation fine à bord de plateformes mobiles reste un défi majeur pour l'entretien d'infrastructures en mer, le transfert de charges entre navires ou les opérations de maintenance sur éoliennes offshore, où le couplage dynamique entre base instable et bras articulé dégrade habituellement la précision et complique tout contact contrôlé. Une réduction significative des forces de contact tout en maintenant un succès élevé sur une tâche de précision millimétrique constitue une preuve tangible que des opérations délicates, jusqu'ici réservées à des environnements statiques, deviennent envisageables en mer. Ce travail s'inscrit dans la lignée des recherches en contrôle robuste pour bases mobiles non stationnaires, où les approches précédentes peinaient à combiner compensation dynamique et compliance en environnement de contact. En couplant estimation d'état par capteurs inertiels et retour visuel ou de pose, les auteurs ouvrent la voie à des validations sur navires réels et à l'extension de la méthode à d'autres configurations de bras et de plateformes mobiles instables.

RecherchePaper
1 source
ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts
54arXiv cs.RO 

ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts

Des chercheurs présentent ViTacWorld, un modèle de monde visuo-tactile conditionné par l'action, conçu pour la manipulation robotique riche en contacts, décrit dans une prépublication arXiv (2607.22530v1). Le système s'appuie sur des jeux de données tactiles réels publics combinés à un environnement de simulation construit spécifiquement pour l'occasion, afin de générer à grande échelle des trajectoires visuo-tactiles-actions. Le modèle est d'abord préentraîné sur de larges volumes de trajectoires réelles et simulées, puis affiné avec des rollouts de politiques collectés en conditions réelles pour mieux coller aux comportements de manipulation visés. À partir d'une séquence d'actions du robot, ViTacWorld prédit conjointement les observations visuelles et le retour tactile correspondants, permettant de générer des rollouts visuo-tactiles-actions complets. Les auteurs présentent cela comme le premier cadre exploitant un modèle de monde pour la génération de trajectoires visuo-tactiles-actions et l'évaluation de politiques robotiques. L'enjeu central est le coût et la rareté des données tactiles réelles, qui freinent l'apprentissage robotique basé sur le toucher : matériel spécifique, collecte coûteuse, diversité de tâches et de scènes limitée. En misant sur le fait que le signal tactile, directement ancré dans le contact physique, souffre d'un écart simulation-vers-réel plus faible que la seule vision, ViTacWorld propose une voie pour combler ce manque de données sans multiplier les campagnes de collecte sur robot réel. Pour les équipes de recherche en manipulation fine (assemblage, insertion, préhension d'objets déformables), cela ouvre deux usages concrets : générer des données synthétiques pour améliorer des politiques tactiles en aval, et évaluer des politiques existantes en prédisant leurs résultats visuo-tactiles sous des séquences d'actions contrôlées, sans passer systématiquement par des essais physiques. C'est un signal de plus que les modèles de monde, déjà répandus en vision, commencent à s'étendre à d'autres modalités sensorielles pour la robotique de contact. Ce travail s'inscrit dans la lignée des modèles de monde appliqués à la robotique, jusqu'ici centrés presque exclusivement sur la modalité visuelle, et dans la continuité des efforts pour réduire la dépendance de l'apprentissage tactile aux capteurs propriétaires et aux collectes sur site. Les expériences menées par les auteurs sur des tâches de manipulation riches en contacts montrent que ViTacWorld génère des rollouts physiquement cohérents, améliore les performances de politiques via une augmentation de données scalable, et permet une évaluation de politiques conditionnée par l'action. Le projet est documenté sur vitacworld.github.io. L'article ne mentionne aucun partenariat industriel ni déploiement commercial à ce stade : il s'agit d'une contribution de recherche dont la portée réelle dépendra de sa reproduction sur des plateformes robotiques variées et de son adoption par des équipes travaillant sur l'assemblage ou la manipulation fine en environnement industriel.

RecherchePaper
1 source
Robot-Factored World Models via le rendu de robots
55arXiv cs.RO 

Robot-Factored World Models via le rendu de robots

Un article de recherche publié sur arXiv (2607.22535) propose une nouvelle architecture pour les "world models" en robotique, ces systèmes qui prédisent les observations futures d'une scène à partir d'une image initiale et d'un signal d'action. L'équipe identifie un problème structurel dans les approches existantes : conditionner le modèle directement sur les commandes d'action l'oblige à apprendre lui-même comment le corps du robot et son contrôleur traduisent ces commandes en mouvement réel, tandis que le conditionner sur les états futurs enregistrés revient à lui donner d'avance le résultat qu'il est censé prédire. La solution proposée, baptisée "robot-factored world model", sépare deux facteurs propres au robot en amont du modèle. D'abord, la trajectoire nominale : chaque commande est passée par le contrôleur et la cinématique du robot pour produire un signal intermédiaire disponible au déploiement. Ensuite, le rendu robotique : cette trajectoire est rendue via le fichier URDF du robot, extrayant sa géométrie et son apparence du modèle d'apprentissage. Pour lever l'ambiguïté de profondeur, les chercheurs associent la profondeur de l'effecteur terminal à celle de la scène. Cette approche cible un angle mort connu des modèles vidéo conditionnés par l'action utilisés en planification et simulation robotique, à savoir leur difficulté à généraliser au-delà du robot sur lequel ils ont été entraînés. Les résultats montrent que l'interface de rendu surpasse les méthodes de référence conditionnées par vecteurs d'action et généralise à des embodiments robotiques inédits au moment de l'inférence, un point sensible pour l'industrie alors que les modèles vision-langage-action (VLA) cherchent à s'affranchir de la dépendance à une plateforme matérielle unique. Le modèle parvient aussi à générer des vidéos de manipulation robotique à partir de démonstrations humaines, en retargetant le mouvement de la main vers une géométrie de robot. Ces travaux s'inscrivent dans une compétition plus large autour des world models et des politiques VLA à grande échelle, un terrain où Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) investissent massivement pour rendre leurs systèmes transférables d'un robot à l'autre. La piste du rendu explicite de la géométrie robotique, plutôt que son encodage implicite dans des vecteurs d'action, pourrait devenir un standard méthodologique si elle se confirme sur des déploiements réels au-delà des benchmarks académiques.

RecherchePaper
1 source
Modèles de génération de graphes de scènes 2D géométriques
56arXiv cs.RO 

Modèles de génération de graphes de scènes 2D géométriques

Une équipe de recherche propose une nouvelle méthode pour générer automatiquement des graphes de scène représentant les relations d'assemblage entre composants, sans recourir à des données sémantiques annotées et en fonctionnant avec un jeu de données très restreint. Le pipeline s'appuie d'abord sur un modèle Faster R-CNN pour détecter les composants et produire des représentations géométriques de leur position et de leur forme. Ces représentations passent ensuite par une architecture transformer chargée de générer une matrice d'adjacence, qui sert à son tour d'entrée à un réseau siamois. Ce dernier utilise un mécanisme de passage de messages fondé sur un réseau convolutionnel de graphe attentionnel (aGCN) pour caractériser précisément la nature des connexions entre pièces. La méthode a été validée sur un jeu de données d'étude composé de pièces de modèles réduits assemblables en véhicules de transport (type maquettes jouets). Pour la robotique d'assemblage, ce travail répond à un problème très concret : un bras robotique ne peut planifier ni exécuter un montage sans comprendre comment les pièces s'articulent entre elles, et les approches classiques de génération de graphes de scène reposent généralement sur de lourdes bases sémantiques annotées, coûteuses à constituer pour chaque nouveau produit industriel. En s'appuyant uniquement sur la géométrie détectée visuellement et en tolérant de petits volumes de données d'entraînement, cette approche vise à réduire le travail d'annotation nécessaire pour déployer un système de compréhension d'assemblage sur une nouvelle chaîne de production ou un nouveau produit, ce qui intéresse directement les intégrateurs et les équipes R&D en robotique industrielle. Ce travail s'inscrit dans la lignée des recherches sur la génération de graphes de scène (scene graph generation), initialement développée pour la compréhension d'images en vision par ordinateur, mais ici réorientée vers un cas d'usage industriel précis : la planification d'assemblage robotique. La combinaison Faster R-CNN plus transformer plus réseau siamois à base de aGCN constitue une architecture hybride originale, distincte des approches purement sémantiques dominantes dans ce domaine. Publiée sur arXiv, cette contribution reste à ce stade une preuve de concept testée sur un jeu de données jouet ; sa généralisation à des composants industriels réels, à des géométries plus complexes ou à des scènes encombrées reste une étape à valider.

RecherchePaper
1 source
DB-VIO : odométrie visuelle-inertielle à double branche avec représentation visuelle-inertielle améliorée
57arXiv cs.RO 

DB-VIO : odométrie visuelle-inertielle à double branche avec représentation visuelle-inertielle améliorée

Résumé rédigé, sans travail d'outil nécessaire. DB-VIO est un nouveau système d'odométrie visuo-inertielle développé pour estimer précisément la pose à six degrés de liberté (6-DoF) des robots mobiles, présenté dans un preprint publié sur arXiv (arXiv:2607.22123v1). Contrairement aux approches d'apprentissage existantes qui fusionnent vision et inertie dans une représentation unique traitée par un seul modèle temporel, DB-VIO sépare le problème en deux branches dédiées, une pour la rotation, une pour la translation. Le système enrichit la perception visuelle monoculaire avec des indices de profondeur et injecte un a priori d'attitude intégré pour renforcer les signaux rotationnels souvent implicites dans les données brutes de la centrale inertielle (IMU). Testé sur les benchmarks KITTI (conduite autonome) et EuRoC (robot aérien), DB-VIO améliore les méthodes de référence de 20% sur KITTI et de 33% sur EuRoC, avec un gain de 65,7% sur la métrique rotationnelle dans les scénarios de mouvement agile d'EuRoC. Ces résultats, à ce stade limités à des benchmarks académiques standardisés et non à un déploiement réel, illustrent une tendance de fond dans la navigation robotique: la décomposition explicite des tâches de perception plutôt que des architectures monolithiques tend à mieux capturer des dynamiques physiques hétérogènes. Pour les intégrateurs travaillant sur des drones, des véhicules autonomes ou des robots mobiles, ce type d'avancée conditionne directement la fiabilité du suivi de trajectoire en environnement GPS-dégradé, un enjeu critique pour la navigation en intérieur ou en essaim. L'odométrie visuo-inertielle reste un champ actif depuis les approches classiques comme VINS-Mono jusqu'aux méthodes apprises plus récentes, ces dernières cherchant à dépasser les limites des pipelines géométriques traditionnels face au bruit capteur et aux mouvements rapides. DB-VIO s'inscrit dans cette lignée en ciblant spécifiquement la faiblesse connue des features monoculaires, l'absence de structure géométrique explicite. Aucune date d'intégration industrielle ni partenariat n'est mentionné à ce stade, le travail restant une contribution de recherche.

RecherchePaper
1 source
Main humanoïde monolithique à pliage origami asymétrique et actionneurs à double chambre
58arXiv cs.RO 

Main humanoïde monolithique à pliage origami asymétrique et actionneurs à double chambre

Une équipe de chercheurs présente une nouvelle main robotique souple entièrement monolithique, baptisée OSOR (Origami-inspired SOft Robotic hand), imprimée en une seule pièce par frittage laser sélectif (SLS) dans un seul matériau, le polyuréthane thermoplastique (TPU). L'innovation repose sur deux structures géométriques inédites : le motif de flexion origami asymétrique (AOB), décliné en versions à chambre simple (AOB-S) pour les doigts et à double chambre asymétrique (AOB-D, ou ADC) pour la paume, qui reproduit un mouvement combiné doigts-paume inspiré de la main humaine. Les essais expérimentaux, validés par des modèles analytiques et une analyse par éléments finis, montrent une amplitude de flexion maximale de 203 degrés pour les doigts et 40 degrés pour la paume, avec des forces de sortie respectives de 6,3 N et 16 N. La main démontre plusieurs types de préhension : pincement délicat d'un morceau de tissu, saisie stable d'une bouteille d'eau à deux doigts, prise paume seule, et l'ensemble des prises de puissance recensées dans la taxonomie standard des préhensions manufacturières. L'apport principal ne tient pas tant à la performance brute qu'à la simplification radicale de la fabrication. Les mains souples existantes offrent une bonne adaptabilité passive mais restent souvent limitées par des architectures multi-matériaux ou multi-pièces, coûteuses à produire et fragiles à assembler. En démontrant qu'une géométrie asymétrique unique permet à la fois la flexion des doigts et le mouvement de paume dans une structure imprimable en un seul bloc, les auteurs répondent directement au compromis habituel entre performance et facilité de production, un frein connu à l'adoption industrielle des préhenseurs souples pour la manutention, la logistique ou la robotique collaborative. Ce travail s'inscrit dans la lignée des actionneurs souples inspirés de l'origami, un axe de recherche actif visant à remplacer les architectures pneumatiques complexes par des géométries pliables imprimables directement. Contrairement aux préhenseurs à jamming granulaire ou aux mains tendineuses multi-articulées développées par d'autres laboratoires, l'approche ici mise sur la simplicité structurelle plutôt que sur la richesse des degrés de liberté. Les auteurs évoquent la poursuite des travaux vers une caractérisation plus fine du ratio d'asymétrie et une intégration potentielle sur des bras robotiques complets.

RecherchePaper
1 source
Modèle Vision-Langage-Action pour la manipulation multi-mains via recherche dans les espaces d'assignation et nuls
59arXiv cs.RO 

Modèle Vision-Langage-Action pour la manipulation multi-mains via recherche dans les espaces d'assignation et nuls

Des chercheurs publient sur arXiv (arXiv:2607.22020, nouvelle soumission) une méthode pour résoudre un problème d'exécution resté largement irrésolu dans la robotique par apprentissage : les politiques de manipulation entraînées produisent aujourd'hui des trajectoires pour des « mains » abstraites, indépendantes de toute plateforme physique, ce qui facilite la collecte de démonstrations et le transfert d'un robot à l'autre. Mais transposer ces sorties sur un robot réel à plusieurs bras pose trois contraintes simultanées : assigner chaque trajectoire de main à un bras physique, faire en sorte que chaque bras suive dans l'espace des configurations la trajectoire prescrite de son effecteur, et respecter les limites cinématiques tout en évitant les collisions entre bras. En l'absence d'algorithme dédié, les équipes bricolent aujourd'hui des pipelines de cinématique inverse (IK) mono-bras étendus ad hoc, sans garantie de faisabilité ni de sécurité. Les auteurs proposent un planificateur fondé sur le Conflict-Based Search (CBS), qui recherche conjointement dans l'espace discret d'assignation des trajectoires aux bras et dans l'espace continu des espaces nuls jacobiens des bras redondants, exploitant cette redondance pour éviter les collisions inter-bras tout en suivant les mouvements prescrits. Le projet est documenté sur omcbsa.github.io. Ce travail s'attaque directement au maillon faible entre les politiques génératives type VLA (Pi-0, GR00T N2, Helix) et leur déploiement effectif sur des plateformes multi-bras ou humanoïdes bi-manuelles. Il illustre un écart typique du secteur : une politique peut être excellente en simulation ou sur une seule paire de bras, sans qu'il existe de méthode garantissant sa transposition sûre et complète à un robot physique concret. Pour les intégrateurs, disposer d'un cadre théoriquement complet, plutôt que d'heuristiques IK non garanties, réduit le risque d'échecs d'exécution ou de collisions lors du passage du laboratoire au déploiement industriel. CBS est historiquement un algorithme de planification multi-agents pour la recherche de chemins sans collision entre plusieurs robots mobiles ; son adaptation ici à l'espace nul des manipulateurs redondants est la contribution centrale. Il s'agit pour l'instant d'un travail de recherche publié en preprint, sans annonce de pilote industriel ni de partenaire ; la suite naturelle serait une validation sur des plateformes multi-bras réelles au-delà des démonstrations du site du projet.

RecherchePaper
1 source
Modélisation de récompense de progression pour l'apprentissage robotique : une étude complète
60arXiv cs.RO 

Modélisation de récompense de progression pour l'apprentissage robotique : une étude complète

Une étude publiée sur arXiv (arXiv:2607.21655v1) propose la première synthèse structurée de la littérature sur le "progress reward modeling" en apprentissage robotique, soit les signaux de récompense qui mesurent l'avancement d'une tâche pendant son exécution, et non plus seulement à son terme. Le constat de départ est simple: un signal de succès terminal indique si la tâche est accomplie, mais ne dit rien sur le fait qu'un robot progresse, stagne ou régresse dans son comportement en cours de route. Face à la profusion de méthodes récentes exploitant ce type de retour intermédiaire, les auteurs organisent le champ en trois axes reliés: l'interface du modèle (quelles observations et spécifications d'objectif il reçoit, quel signal de progression il produit), les mécanismes internes de construction de ce signal, puis les données et protocoles d'évaluation qui servent à le valider. L'étude recense aussi les limites actuelles des approches existantes et esquisse des pistes de recherche futures. L'enjeu dépasse la seule taxonomie académique. En apprentissage par renforcement ou par imitation, la récompense terminale rare reste un goulot d'étranglement majeur pour les tâches longues de manipulation ou de locomotion: sans retour intermédiaire, l'agent ne sait pas s'il se rapproche de l'objectif. Des signaux de progression denses, exploitables par des politiques vision-langage-action comme GR00T ou Pi-0, promettent un apprentissage plus efficace en échantillons. Mais les auteurs pointent surtout l'absence de cadre commun: espaces d'observation, formats de signal, sources de supervision et protocoles d'évaluation diffèrent d'un papier à l'autre, rendant les comparaisons de résultats entre laboratoires largement invalides en l'état. Ce travail s'inscrit dans la lignée des modèles de récompense apparus avec le RLHF pour les grands modèles de langage, transposés ici au monde incarné, après des années de récompenses denses conçues à la main ou de signaux terminaux trop pauvres pour guider l'apprentissage. Les approches récentes s'appuient sur des fonctions de valeur apprises à partir de vidéos, des modèles vision-langage utilisés comme juges, ou de l'apprentissage contrastif contre des démonstrations. Sans annoncer de nouveaux résultats expérimentaux, cette synthèse vise avant tout à poser les bases de benchmarks standardisés pour ce sous-domaine en pleine expansion.

RecherchePaper
1 source
Ordered Action Tokens pour l'apprentissage de politiques visuomotrices
61arXiv cs.RO 

Ordered Action Tokens pour l'apprentissage de politiques visuomotrices

Des chercheurs publient sur arXiv (arXiv:2607.21670v1) une nouvelle méthode de tokenisation d'actions pour les politiques visuomotrices de robots, baptisée OAT (Ordered Action Tokenization). Le problème visé est concret : pour piloter un bras ou un robot humanoïde via un modèle vision-langage-action (VLA), il faut convertir des séquences d'actions continues en tokens discrets, une étape clé de l'architecture. Les méthodes existantes échouent sur deux fronts, soit elles produisent des séquences de tokens beaucoup trop longues, soit elles génèrent des tokens latents appris mais sans structure interne, ce qui les rend peu compatibles avec les politiques de contrôle en aval. OAT combine un transformer à registres, une quantification scalaire finie et des mécanismes d'entraînement qui imposent un ordre aux tokens produits. Concrètement, chaque préfixe de la séquence de tokens est entraîné à pouvoir, à lui seul, se décoder en une action valide, les premiers tokens portant l'information de contrôle grossière et les suivants affinant les détails résiduels. Les auteurs ont testé la méthode sur trois architectures de politiques différentes et plus de 60 tâches, couvrant cinq bancs d'essai en simulation ainsi que des scénarios réels. Cette structure ordonnée change la donne opérationnelle : elle permet un compromis "anytime" entre coût de calcul à l'inférence et précision du geste, un point critique pour le déploiement embarqué où la latence contraint directement la cadence de contrôle. Pour les intégrateurs travaillant avec des politiques autorégressives ou des architectures hybrides combinant tokens et experts de type flow, cela ouvre la possibilité d'ajuster dynamiquement le compromis vitesse-précision sans changer de modèle, un besoin réel face aux VLA actuels souvent jugés trop lents pour du contrôle temps réel industriel. Le travail s'inscrit dans la lignée des tokenizers d'actions développés pour les politiques VLA type Pi-0 ou GR00T N2, où l'encodage des actions reste un goulot d'étranglement identifié par la recherche depuis l'essor de ces modèles. En comparant explicitement autorégression pure et co-entraînement par tokens dans un cadre flow-based, les auteurs positionnent OAT comme une brique d'interface générique, potentiellement réutilisable au-delà des architectures testées dans l'étude.

RechercheActu
1 source
Robot apprend à communiquer via des abstractions visuelles projetées
62arXiv cs.RO 

Robot apprend à communiquer via des abstractions visuelles projetées

Des chercheurs presentent un systeme robotique capable d'exprimer des formes via des ombres projetees, construit autour d'une main dexterisee a 21 degres de liberte recouverte d'une peau souple compliante qui limite les fuites de lumiere et produit des silhouettes continues. Le coeur du systeme est un "self-model" differentiable, appris par exploration autonome sans tache predefinie, qui associe chaque configuration de la main a l'ombre qu'elle projette. A partir d'une image ou d'une video cible, le robot optimise sa configuration par descente de gradient sur ce modele appris, puis affine la solution via une simulation tenant compte des collisions pour garantir des mouvements physiquement realisables. Pour les ombres en mouvement, les chercheurs ajoutent des objectifs de region expressive, une regularisation de lissage temporel et une optimisation par images-cles. Les demonstrations couvrent la langue des signes, les ombres chinoises artisanales et l'imitation de mouvements animaux, testees en simulation et sur robot physique. L'interet depasse le gadget: peu de travaux en robotique expressive abordent la communication via une abstraction visuelle du corps plutot que par la morphologie elle-meme. Pour la recherche en interaction homme-robot, cela ouvre un canal alternatif aux gestes directs ou aux ecrans expressifs, en exploitant un phenomene physique universellement lisible. La demonstration valide aussi, a petite echelle, la faisabilite d'un self-model differentiable appris par auto-exploration plutot que programme manuellement, une approche qui rejoint la tendance des modeles de monde appris pour la manipulation dexterisee. Reste que ce travail est une preuve de concept en laboratoire, sans donnees sur la robustesse en conditions reelles ni sur le temps de calcul requis. Cette recherche s'inscrit dans la lignee des mains robotiques a haut nombre de degres de liberte, un axe distinct des mains de prehension des humanoides generalistes comme Figure ou Tesla Optimus, davantage orientees manipulation qu'expression. La question des abstractions corporelles projetees prolonge les travaux sur les visages expressifs des robots sociaux, ici sous un angle purement optique. Publie sur arXiv, l'article ne mentionne ni calendrier de suite ni application commerciale visee: il s'agit d'une demonstration de faisabilite scientifique posant un cadre reutilisable par d'autres equipes travaillant sur l'expressivite robotique, non d'un produit ou d'un pilote industriel.

RecherchePaper
1 source
Robot Serpent : Locomotion Ondulatoire Adaptative en Milieu Visqueux Dynamique via Apprentissage par Renforcement Profond
63arXiv cs.RO 

Robot Serpent : Locomotion Ondulatoire Adaptative en Milieu Visqueux Dynamique via Apprentissage par Renforcement Profond

Des chercheurs démontrent qu'un robot serpent piloté par apprentissage par renforcement profond (DRL) peut adapter sa locomotion en temps réel dans des environnements visqueux dont les propriétés changent dynamiquement, là où les méthodes de contrôle classiques à trajectoire prédéfinie échouent. Le problème est formulé comme un processus de décision markovien partiellement observable, puisque le robot ne dispose d'aucun capteur embarqué mesurant directement la viscosité du fluide environnant. La solution repose sur un cadre acteur-critique asymétrique : une politique "professeur" est d'abord entraînée en simulation physique avec accès à des informations privilégiées (la viscosité réelle), puis distillée dans une politique "étudiante" qui ne s'appuie plus que sur des capteurs proprioceptifs, exploitables sur un robot réel. Testé sur une plage de viscosités dynamiques allant de 10⁻⁷ à 10⁻² m²/s, l'agent apprend spontanément des allures ondulatoires non sinusoïdales, en rupture avec les gaits classiques, qui améliorent à la fois la vitesse de propulsion et l'efficacité de transport. L'intérêt dépasse le simple exercice académique : les robots serpents sont pressentis pour l'inspection de pipelines, l'exploration de milieux confinés ou sous-marins, et les opérations de recherche et sauvetage, autant de contextes où la viscosité du milieu (eau, boue, hydrocarbures) varie sans prévenir. Démontrer qu'un contrôleur peut inférer implicitement les propriétés physiques de l'environnement sans capteur dédié, uniquement via la distillation de connaissances privilégiées, ouvre une voie pour s'affranchir des modèles hydrodynamiques classiques, souvent trop rigides face à l'imprévisibilité réelle des fluides. Ce travail s'inscrit dans la lignée des recherches sur la locomotion bio-inspirée, où le contrôle par générateurs de patterns centraux (CPG) et les gaits sinusoïdaux dominent depuis des décennies faute d'alternative robuste. Il rejoint aussi la tendance plus large du DRL en robotique locomotrice, illustrée par les transferts sim-to-réel sur quadrupèdes ou bipèdes. Les résultats présentés restent toutefois cantonnés à la simulation ; la validation sur un robot serpent physique, confronté à de vrais fluides et à leurs bruits de mesure, constitue l'étape suivante logique avant tout déploiement industriel.

RecherchePaper
1 source
Apprentissage de tâches humanoïdes variées via des scénarios vidéo synthétiques, sans données du monde réel
64arXiv cs.RO 

Apprentissage de tâches humanoïdes variées via des scénarios vidéo synthétiques, sans données du monde réel

Une équipe de recherche propose une nouvelle méthode pour entraîner des robots humanoïdes sans passer par la collecte de données réelles, coûteuse et chronophage. Décrite dans un article publié sur arXiv (2607.21648), l'approche utilise l'IA générative pour transformer de simples prompts textuels en séquences vidéo synthétiques et réalistes de mouvements humains. Plutôt que de filmer des opérateurs humains exécutant une tâche, encore et encore, pour capturer différentes variantes de mouvement, le système génère lui-même de multiples façons d'accomplir une même action. Ces démonstrations synthétiques servent ensuite de matériel d'apprentissage pour le robot, selon un principe proche du Learning-from-Demonstration mais sans intervention humaine directe. Les chercheurs ont testé leur méthode sur quatre scénarios de simulation, avec des résultats montrant que le robot exécute les tâches avec succès et s'adapte à des variations complexes de mouvement. L'intérêt de cette approche tient au goulot d'étranglement bien identifié de l'apprentissage par démonstration pour les humanoïdes : la morphologie proche de l'humain ouvre des possibilités motrices riches, mais capturer suffisamment de données réelles diversifiées, couvrant les multiples façons dont différentes personnes réalisent une même tâche, reste onéreux et limité en échelle. Si la génération synthétique de mouvements humains via IA générative tient ses promesses en conditions réelles, elle pourrait réduire la dépendance aux tournages de motion capture et accélérer l'entraînement de modèles de type VLA, un enjeu central pour des acteurs comme Figure, Physical Intelligence ou NVIDIA avec GR00T. Ce travail s'inscrit dans une tendance de recherche plus large qui explore les données synthétiques et la simulation pour combler l'écart entre démonstration et déploiement réel, le fameux problème du sim-to-real. Il reste toutefois à ce stade un résultat de simulation publié en preprint, sans validation sur robot physique ni comparaison chiffrée avec des méthodes concurrentes de génération de données d'entraînement, ce qui invite à la prudence avant toute extrapolation vers une application industrielle.

RecherchePaper
1 source
Chargement en 30 000 heures de données tactiles comble le fossé de l'IA incarnée : XinZhi Embodied et l'université Fudan publient trois rapports techniques sur la perception haptique
65Pandaily 

Chargement en 30 000 heures de données tactiles comble le fossé de l'IA incarnée : XinZhi Embodied et l'université Fudan publient trois rapports techniques sur la perception haptique

XinZhi Embodied et l'université Fudan ont publié conjointement trois rapports techniques consacrés à un maillon longtemps négligé de l'intelligence incarnée : le toucher. Alors que la vision et le langage progressent rapidement dans les modèles de manipulation robotique, la perception tactile reste en retard, alors qu'elle est indispensable pour saisir, assembler ou identifier des objets. La collaboration, basée à Shanghai, met à disposition 30 000 heures de données d'interaction tactile collectées sur de véritables opérations robotiques, destinées à entraîner des modèles capables de reconnaître texture, dureté, température et friction par le contact. Les trois rapports couvrent respectivement la conception et l'étalonnage des capteurs tactiles, la méthodologie de collecte de données à grande échelle, et l'entraînement de modèles de manipulation sensibles au toucher. L'approche matérielle combine plusieurs principes de transduction, capacitif, piézoélectrique et résistif, afin de capter à la fois la distribution statique de pression et les signaux vibratoires dynamiques lors du contact. La collecte a mobilisé plusieurs plateformes robotiques réalisant des tâches de préhension, de manipulation en main et d'exploration de surface sur des milliers d'objets aux matériaux, géométries et textures variés. Cette publication répond à un goulot d'étranglement largement identifié dans le secteur : les systèmes fondés uniquement sur la vision savent repérer un objet et planifier une trajectoire d'approche, mais échouent à juger la force de préhension nécessaire, à détecter un glissement ou à distinguer des matériaux au contact, des compétences que l'humain acquiert par des milliers d'heures d'interaction physique durant son développement. En ouvrant l'accès à un volume aussi important de données tactiles structurées, rare car leur collecte exige du matériel spécialisé, une annotation précise des événements de contact et un temps d'exploitation robotique prolongé, XinZhi Embodied et Fudan espèrent lever un frein concret à la commercialisation de robots capables de manipuler des objets variés en conditions réelles, au-delà des environnements contrôlés typiques des démonstrations actuelles. Cette initiative s'inscrit dans la tendance plus large de la perception multimodale en robotique, où la vision assure la conscience spatiale globale, le langage porte l'instruction de tâche, et le toucher fournit l'information locale nécessaire à une manipulation fine. Elle illustre aussi l'intégration croissante entre recherche académique et innovation entrepreneuriale dans l'écosystème chinois de l'intelligence incarnée, les résultats de recherche alimentant directement les cycles de développement produit. En ouvrant ces données à des chercheurs et développeurs tiers, XinZhi Embodied et Fudan University visent à accélérer l'émergence de capacités de manipulation tactile jusqu'ici hors de portée faute de données, dans un secteur où la course à l'autonomie manipulatoire s'intensifie face aux acteurs américains et européens.

RecherchePaper
1 source
Robot-araignée à quatre pattes conçu pour repérer et récupérer des personnes dans l'eau
66Interesting Engineering 

Robot-araignée à quatre pattes conçu pour repérer et récupérer des personnes dans l'eau

Des chercheurs de l'AIRS (Shenzhen Institute of Artificial Intelligence and Robotics for Society) en Chine et du Stevens Institute of Technology aux Etats-Unis ont developpe QuadBoat, un robot de sauvetage aquatique a quatre pattes inspire des araignees pecheuses, capable de suivre et de recuperer physiquement une personne en detresse dans l'eau. Contrairement aux araignees pecheuses qui exploitent la tension de surface, QuadBoat repose sur une flottabilite classique tandis que ses quatre pattes independantes assurent la propulsion et la maniabilite grace a un controleur en cinematique inverse. Le pilotage combine une commande predictive de modele (MPC) en cascade avec un regulateur PID pour stabiliser et diriger l'engin. L'equipe, menee par Lianxin Zhang, Yihan Huang et Huihuan Qian, a teste le robot en piscine pour verifier sa capacite a suivre des trajectoires planifiees, puis en environnements interieur et exterieur pour des experiences de suivi visuel et de recuperation d'objets flottants. Les essais montrent que QuadBoat parvient a suivre une cible sur l'eau et a executer des taches de recuperation pertinentes pour une mission de sauvetage. L'etude a ete publiee sur le serveur de preprints arXiv. La plupart des vehicules de surface sans pilote (USV) actuellement utilises en recherche et sauvetage se limitent a localiser ou approcher une personne en difficulte, sans pouvoir la sortir de l'eau. QuadBoat cible precisement cet angle mort : l'extraction physique de la victime, une etape critique quand l'hypothermie, l'epuisement ou une mer agitee reduisent les chances de survie. Pour les integrateurs et decideurs du secteur maritime et de la securite civile, ce type de plateforme ouvre une piste distincte de celle des drones aeriens ou des USV classiques a coque rigide, en misant sur une agilite de posture proche de celle d'un robot quadrupede terrestre plutot que sur la seule vitesse de deplacement. Le papier reste toutefois prudent : les demonstrations ont eu lieu en bassin controle, sans vagues, courants ni conditions meteo degradees, ce qui laisse un ecart important entre la preuve de concept en laboratoire et un deploiement operationnel reel. QuadBoat s'inscrit dans un mouvement plus large de transfert des architectures de locomotion quadrupede, deja eprouvees a terre par des robots comme ceux de Boston Dynamics ou Unitree, vers des environnements aquatiques ou aeriens. Les auteurs soulignent que la recherche sur les robots de sauvetage a jusqu'ici peu traite la phase de recuperation proprement dite, se concentrant surtout sur la detection et le reperage. Les prochaines etapes annoncees par l'equipe consistent a faire evoluer le prototype vers un outil pratique pour les equipes de secours, en le testant dans des conditions plus proches du reel : vagues, courants et scenarios d'accidents maritimes ou de naufrages. Aucun calendrier de deploiement ni partenariat industriel n'est pour l'instant precise.

RecherchePaper
1 source
AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle
67arXiv cs.RO 

AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle

Des chercheurs ont présenté AXIS, un moteur de données communautaire et évolutif pour l'apprentissage de la manipulation robotique, décrit dans un article déposé sur arXiv le 24 juillet 2026. Le système permet de collecter des démonstrations à grande échelle via téléopération directement dans le navigateur, sans matériel spécialisé ni opérateurs centralisés, et génère puis valide automatiquement de nouvelles tâches de manipulation. Un pipeline automatisé filtre la qualité des trajectoires, les lisse et applique des augmentations visuelles et physiques pour produire des données prêtes à l'entraînement. Le jeu de données AXIS compte actuellement 207 tâches diverses et plus de 50 000 trajectoires, organisées en "task snapshots" évalués selon un protocole strict à données retenues (held-out). Ce travail cible un goulot d'étranglement bien identifié du secteur : la difficulté à faire grandir les jeux de démonstrations utilisés pour entraîner les politiques vision-langage-action (VLA), jusqu'ici souvent limités par du matériel dédié ou des catalogues de tâches figés. Les auteurs montrent que le pré-entraînement continu sur AXIS améliore le taux de réussite global du modèle π0.5 de 5,8 points, et dépasse de 37,3 points un modèle pré-entraîné sur RoboCasa365, avec des gains qui s'accentuent à mesure que le volume de données augmente. Les progrès les plus nets apparaissent sous perturbations de disposition, de bruit capteur et de point de vue caméra, un signal utile pour les intégrateurs cherchant des politiques robustes hors laboratoire plutôt que de simples démonstrations réussies en conditions idéales. Le projet s'inscrit dans une tendance émergente consistant à traiter la collecte de données robotiques comme un problème d'échelle communautaire, à l'image de ce que le crowdsourcing a permis pour les grands modèles de langage. Il se positionne explicitement face à RoboCasa365, utilisé comme référence de comparaison, et s'appuie sur des politiques VLA existantes telles que π0.5 pour évaluer l'apport réel des données AXIS. Il s'agit à ce stade d'un article de recherche déposé en preprint, dont les résultats n'ont pas encore été validés par relecture par les pairs ni reproduits par des équipes tierces.

RecherchePaper
1 source
VPWEM : politique visuomotrice non markovienne à mémoire de travail et épisodique
68arXiv cs.RO 

VPWEM : politique visuomotrice non markovienne à mémoire de travail et épisodique

Voici l'article traduit et résumé : Une équipe de recherche publie VPWEM (Visuomotor Policy with Working and Episodic Memory), une architecture destinée aux politiques visuomotrices utilisées en apprentissage par imitation robotique. Le problème ciblé : la plupart des politiques actuelles ne conditionnent leurs décisions que sur l'observation courante ou un historique court, ce qui les rend inefficaces sur des tâches non-markoviennes nécessitant une mémoire à long terme, comme retrouver un objet déplacé hors champ de vision quelques instants plus tôt. Plutôt que d'élargir la fenêtre de contexte, coûteux en calcul et propice au surapprentissage de corrélations superficielles, VPWEM conserve une fenêtre glissante d'observations récentes comme mémoire de travail à court terme, et ajoute un compresseur contextuel basé sur Transformer qui convertit récursivement les observations sorties de la fenêtre en un nombre fixe d'embeddings de mémoire épisodique. Ce compresseur combine auto-attention sur les résumés passés et attention croisée sur les observations historiques, et s'entraîne conjointement avec la politique. L'architecture a été instanciée sur des diffusion policies, avec mémoire et calcul quasi constants à chaque pas de temps. Sur les benchmarks MIKASA (tâches de manipulation exigeantes en mémoire) et MoMaRT (manipulation mobile), VPWEM dépasse les diffusion policies et modèles vision-langage-action (VLA) de référence de plus de 20% et 5% respectivement. Le code est disponible sur GitHub. Pour les intégrateurs et décideurs robotiques, ce travail répond à une limite concrète des systèmes VLA et diffusion policies actuellement déployés en usine ou en logistique : leur incapacité à raisonner sur des séquences longues fait qu'ils échouent dès qu'une tâche exige de se souvenir d'un événement passé, un tri d'objets par comptage, une inspection multi-étapes, un scénario où un obstacle a bougé hors caméra. Un gain de 20% sur les tâches à mémoire intensive suggère que le goulot d'étranglement n'est pas tant la capacité de perception ou de génération d'action que la gestion du contexte temporel, un point souvent minimisé dans les démonstrations commerciales de robots humanoïdes ou de bras manipulateurs, où les tâches testées restent généralement courtes et markoviennes. Ce travail s'inscrit dans la lignée des diffusion policies popularisées pour le contrôle robotique ces dernières années, et des architectures VLA (vision-language-action) comme Pi-0 ou GR00T N2, qui dominent actuellement les annonces du secteur mais peinent structurellement sur la mémoire longue durée. VPWEM se positionne comme complément architectural plutôt que rupture, applicable en théorie à d'autres backbones de politique. Il s'agit ici d'une publication de recherche avec code ouvert, pas d'un produit ou d'un déploiement industriel, une étape amont dans la chaîne qui sépare la recherche académique des systèmes commerciaux vendus par les acteurs de l'humanoïde.

RecherchePaper
1 source
Ce qui compte pour le transfert de l'apprentissage par renforcement en simulation vers l'apprentissage en ligne sur des robots réels
69arXiv cs.RO 

Ce qui compte pour le transfert de l'apprentissage par renforcement en simulation vers l'apprentissage en ligne sur des robots réels

Voici l'article traduit et adapté : Une étude empirique menée sur trois plateformes robotiques distinctes a testé l'apprentissage par renforcement (RL) en ligne directement sur des robots physiques, à travers 100 sessions d'entraînement réelles. Les chercheurs ont systématiquement isolé les choix de conception algorithmiques, matériels et expérimentaux habituellement laissés implicites dans les travaux précédents sur le sujet. Résultat principal : certains réglages par défaut largement utilisés dans la pratique du RL se révèlent contre-productifs sur du matériel réel, tandis qu'un ensemble restreint de choix de conception robustes, faciles à adopter dans le cadre standard du RL, permet d'obtenir un apprentissage stable sur différentes tâches et différents types de robots. Il s'agit, selon les auteurs, de la première étude empirique à grande échelle de ce type portant sur ces choix de conception. Cette cartographie répond à un point de friction bien identifié chez les intégrateurs et équipes de recherche robotique : le RL en ligne sur robot réel reste réputé fragile, coûteux en ingénierie et peu reproductible d'une plateforme à l'autre, ce qui pousse la majorité des équipes vers l'apprentissage en simulation (sim-to-real) ou l'imitation à partir de démonstrations. En identifiant quels réglages par défaut nuisent réellement à l'apprentissage et lesquels le stabilisent, ce travail réduit potentiellement l'effort d'ingénierie nécessaire pour déployer du RL en ligne directement sur du hardware, sans passer par un simulateur intermédiaire. C'est un signal utile pour évaluer si le RL en ligne peut devenir une option pratique face aux architectures VLA (vision-langage-action) qui dominent actuellement la communication du secteur, en offrant une alternative plus frugale en données de démonstration. Le papier s'inscrit dans une lignée de travaux cherchant à combler l'écart entre les promesses du RL en robotique, démontrées depuis longtemps en simulation, et sa fiabilité en conditions réelles, où le coût d'échantillonnage et les risques matériels limitent les expérimentations à grande échelle. Contrairement aux annonces de plateformes humanoïdes commerciales, ce travail relève de la recherche fondamentale reproductible, avec des ablations systématiques plutôt qu'une démonstration ponctuelle. Publié sur arXiv en tant que version révisée ("replace"), il ouvre la voie à des protocoles standardisés que d'autres laboratoires pourront reprendre et à des comparaisons futures avec des approches sim-to-real ou par imitation sur les mêmes tâches.

RecherchePaper
1 source
Robotisation de laboratoire à faible coût et évolutive : plateforme robotique intégrée à un jumeau numérique pour la manipulation autonome de liquides (RAINBOT™)
70arXiv cs.RO 

Robotisation de laboratoire à faible coût et évolutive : plateforme robotique intégrée à un jumeau numérique pour la manipulation autonome de liquides (RAINBOT™)

Des chercheurs présentent RAINBOT, un robot de manipulation de liquides à bas coût conçu en convertant une imprimante 3D cartésienne grand public, l'Elegoo Neptune 4 Max. L'extrudeuse est remplacée par une pipette monocanal de précision, actionnée par le portique X-Y-Z d'origine piloté en G-code, tandis que le mouvement du piston et l'éjection des embouts sont assurés par deux actionneurs linéaires compacts contrôlés en Python. Pour rendre les expériences transparentes et supervisables à distance, les équipes ont développé un jumeau numérique accessible depuis un navigateur, synchronisé en temps réel avec la plateforme physique : il reproduit la cinématique et les états de pipetage, et permet un monitoring distant, des interventions et un arrêt d'urgence depuis n'importe quel navigateur. Comme preuve de concept, RAINBOT a réalisé des échanges séquentiels de solutions aqueuses colorées, un capteur de couleur intégré mesurant les mélanges obtenus en modèle rouge-jaune-bleu (RYB), avec un écart moyen de seulement deux points de pourcentage par rapport au comportement attendu. Le coût total du matériel reste inférieur à 1300 dollars. Cette approche s'adresse directement à un frein connu de l'automatisation de laboratoire : le coût élevé, la conception propriétaire et la faible supervisabilité à distance des systèmes commerciaux de manipulation de liquides, environ dix fois plus chers que RAINBOT à l'entrée de gamme. Pour des laboratoires académiques ou des équipes R&D aux budgets serrés, la reproductibilité ouverte de la plateforme (basée sur du matériel grand public modifiable) abaisse significativement la barrière à l'entrée pour automatiser des protocoles de dosage et de mélange, tout en gardant un contrôle humain via le jumeau numérique, un point clé pour la confiance et la validation scientifique. RAINBOT est ensuite couplé au framework CEID (Cooperative Explorer for Inverse Design), qui transforme l'expérimentation manuelle par essais successifs en une recherche orientée par objectif, de type conception inverse, tout en conservant un humain dans la boucle décisionnelle. Cette intégration positionne la plateforme comme une brique physique-virtuelle pour des laboratoires auto-pilotés (self-driving labs), un domaine en pleine expansion où l'automatisation low-cost et open source pourrait accélérer la découverte de matériaux ou de formulations, en complément des systèmes commerciaux plus coûteux et fermés.

RecherchePaper
1 source
TOPReward : les probabilités de tokens comme récompenses cachées zéro-shot pour la robotique
71arXiv cs.RO 

TOPReward : les probabilités de tokens comme récompenses cachées zéro-shot pour la robotique

TOPReward est une méthode d'apprentissage robotique sans entraînement dédié, conçue pour générer des signaux de récompense denses et fondés sur l'instruction donnée au robot. Contrairement aux approches existantes, qui reposent sur des annotations manuelles de progression, des démonstrations spécifiques à chaque tâche, ou des modèles de récompense entraînés sur des jeux de données robotiques triés, TOPReward exploite directement les probabilités de tokens internes de modèles Video-Language (VLM) déjà pré-entraînés. Concrètement, la méthode fournit au VLM un extrait vidéo et une instruction en langage naturel, puis mesure la probabilité que le modèle attribue au fait que la tâche soit terminée, plutôt que de lui demander de générer une valeur numérique de progression. Les chercheurs évaluent leur approche sur ManiRewardBench, un benchmark de manipulation en conditions réelles qu'ils ont construit, couvrant 130 tâches uniques sur quatre plateformes robotiques distinctes, ainsi que sur les jeux de données Open X-Embodiment. TOPReward surpasse nettement les méthodes VLM sans entraînement existantes sur les modèles open source, et se montre compétitif face à un modèle de récompense entraîné spécifiquement, sur les métriques d'estimation de progression, sans nécessiter le moindre entraînement dédié. Pour l'industrie robotique, l'enjeu central reste l'obtention de feedback fiable à grande échelle sans coûteuse collecte et annotation manuelle propre à chaque tâche. Si un VLM générique, non spécialisé, parvient à distinguer une tâche réussie d'un comportement bloqué ou raté, cela allège considérablement le travail des équipes qui veulent déployer de l'apprentissage par renforcement ou du clonage de comportement sur de nouvelles tâches sans repasser par une phase d'étiquetage. Les auteurs précisent que le signal reste sensible à l'instruction donnée et n'est pas simplement expliqué par la position temporelle dans la vidéo, un point qui écarte l'hypothèse que le modèle se contente de suivre le déroulé de la séquence sans réellement évaluer l'accomplissement de la tâche. Ce travail s'inscrit dans la lignée des recherches cherchant à remplacer les reward models spécialisés par des modèles vision-langage généralistes, une piste motivée par le coût et la rigidité des modèles entraînés sur mesure pour chaque robot. TOPReward se distingue des méthodes VLM précédentes, qui demandaient au modèle de produire explicitement un score numérique, une approche jugée peu fiable car les VLM restent mal calibrés pour ce type de sortie. Le papier, disponible sur arXiv (2602.19313v2, version révisée), démontre deux applications en aval : la détection de succès de tâche et le clonage de comportement pondéré par récompense en mode offline. Reste à confirmer si l'approche tient à plus grande échelle, sur des tâches de manipulation plus complexes que celles couvertes par ManiRewardBench.

RecherchePaper
1 source
Facteurs spatio-temporels pour l'estimation de pose humaine à partir de lidar planaire
72arXiv cs.RO 

Facteurs spatio-temporels pour l'estimation de pose humaine à partir de lidar planaire

Une équipe de recherche publie sur arXiv (référence 2607.21309, soumission du 24 juillet 2026) un nouveau réseau de neurones léger pour la détection humaine et l'estimation de pose relative à partir de LiDAR planaire omnidirectionnel, un capteur bien plus répandu sur les robots de service que les caméras ou les LiDAR 3D. Le système repose sur des « Space-Time Blocks », une architecture qui sépare explicitement le traitement spatial le long des rayons de balayage et l'agrégation temporelle entre scans successifs. À partir de séquences LiDAR à 360 degrés, le réseau produit pour chaque rayon la présence d'un humain, sa distance et son orientation relative. Point clé de la méthode : l'entraînement se fait par auto-supervision croisée, en utilisant un capteur RGB-D à champ de vision étroit comme source de vérité dans la zone de recouvrement des deux capteurs, ce qui supprime le besoin d'annotations manuelles sur les données LiDAR. Comparé à un modèle de référence à nombre de paramètres équivalent, le réseau réduit les erreurs de 38% sur la distance, 28% sur la position et 15% sur l'orientation. Les auteurs valident aussi leur approche sur le jeu de données public FROG et démontrent une inférence temps réel sur processeur embarqué, avec des essais en conditions réelles sur un robot de service. Pour l'industrie robotique, ce travail s'attaque à un angle mort concret : la plupart des robots de service commercialisés (nettoyage, logistique intérieure, accueil) n'embarquent qu'un LiDAR planaire et un processeur modeste, loin des GPU nécessaires aux pipelines de perception humaine classiques basés vision. Une estimation fiable de la position et de l'orientation d'un humain à faible coût de calcul est une brique essentielle pour la navigation sociale sûre, sans nécessiter de capteur additionnel coûteux. La méthode d'auto-supervision est également notable : elle contourne le goulot d'étranglement de l'annotation manuelle, un frein récurrent au déploiement de perception apprise sur flotte réelle. Le travail s'inscrit dans une littérature déjà riche sur la détection humaine par LiDAR, mais cible spécifiquement le cas sous-desservi du LiDAR planaire bas coût, par opposition aux LiDAR 3D denses privilégiés en robotique mobile et véhicules autonomes. Le recours au jeu de données FROG, dédié à la perception sociale en environnement de service, situe la contribution dans la continuité des efforts de benchmarking pour la navigation collaborative homme-robot, sans acteur industriel ni feuille de route de déploiement commercial mentionnés à ce stade.

RecherchePaper
1 source
ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages
73arXiv cs.RO 

ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages

Voici le résumé en français : Une équipe de recherche présente ZONDA, un nouveau framework de navigation robotique "zero-shot" vers un objet désigné (Object Goal Navigation), conçu pour fonctionner dans des environnements multi-étages et en présence de piétons en mouvement. Le système repose sur trois composants : une planification heuristique multi-étages qui exploite des cartes de différences de hauteur pour permettre à un robot de gravir des escaliers et de changer d'étage sans contrôleur spécifique à la plateforme ; une vérification multi-vues de la cible, qui croise des observations à différentes échelles avec un modèle vision-langage (VLM) pour réduire les faux positifs de détection ; et un module d'évitement dynamique des piétons, qui suit et anticipe leurs déplacements pour générer des trajectoires préventives. Le système a été testé sur un robot bipède TITA du fabricant chinois Direct Drive Tech, ainsi que sur des simulations extensives utilisant les jeux de données HM3D et MP3D, deux benchmarks de référence pour la navigation en environnement intérieur photoréaliste. Les auteurs annoncent des résultats "significativement améliorés" par rapport aux méthodes existantes, ainsi qu'une robustesse maintenue sur HM3D-DYNA, une variante dynamique du benchmark incluant des agents mobiles. Cette publication s'attaque à une limite concrète et rarement traitée des systèmes de navigation robotique actuels : la quasi-totalité des méthodes de pointe supposent un environnement statique et confiné à un seul étage, une hypothèse commode en laboratoire mais irréaliste pour un déploiement réel en entrepôt, hôpital ou bâtiment de bureaux à plusieurs niveaux. En combinant franchissement d'escaliers sans apprentissage spécifique au robot et anticipation des piétons, ZONDA vise directement l'écart entre démonstration en simulation et usage industriel, un problème central pour les intégrateurs qui cherchent à déployer des robots mobiles ou humanoïdes au-delà d'un seul plateau. À noter que l'abstract ne fournit pas de chiffres précis de performance (taux de succès, distance parcourue, temps de cycle) permettant de comparer objectivement l'ampleur du gain revendiqué face aux méthodes concurrentes, une réserve à garder en tête avant de considérer le résultat comme acquis. Le champ de l'Object Goal Navigation s'est largement construit sur des benchmarks comme HM3D et MP3D, où les méthodes récentes intègrent de plus en plus des modèles vision-langage pour améliorer la reconnaissance sémantique des cibles, dans la lignée de travaux comme les architectures VLA utilisées en manipulation robotique. Le choix du robot bipède TITA de Direct Drive Tech comme plateforme de test réel, plutôt qu'un robot à roues plus classique en recherche de navigation, souligne l'ambition de valider l'approche sur une morphologie capable physiquement de franchir des escaliers, condition nécessaire à toute navigation multi-étages. L'article, publié sur arXiv le 24 juillet 2026, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution académique, dont la prochaine étape logique serait une validation sur davantage de plateformes robotiques et dans des environnements réels plus variés que le cadre expérimental actuel.

RecherchePaper
1 source
PhysCoRe : modèles du monde résiduels corrigés par la physique pour la dynamique déformable adaptée aux matériaux
74arXiv cs.RO 

PhysCoRe : modèles du monde résiduels corrigés par la physique pour la dynamique déformable adaptée aux matériaux

Voici l'article traduit et résumé. Une équipe de recherche présente PhysCoRe, un modèle physique hybride destiné à prédire le comportement d'objets déformables manipulés par un robot, un problème resté longtemps non résolu en robotique. Le système combine un simulateur différentiable de type Material Point Method (MPM) avec deux réseaux de neurones feed-forward complémentaires. Le premier module, baptisé Material from Motion (MfM), déduit l'élasticité de chaque particule de l'objet à partir d'observations visuelles, ce qui ancre le simulateur dans la physique réelle propre à chaque objet plutôt que dans des paramètres génériques. Le second module, Residual from Dynamics (RfD), apprend l'écart entre les prédictions du simulateur analytique et la réalité observée, et corrige les biais systématiques que le modèle physique pur ne peut pas capturer. Sur des séquences réelles de manipulation d'objets déformables, PhysCoRe dépasse les méthodes de référence de l'état de l'art en précision de prédiction. Cette approche s'attaque directement à un compromis classique du secteur de la robotique de manipulation : les méthodes d'optimisation par objet, qui calibrent les paramètres matériaux au cas par cas, sont lentes et ne généralisent pas d'un objet à l'autre, tandis que les modèles appris de bout en bout extrapolent mal et violent souvent des contraintes physiques élémentaires (conservation de la masse, cohérence géométrique). En couplant simulation physique et correction résiduelle apprise, PhysCoRe vise un entre-deux praticable pour des tâches comme le pliage de tissu, la manipulation de câbles ou l'emballage d'objets mous, autant d'opérations encore mal maîtrisées en logistique et en assemblage industriel. Point notable pour les intégrateurs : le système permet une identification de matériau en ligne sur des objets jamais vus, le module MfM s'adaptant à partir d'un nombre limité d'interactions, et sa confiance prédictive orientant l'exploration robotique vers les zones où l'estimation reste la moins fiable, un signal utile pour guider l'apprentissage actif plutôt que l'exploration aléatoire. Le travail s'inscrit dans une lignée de recherche qui cherche à réconcilier simulateurs physiques différentiables et apprentissage profond, une piste explorée notamment autour des méthodes MPM depuis plusieurs années pour modéliser des matériaux mous, granulaires ou élastiques. Il se positionne face aux approches purement data-driven de prédiction de dynamique déformable, ainsi qu'aux pipelines classiques d'optimisation de paramètres matériaux par essais successifs. Publié comme prépublication arXiv (2607.20653), l'article ne mentionne pas de déploiement industriel ni de partenariat commercial à ce stade ; il s'agit d'un résultat de recherche validé sur des séquences de manipulation réelles en laboratoire, dont la suite logique serait une évaluation sur des tâches de manipulation plus longues et des objets plus variés.

RecherchePaper
1 source
Automatisation en temps réel de la perception RGB-D pour marteaux-piqueurs autonomes en mine : autofiltrage, segmentation des roches et génération de poses de fragmentation
75arXiv cs.RO 

Automatisation en temps réel de la perception RGB-D pour marteaux-piqueurs autonomes en mine : autofiltrage, segmentation des roches et génération de poses de fragmentation

Les chercheurs à l'origine de ce papier arXiv (référence 2607.20748v1) présentent un système de perception en temps réel destiné à automatiser les brise-roches hydrauliques utilisés en exploitation minière, notamment lors des opérations de réduction secondaire souterraine. Aujourd'hui, ces machines sont pilotées à distance par téléopération, ce qui limite fortement la cadence de travail. Le pipeline proposé combine une caméra RGB-D, de la segmentation d'instance par image et un traitement géométrique de nuage de points pour générer simultanément des poses de frappe faisables mécaniquement et une reconstruction 3D de l'espace de travail débarrassée du bras robotique lui-même, une étape nécessaire pour que le système ne confonde pas sa propre structure avec les roches à fragmenter. L'ensemble tourne sur du matériel embarqué à environ 10 Hz, pour une latence totale d'environ 675 millisecondes, un niveau de réactivité jugé compatible avec un asservissement en boucle fermée. Les tests ont été menés sur un scénario réduit à l'échelle, reproduisant les conditions typiques d'un chantier souterrain. Pour le secteur minier, cette publication illustre une tendance de fond: l'automatisation progressive d'équipements lourds historiquement pilotés à la main, un segment resté en retrait par rapport à l'automatisation des véhicules de transport minier (camions autonomes) déjà répandue chez les grands opérateurs. Contrairement à des annonces marketing sur des robots humanoïdes en usine, il s'agit ici d'un travail de recherche mesuré et transparent sur ses limites: le prototype n'a été validé qu'en environnement réduit et contrôlé, pas sur un chantier minier réel, ce qui laisse ouvert l'écart classique entre démonstration en laboratoire et déploiement industriel. Le contexte est celui d'une industrie minière cherchant à réduire l'exposition des opérateurs aux zones dangereuses et à améliorer la productivité des opérations de dégagement de blocs rocheux surdimensionnés, un goulot d'étranglement récurrent après les tirs de mine. Les auteurs ne mentionnent pas de partenariat industriel ni de calendrier de commercialisation; la suite logique évoquée par ce type de travaux académiques est généralement un passage à l'échelle réelle et une validation en conditions souterraines effectives, étapes qui restent à venir.

RecherchePaper
1 source
IA incarnée : FORGE-plus régule l'effort de récupération pour l'assemblage à contact riche via un superviseur LLM figé
76arXiv cs.RO 

IA incarnée : FORGE-plus régule l'effort de récupération pour l'assemblage à contact riche via un superviseur LLM figé

Des chercheurs présentent FORGE-plus, un framework à deux couches combinant un grand modèle de langage (LLM) figé, uniquement textuel, avec un contrôleur bas niveau pour l'assemblage de précision par apprentissage par renforcement conditionné en force. Le LLM détermine avant exécution un plafond de force propre à chaque objet, puis sélectionne des manœuvres de récupération dans un menu d'actions fixe à partir de signatures de force textuelles compactes, sans jamais piloter la force directement, celle-ci restant imposée par un contrôleur bas niveau indépendant. Le seuil de rupture réel de chaque objet reste caché, connu seulement de l'évaluateur. Les tests portent sur deux tâches, le placement d'une bouteille fragile et l'insertion d'un engrenage avec un jeu diamétral de 0,4 mm, réalisées avec deux pinces différentes, la Robotiq 2F-140 et la main Franka Panda. Une politique unique réussit 256 épisodes sur 256 sans casse, sur objets fragiles comme robustes, prédit correctement le moment du relâchement, et complète un pipeline complet de prise sur table et insertion avec une force de pointe moyenne de 5,4 N. Face à des glissements de préhension injectés artificiellement, la stratégie de récupération basée sur les signatures de force résout 40% et 64% des échecs selon la pince utilisée, contre une approche naïve consistant à serrer plus fort, inefficace ou provoquant des casses fréquentes. Ce travail éclaire un débat central de la robotique industrielle actuelle, celui de la fiabilité réelle des politiques d'assemblage par apprentissage face aux démonstrations soigneusement sélectionnées. En séparant décision stratégique, confiée au LLM, et exécution physique, confiée à un contrôleur strict, les auteurs proposent une architecture qui limite les risques de casse tout en gardant une flexibilité de raisonnement, un enjeu clé pour les intégrateurs manipulant des composants fragiles ou à tolérances serrées. Les auteurs situent explicitement les limites de l'étude: tout se déroule en simulation à corps rigides, avec une rupture par seuil de force caché, et aucune revendication de transfert vers le réel n'est faite. Ils rapportent aussi des résultats négatifs, notamment l'échec de l'algorithme PPO classique sous contraintes de force strictes et l'inefficacité de stratégies de relâchement apprises, signalant que le problème reste loin d'être résolu de bout en bout par apprentissage pur.

RecherchePaper
1 source
Grasp, transfert, rotation : réorientation bimanuelle d'objets par diffusion compositionnelle et optimisation énergétique
77arXiv cs.RO 

Grasp, transfert, rotation : réorientation bimanuelle d'objets par diffusion compositionnelle et optimisation énergétique

Grasp, Handover, Rotate : réorientation bimanuelle d'objets par diffusion compositionnelle et optimisation à base d'énergie Une équipe de recherche publie sur arXiv (arXiv:2607.21341v1, soumission du 24 juillet 2026) BiCompoDiff, un framework qui traite la réorientation bimanuelle d'objets : saisir un objet, le transférer d'un bras à l'autre, puis le poser dans une orientation cible, une manoeuvre nécessaire quand un placement direct depuis la prise initiale est impossible à cause de collisions, de contraintes cinématiques ou d'une orientation finale inadéquate. Le système combine un modèle de diffusion de prise pré-entraîné avec des modèles à base d'énergie (EBM) de planification bimanuelle, et injecte un guidage par gradient pendant la diffusion inverse pour imposer simultanément l'évitement de collisions, la fluidité de trajectoire via cinématique inverse différentiable, la faisabilité du transfert entre bras et la sécurité de la reprise. Un échantillonnage MCMC recuit affine ensuite les poses de prise sur ce paysage énergétique composite. Sur des tâches simulées de réorientation d'objets domestiques, BiCompoDiff atteint un taux de réussite supérieur de plus de 20% et des trajectoires jusqu'à 37% plus lisses, mesurées par le déplacement articulaire, comparé à des méthodes d'échantillonnage jugées solides par les auteurs. Une validation en conditions réelles est également mentionnée, avec un transfert sim-to-real jugé efficace. L'enjeu dépasse la simple démonstration technique : la manipulation bimanuelle coordonnée reste l'un des points faibles concrets des robots humanoïdes et bras doubles destinés à des tâches réelles, là où le pick-and-place à un seul bras échoue régulièrement sur des objets encombrants, mal orientés ou nécessitant un contournement d'obstacle. La plupart des approches existantes optimisent séparément la sélection de prise, la planification de trajectoire et la gestion du transfert entre bras, ce qui génère des incohérences quand ces sous-problèmes entrent en conflit. En unifiant ces objectifs dans un même cadre d'optimisation sous contraintes, ce travail illustre une tendance de fond en robotique de manipulation : combiner modèles génératifs de prise et méthodes de planification basées sur l'énergie pour traiter des séquences multi-étapes, plutôt que des gestes isolés. C'est un signal utile pour les intégrateurs travaillant sur des cellules robotiques bimanuelles ou des humanoïdes appelés à manipuler des objets dans des environnements non structurés, un des écarts persistants entre les démonstrations en vidéo et la réalité opérationnelle. Le papier s'inscrit dans une double lignée de recherche déjà bien établie séparément, les modèles de diffusion pour la génération de prises robustes d'un côté, les modèles à base d'énergie pour la planification de trajectoires sous contraintes de l'autre, que BiCompoDiff cherche à faire converger de façon compositionnelle. Les gains annoncés (20%, 37%) sont mesurés contre des baselines d'échantillonnage qualifiées de "fortes" sans détail sur leur nature exacte, une réserve à garder en tête tant que le papier n'a pas été revu par les pairs ni testé par d'autres équipes. Aucune entreprise ni plateforme robotique commerciale n'est citée, il s'agit d'un travail académique pur à ce stade, sans indication de mise en oeuvre sur un produit ou une ligne de déploiement. Les suites logiques attendues seraient une évaluation sur du matériel bimanuel plus divers, une comparaison directe avec des méthodes de planification classiques utilisées en industrie, et potentiellement une intégration dans des piles de manipulation robotique plus larges.

RecherchePaper
1 source
Robots multiples : navigation socialement cohérente via planification découplée et coordination des trajectoires
78arXiv cs.RO 

Robots multiples : navigation socialement cohérente via planification découplée et coordination des trajectoires

Article : Une équipe de recherche présente un système de navigation multi-robots visant à rendre les déplacements en environnement humain non seulement sûrs et efficaces, mais aussi prévisibles et conformes aux conventions sociales, un facteur clé pour l'acceptation par les usagers. Le framework proposé est partiellement décentralisé et découple la planification globale de trajectoire de la coordination fine entre robots. La première brique est une version modifiée de l'algorithme A* qui intègre directement des normes sociales macroscopiques dans sa fonction de coût, poussant chaque robot à emprunter des chemins jugés socialement acceptables plutôt que purement optimaux en distance. Ces trajectoires planifiées sont ensuite partagées entre les robots de la flotte pour construire collectivement un graphe social des itinéraires établis, ce qui renforce la cohérence des chemins choisis dans le temps et réduit l'effort de planification pour les déplacements futurs. Sur cette base, la coordination des trajectoires entre robots est formulée comme un programme convexe en variables mixtes-entières, permettant de calculer efficacement des trajectoires sans collision, avec une capacité annoncée à bien passer à l'échelle sur de grandes flottes et à supporter l'attribution dynamique de tâches. Pour l'industrie de la robotique mobile et les intégrateurs de flottes d'AMR (robots mobiles autonomes) en entrepôt, magasin ou hôpital, ce travail s'attaque à un angle mort courant des architectures actuelles : la plupart des planificateurs "human-aware" opèrent à court terme et reportent tout le poids de la cohérence comportementale sur le planificateur local, ce qui produit des trajectoires réactives, changeantes d'un passage à l'autre, et donc imprévisibles pour les humains qui partagent l'espace. En déplaçant la contrainte sociale au niveau de la planification globale, l'approche promet des comportements de flotte plus stables et lisibles dans la durée, un argument qui pèse directement sur le confort perçu et l'acceptabilité des déploiements en environnements partagés à forte densité humaine. Elle illustre aussi une tendance de fond du secteur : traiter la coordination multi-robots non plus comme un problème purement combinatoire de sans-collision, mais comme un problème conjoint d'optimisation technique et de normes sociales. Le papier s'inscrit dans la lignée des travaux sur la navigation "human-aware", qui cherchent depuis plusieurs années à dépasser les planificateurs purement géométriques hérités de la robotique classique. La nouveauté ici est la séparation explicite entre planification de chemin socialement contrainte et coordination de trajectoire par optimisation convexe, une architecture partiellement décentralisée pensée pour scaler sur des flottes de taille importante. Le texte, publié sur arXiv, ne précise pas de déploiement industriel réel ni de partenaire commercial identifié à ce stade ; il s'agit d'une contribution de recherche dont les résultats sont validés en simulation ou en conditions contrôlées selon les standards habituels de ce type de publication, avant d'éventuels essais sur plateformes réelles.

RecherchePaper
1 source
I2Nav-Robot : un jeu de données robotique intérieur-extérieur à grande échelle pour la navigation par fusion multi-capteurs
79arXiv cs.RO 

I2Nav-Robot : un jeu de données robotique intérieur-extérieur à grande échelle pour la navigation par fusion multi-capteurs

Chercheurs de l'université de Wuhan (laboratoire i2Nav) ont publié i2Nav-Robot, un jeu de données à grande échelle destiné à la navigation par fusion multi-capteurs pour véhicules terrestres autonomes (UGV), en environnements intérieurs et extérieurs. La plateforme, un véhicule à roues omnidirectionnel, embarque des LiDAR solid-state à vision frontale et à 360 degrés de dernière génération, un radar millimétrique 4D, des caméras stéréo, une centrale inertielle (IMU), un récepteur GNSS et des odomètres à roues, tous synchronisés temporellement via une combinaison de synchronisation matérielle en ligne et de calibration hors ligne. Le jeu de données comprend dix séquences couvrant des scénarios variés (rues extérieures, parkings intérieurs) pour une distance cumulée d'environ 17 060 mètres, avec une vérité terrain de précision centimétrique obtenue par post-traitement de navigation intégrée sur IMU haut de gamme. Quinze méthodes open source de fusion multi-capteurs ont servi à valider la qualité des données. Le tout est accessible sur GitHub (i2Nav-WHU/i2Nav-Robot). Pour la recherche en navigation robotique, ce type de benchmark comble un manque réel: les jeux de données existants pour UGV souffrent souvent de configurations de capteurs limitées, d'une synchronisation imprécise, d'une vérité terrain incomplète ou peu fiable, et d'un manque de diversité de scénarios, ce qui freine le développement et la comparaison rigoureuse des algorithmes SLAM et de fusion de capteurs. Un dataset combinant LiDAR récents, radar 4D et vérité terrain centimétrique dans des environnements mixtes intérieur-extérieur offre aux équipes de recherche et aux intégrateurs un terrain d'évaluation plus représentatif des conditions réelles de déploiement, notamment pour les robots mobiles industriels et logistiques. Ce travail s'inscrit dans la lignée de benchmarks antérieurs comme KITTI ou M2DGR, mais cherche à dépasser leurs limites en matière de synchronisation et de diversité de capteurs, notamment via l'intégration récente du radar millimétrique 4D, technologie de plus en plus utilisée en complément du LiDAR pour la robustesse par mauvaise visibilité. La publication en open source, avec documentation complète sur GitHub, vise à en faire une référence pour les futures évaluations comparatives de méthodes de navigation autonome, un domaine où la disponibilité de données de qualité reste un goulot d'étranglement majeur pour l'industrie.

RecherchePaper
1 source
Distributed Model-Based Diffusion pour l'optimisation de trajectoires multi-robots à grande échelle
80arXiv cs.RO 

Distributed Model-Based Diffusion pour l'optimisation de trajectoires multi-robots à grande échelle

Des chercheurs viennent de publier sur arXiv (2607.20992) une méthode baptisée Distributed Model-Based Diffusion (DMBD), conçue pour résoudre l'optimisation de trajectoires pour des flottes de robots évoluant dans des environnements fortement non convexes, non linéaires et non différentiables. Le point de départ est le Model-Based Diffusion (MBD), une approche d'optimisation par échantillonnage qui avait déjà montré des résultats prometteurs pour un robot unique, mais qui devient un problème d'inférence centralisé et de très haute dimension dès qu'on l'étend à plusieurs robots, avec une perte nette d'efficacité d'échantillonnage due à la malédiction de la dimensionnalité, et la nécessité d'un accès global à la dynamique, aux contraintes et aux objectifs de chaque robot. DMBD contourne ce verrou en décomposant le processus de diffusion inverse en processus de diffusion conditionnels locaux : chaque robot débruite sa propre trajectoire dans son sous-espace de commande, en se conditionnant sur les estimations de trajectoires des autres robots, agrégées et redistribuées par un serveur central. Les auteurs valident l'approche sur quatre scénarios de simulation : échange de positions entre robots (goal swapping), couverture multi-étages, stationnement (parking) et trafic dense (rush-hour), avec des temps de résolution annoncés en dessous de la seconde. Cette architecture serveur-robots répond directement à un goulot d'étranglement connu de la planification multi-robots : la coordination centralisée s'effondre en calcul et en bande passante dès que le nombre d'agents augmente, ce qui limite aujourd'hui le déploiement de flottes d'AMR ou de robots mobiles en entrepôt, en logistique ou en coordination aérienne à grande échelle. Si les gains de scalabilité annoncés se confirment au-delà des scénarios simulés, la méthode pourrait intéresser les intégrateurs qui cherchent à faire cohabiter de nombreux robots autonomes sans dépendre d'un planificateur central surchargé, tout en gardant chaque robot capable de calculer localement sa propre trajectoire. Le travail s'inscrit dans la lignée récente des méthodes de diffusion appliquées à la planification robotique, où le MBD a émergé comme alternative aux solveurs d'optimisation classiques pour un seul robot. L'extension au multi-robot reste un champ actif de recherche, avec plusieurs équipes explorant des architectures distribuées ou décentralisées pour éviter l'explosion combinatoire. À ce stade, DMBD reste une contribution académique validée uniquement en simulation, sans démonstration sur robots physiques ni benchmark comparatif détaillé publié dans l'abstract.

RecherchePaper
1 source
FELT : générer des signaux tactiles à partir de la vision pour la manipulation visuo-tactile
81arXiv cs.RO 

FELT : générer des signaux tactiles à partir de la vision pour la manipulation visuo-tactile

Une équipe de recherche présente FELT (Feature-Extracted Latent Tactile), une méthode qui génère des signaux tactiles à partir de simples images RGB, sans capteur tactile physique nécessaire au moment de l'inférence. Décrite dans un preprint publié sur arXiv (arXiv:2607.20683v1), l'approche s'appuie sur un grand encodeur visuel figé associé à un décodeur léger à requêtes, capable de prédire les signaux tactiles en une seule passe. Pour respecter la topologie physique des capteurs tactiles à deux doigts, FELT décode séparément les panneaux gauche et droit via deux branches distinctes, ce qui permet de capturer les motifs de contact asymétriques observés lors de tâches comme l'essuyage, l'insertion de pièces ou la rotation d'objets en main. Le système a été testé sur quatre tâches de manipulation à fort contact physique, où les images tactiles générées ainsi que les représentations latentes tactiles ont amélioré les performances par rapport à des politiques entraînées uniquement sur la vision. L'enjeu principal est la rareté des données tactiles, bien plus difficiles à collecter que les données visuelles car les capteurs tactiles restent fragiles, spécialisés et peu standardisés d'un fabricant à l'autre. En permettant d'enrichir des jeux de données purement visuels avec une information tactile synthétique, FELT réduit la dépendance à des campagnes de collecte coûteuses avec du matériel dédié. Le résultat le plus notable concerne les représentations latentes tactiles: elles améliorent le taux de réussite des politiques de manipulation sans qu'aucun capteur tactile réel ne soit nécessaire, ni à l'entraînement ni au déploiement, ce qui ouvre la voie à des politiques visuo-tactiles moins coûteuses à mettre en œuvre à grande échelle. Ce travail s'inscrit dans une recherche plus large sur la fusion vision-toucher en manipulation robotique, où l'écart entre démonstrations en laboratoire et déploiement réel reste un point de vigilance récurrent du secteur. Aucun acteur français ou européen n'est mentionné dans cette publication. Il s'agit d'un résultat de recherche académique au stade preprint, non d'un produit commercialisé, avec du matériel supplémentaire disponible sur un site anonymisé associé à la soumission.

RecherchePaper
1 source
Ajustement précis de trajectoire par apprentissage résiduel DAgger sensible à la force pour l'insertion de précision avec contrôle d'impédance
82arXiv cs.RO 

Ajustement précis de trajectoire par apprentissage résiduel DAgger sensible à la force pour l'insertion de précision avec contrôle d'impédance

Des chercheurs présentent TER-DAgger (Trajectory Editing Residual Dataset Aggregation), une méthode d'apprentissage par imitation conçue pour les tâches d'insertion de précision en robotique, où le contact physique rend l'apprentissage classique instable. Le système combine trois éléments : une édition de trajectoire par optimisation qui fusionne en douceur les trajectoires générées par la politique du robot avec les corrections humaines, un mécanisme d'anticipation des échecs basé sur la force qui ne déclenche une intervention humaine que lorsque la force mesurée à l'effecteur diverge de la force prédite, et une exécution sous contrôle en impédance cartésienne pour garantir un comportement souple et sûr lors des contacts. Dans des expériences en simulation et en conditions réelles sur des tâches d'insertion, TER-DAgger améliore le taux de réussite moyen de plus de 37 % par rapport aux méthodes de référence que sont le clonage comportemental simple, la correction guidée par un humain, le réentraînement complet et le fine-tuning. L'enjeu dépassé ici est le "covariate shift" : un robot entraîné par imitation dérive souvent des trajectoires démontrées dès qu'il rencontre un état légèrement différent, et sa récupération nécessite jusqu'ici la supervision continue d'un opérateur humain, ce qui limite fortement le passage à l'échelle. En ne sollicitant l'humain que lorsque l'écart de force le justifie, TER-DAgger réduit la charge de supervision tout en conservant la robustesse du DAgger classique. Pour les intégrateurs industriels visant l'assemblage fin, le montage de composants électroniques ou toute tâche à tolérance serrée, cela rapproche l'apprentissage par imitation d'un déploiement viable sans ingénieur dédié en permanence sur la boucle de correction. La méthode s'inscrit dans la lignée du DAgger original, qui corrige le décalage de distribution par interrogation active de l'expert, mais que son coût de supervision continue rendait peu pratique. TER-DAgger cible spécifiquement les tâches riches en contact, un terrain où les politiques de type VLA et les approches de clonage comportemental peinent encore à généraliser au-delà des démonstrations. L'article, publié sur arXiv, ne mentionne pas de partenariat industriel ni de déploiement en usine à ce stade ; il s'agit d'un résultat de recherche appelé à être testé sur des plateformes robotiques plus variées.

RecherchePaper
1 source
URF : cadre de contrôle unifié pour une manipulation stable et consciente du contact
83arXiv cs.RO 

URF : cadre de contrôle unifié pour une manipulation stable et consciente du contact

Traitement effectué. Voici l'article en français : --- Des chercheurs proposent URF (Unified Robot Control-Policy Framework), une architecture de contrôle qui unifie prédiction d'action et exécution bas niveau pour la manipulation robotique en contact rigide. Publié sur arXiv (2607.20912v1), le système part d'un constat technique précis : les politiques de manipulation apprises prédisent généralement une trajectoire ou une cible virtuelle, puis délèguent son exécution à un contrôleur bas niveau séparé, ce qui peut provoquer un contact instable, des erreurs de suivi, une surcharge de force voire une casse d'outil selon le contrôleur utilisé. URF fait converger ces deux étages : à partir d'observations multimodales, le modèle prédit simultanément une cible virtuelle, une matrice de rigidité (stiffness matrix), et un ratio de bascule entre contrôle en admittance et contrôle en impédance. Ce ratio détermine à quel moment privilégier un suivi de mouvement précis (admittance) ou une gestion plus sûre du contact rigide (impédance). Faute de vérité terrain sur la rigidité de l'environnement dans les données de démonstration, les chercheurs construisent leurs labels de supervision à partir des forces de contact réellement mesurées. Sur deux tâches de test, retournement de boîte et pressage linéaire, URF affiche un taux de réussite supérieur aux approches en admittance seule, avec moins d'échecs par montée en force rapide, oscillations de force, casse d'outil ou arrêts de sécurité du robot. Pour l'industrie de la manipulation robotique, ce travail cible un angle mort souvent sous-traité dans la course aux politiques VLA (vision-language-action) : la qualité d'une politique de haut niveau ne garantit rien si le contrôleur bas niveau n'est pas conçu pour exploiter cette information de contact. Beaucoup de démonstrations impressionnantes de manipulation dextre échouent en conditions réelles précisément à cause de ce écart entre commande prédite et exécution physique stable, un des points aveugles classiques du fossé démo-vers-réalité. En intégrant la prédiction du comportement du contrôleur lui-même dans le modèle appris, URF illustre une tendance de fond chez les intégrateurs et laboratoires de recherche en manipulation : traiter le contrôle de force comme un objet d'apprentissage à part entière plutôt que comme un simple paramètre fixe en aval, ce qui intéresse directement les applications d'assemblage industriel, de polissage ou d'insertion de précision où le contact rigide est la norme plutôt que l'exception. Ce travail s'inscrit dans la lignée des architectures hybrides impédance-admittance étudiées depuis longtemps en robotique de contact, mais l'apporte au contexte des politiques de manipulation apprises de bout en bout, un terrain où les grands modèles VLA (de type Pi-0, GR00T ou Helix évoqués dans le débat sectoriel actuel) se concentrent surtout sur la prédiction de trajectoires plutôt que sur la dynamique de contact fine. Il s'agit ici d'une publication de recherche académique, avec page projet dédiée, et non d'un produit commercialisé ni d'un déploiement industriel : les résultats se limitent à deux tâches de manipulation en environnement contrôlé. La suite logique, non détaillée dans l'abstract, porterait sur l'extension à des tâches de contact plus variées et sur une validation en dehors du cadre expérimental initial avant toute intégration dans des piles de contrôle robotique commerciales.

RecherchePaper
1 source
Vérificateur de contrôleur sûr : révision critique des tautologies CBF et hypothèses cachées
84arXiv cs.RO 

Vérificateur de contrôleur sûr : révision critique des tautologies CBF et hypothèses cachées

Les Control Barrier Functions (CBF) sont l'un des outils mathematiques les plus utilises depuis une dizaine d'annees pour garantir la securite des controleurs robotiques, en particulier en navigation et en manipulation. Un tutoriel publie sur arXiv (2603.06954v2) propose une revue critique de leur usage pratique et pointe un ecart recurrent: la theorie des CBF suppose l'existence d'un controleur sur qui respecte les contraintes, mais cette existence n'est presque jamais construite explicitement dans les systemes avec des limites d'actionnement reelles (couples, vitesses, forces bornees). L'auteur distingue les CBF dites "candidates", qui ne font que ressembler a une preuve de securite, des CBF "valides", qui integrent correctement la dynamique du systeme, les limites d'actionnement et les fonctions de classe K. Il montre par des exemples de faible dimension que de nombreuses demonstrations de "controleurs surs" publiees dans la litterature portent en realite sur des systemes passivement surs, comme des integrateurs simples ou des manipulateurs cinematiques, ou de simples contraintes geometriques suffiraient deja a eviter les collisions sans recourir aux CBF. Une etude de simulation en navigation en foule illustre par ailleurs que le reward shaping derive des CBF en apprentissage par renforcement ameliore le comportement empirique observe, sans pour autant etablir de garantie de securite formelle. Pour l'industrie robotique et les integrateurs, ce travail est un signal d'alerte methodologique: une etiquette "controle sur base de CBF" apposee sur un robot ne garantit rien en soi si le systeme sous-jacent etait deja trivialement sur, ou si les hypotheses d'actionnement ne sont pas verifiees. Cela invite les decideurs B2B a exiger des preuves de securite construites, et non seulement des demonstrations video ou des affirmations theoriques generiques, avant de valider le deploiement de robots collaboratifs ou autonomes en environnement partage avec des humains. Le cadre des CBF, popularise notamment par les travaux d'Aaron Ames et de son laboratoire a Caltech, s'est impose comme standard academique pour la securite certifiee en robotique legere et en conduite autonome. Ce tutoriel s'inscrit dans un mouvement plus large de remise en question des garanties de securite affichees dans la recherche en controle et en RL, et fournit des lignes directrices pratiques pour construire des arguments de securite realisables sur des systemes non passivement surs, appuyees par une demonstration web interactive open-source permettant de visualiser ces limites.

RecherchePaper
1 source
VoLN : navigation à long terme uniquement par vision (paradigme, référentiel et méthode)
85arXiv cs.RO 

VoLN : navigation à long terme uniquement par vision (paradigme, référentiel et méthode)

Des chercheurs présentent VoLN (Vision-Only Long-Horizon Navigation), un nouveau paradigme de navigation pour agents embarqués qui se passe totalement d'instructions en langage naturel détaillées. Publié sur arXiv le 24 juillet 2026, ce travail part d'un constat : dans la navigation vision-langage classique (VLN), les instructions de type "tournez à droite après 50 mètres" encodent des informations spatiales (orientation, distance, disposition des lieux) que l'agent ne peut pas réellement percevoir depuis ses seuls capteurs, surtout dans des environnements ouverts sans GPS. VoLN retire ces indices explicites : seule une image de destination est fournie, et l'agent doit repérer, interpréter et suivre des repères visuels locaux pour progresser. L'équipe a instancié ce paradigme pour le vol de drones avec VoLN-UAV, un benchmark de 7 210 épisodes combinant vols longue distance orientés objectif, mouvements 3D continus, changements de point de vue importants et sélection de balises dépendante du contexte. Un modèle de référence, VoLN-MLLM, aligne des caractéristiques visuelles auto-supervisées sur un espace sémantique structuré et prédit des segments de trajectoire courts à partir de l'historique d'observation, des vues cibles, de tokens visuo-sémantiques récupérés et de la proprioception. Les résultats obtenus sur le split Test-Unseen (cinq environnements) sont particulièrement bas : 7,4% de réussite sur les épisodes faciles, 4,5% sur les normaux et seulement 1,8% sur les difficiles. Ces chiffres, très inférieurs aux performances habituellement rapportées en VLN classique, illustrent l'écart entre la navigation guidée par instructions explicites et une navigation purement visuelle où l'agent doit reconstruire lui-même la structure de l'itinéraire. Pour les équipes travaillant sur l'autonomie des drones et des robots en environnements GPS-denied, ce résultat sert d'avertissement : les scores impressionnants obtenus sur les benchmarks VLN traditionnels reflètent en partie la richesse des instructions fournies, pas uniquement la capacité de perception et de décision de l'agent. VoLN s'inscrit dans la lignée des travaux sur la navigation vision-langage, en proposant une lecture complémentaire plutôt qu'un remplacement des benchmarks existants. En isolant la composante purement visuelle du problème, les auteurs cherchent à mesurer séparément l'intégration d'indices sur un horizon long, l'appariement d'images entre différents points de vue et la stabilité en boucle fermée, trois faiblesses identifiées comme majeures par leurs expériences. Le code et les détails du benchmark sont disponibles sur la page du projet, ouvrant la voie à des comparaisons futures pour d'autres plateformes robotiques que les drones.

RecherchePaper
1 source
Vers une navigation en terrain accidenté adaptée aux capacités pour environnements non structurés
86arXiv cs.RO 

Vers une navigation en terrain accidenté adaptée aux capacités pour environnements non structurés

Le 24 juillet 2026, une équipe de recherche a publié sur arXiv (2607.20679) un article présentant CAT (Capability-Aware Traversability), un framework de navigation robotique qui conditionne l'estimation de la franchissabilité du terrain à l'embodiment physique du robot. Le principe : un même obstacle ou un même sol peut être traversable pour une plateforme et dangereux pour une autre, selon son poids, sa garde au sol ou son type de locomotion. CAT encode ces contraintes physiques directement dans l'espace de représentation spatiale, via des blocs SPADE (Spatially-Adaptive Denormalization) qui modulent des cartes sémantiques de terrain avec des vecteurs de traversabilité propres à chaque robot. Le système s'appuie aussi sur un pipeline d'annotation interactif ancrant les masques de supervision dans des trajectoires physiques réellement exécutées. Sur des jeux de données annotés par des humains et alignés sur des trajectoires réelles, CAT améliore l'AUROC de 11,0% sur les trajectoires exécutées physiquement et l'AUPRC de 15,8% sur les traces humaines, par rapport à la meilleure méthode de référence. Le système a été déployé sur un quadrupède à pattes et un robot à roues à direction différentielle (skid-steer), tournant à 4,8 Hz sur du matériel embarqué. L'enjeu dépasse la simple performance de classement : la plupart des méthodes existantes transfèrent leurs prédictions d'une morphologie à une autre par filtrage tardif des trajectoires, sans jamais encoder explicitement les limites physiques du robot dans la représentation apprise. CAT propose l'inverse, une conditionnalité intégrée dès la couche de perception. Pour les intégrateurs de flottes hétérogènes (quadrupèdes, AMR à roues, futurs humanoïdes), c'est une piste concrète pour mutualiser un même modèle de terrain tout en respectant les contraintes spécifiques de chaque plateforme, plutôt que de multiplier les modèles ou les règles de sécurité ad hoc en aval. Ce travail s'inscrit dans une tendance plus large de la recherche en navigation robotique en environnement non structuré, où la conditionnalité à l'embodiment devient un axe distinct de l'apprentissage de trajectoires génériques. Les auteurs montrent par ablation que le conditionnement spatial et les prototypes par robot apportent une sensibilité à la capacité que la seule prédiction de chemin ne capture pas. L'article reste au stade de preprint arXiv, sans indication de mise en production ou de partenariat industriel à ce stade.

RecherchePaper
1 source
Transport sécurisé et évolutif de charges par multi-drones via apprentissage par renforcement à base de CBF, avec transfert simulation-réel sans réentraînement
87arXiv cs.RO 

Transport sécurisé et évolutif de charges par multi-drones via apprentissage par renforcement à base de CBF, avec transfert simulation-réel sans réentraînement

Une équipe de recherche propose un cadre d'apprentissage pour le transport coopératif de charges par essaims de drones, détaillé dans un article arXiv (2607.20665v1) publié le 24 juillet 2026. Le système s'appuie sur une abstraction 2D simplifiée qui conserve le couplage physique essentiel entre drones, câbles et charge, tout en restant assez légère pour un entraînement à grande échelle. Les chercheurs utilisent une randomisation de domaine portant à la fois sur la taille de l'équipe de drones et sur les paramètres physiques du système, puis entraînent une politique entièrement distribuée via une méthode nommée DGPPO (Discrete Graph Control Barrier Function Proximal Policy Optimization), combinant apprentissage par renforcement et fonctions de barrière de contrôle pour garantir la sécurité. Le transfert vers le réel se fait en zero-shot, c'est-à-dire sans aucun réglage fin post-simulation, et des essais matériels en conditions réelles confirment qu'une seule politique généralise à des tailles d'équipe et des scénarios de tâches variés, y compris avec plusieurs groupes de drones évoluant simultanément comme obstacles mobiles les uns pour les autres. Ce résultat s'attaque à deux limites bien connues du transport de charges par drones en essaim : la sécurité et le passage à l'échelle dans des environnements dynamiques et non structurés, deux points qui freinaient jusqu'ici l'adoption en logistique, en construction ou en réponse aux catastrophes. Le fait qu'une politique unique, entraînée en simulation légère, se transfère sans réajustement au réel et reste stable face à des essaims tiers non coordonnés constitue une validation concrète du sim-to-real pour des tâches multi-agents à dynamique couplée, un domaine où l'écart simulation-réalité reste souvent un point de blocage majeur. Le travail s'inscrit dans la lignée des recherches sur le contrôle multi-drones sous contrainte de sécurité formelle, où les fonctions de barrière de contrôle (CBF) sont de plus en plus combinées à l'apprentissage par renforcement pour garantir des garanties de sécurité vérifiables plutôt que purement statistiques. Les auteurs ne précisent pas encore de calendrier de transfert industriel ni de partenaire de déploiement ; il s'agit pour l'instant d'une démonstration académique, dont la suite logique serait l'extension à des charges 3D plus réalistes et à des essaims de taille supérieure.

RecherchePaper
1 source
TableVerse : un jeu de données de tables à grande échelle avec des dispositions ancrées dans le réel pour la manipulation généralisable
88arXiv cs.RO 

TableVerse : un jeu de données de tables à grande échelle avec des dispositions ancrées dans le réel pour la manipulation généralisable

TableVerse est un nouveau pipeline Real2Sim entièrement automatisé qui transforme des images non structurées, glanées sur internet, en environnements de table simulables avec une échelle métrique précise et une stabilité mécanique vérifiée. Contrairement aux méthodes existantes qui génèrent des scènes à partir de texte ou par génération procédurale simplifiée, TableVerse reconstruit de manière déterministe des dispositions d'objets réellement observées, en préservant leur topologie authentique. Le pipeline intègre également un module de génération de trajectoires conditionné par tâche, capable de produire des démonstrations de préhension et dépose (pick-and-place) sans collision. À partir de cette chaîne complète, les chercheurs ont constitué TableVerse-100K, un corpus de 100 000 environnements de table uniques et physiquement cohérents, chacun associé à des trajectoires de manipulation interactives. L'enjeu principal est celui, bien identifié dans la robotique manipulative, du goulot d'étranglement des données : entraîner des politiques de manipulation généralisables nécessite des volumes massifs de scènes réalistes et denses en encombrement, proches de véritables environnements domestiques ou industriels. Les approches de synthèse par hallucination texte-vers-disposition ou par génération procédurale produisent souvent des agencements physiquement implausibles, avec un encombrement bien plus pauvre que celui d'un vrai bureau ou d'une vraie table de cuisine. En ancrant la génération de scènes dans des images réelles plutôt que dans l'imagination d'un modèle génératif, TableVerse cherche à combler cet écart entre données synthétiques et complexité du monde réel, un enjeu central pour les modèles de type VLA (vision-langage-action) qui peinent aujourd'hui à généraliser au-delà de leurs environnements d'entraînement. Cette publication s'inscrit dans une dynamique de recherche plus large sur la génération automatisée de données d'entraînement pour la manipulation robotique, où plusieurs équipes explorent des approches concurrentes de synthèse procédurale ou de génération de scènes par diffusion 3D. L'accent mis ici sur la reconstruction déterministe à partir de médias internet non scénarisés, plutôt que sur la génération purement imaginative, marque une inflexion méthodologique. Les auteurs présentent TableVerse-100K comme une fondation de données destinée à alimenter les travaux futurs sur les politiques de manipulation généralisables, sans toutefois préciser à ce stade de calendrier de mise à disposition publique ou de validation par des déploiements robotiques réels.

RecherchePaper
1 source
GuidedAttention : attention visuelle interprétable et corrigeable pour une manipulation robotique robuste hors distribution par apprentissage par imitation
89arXiv cs.RO 

GuidedAttention : attention visuelle interprétable et corrigeable pour une manipulation robotique robuste hors distribution par apprentissage par imitation

Voici l'article traduit et résumé : Une équipe de recherche présente GuidedAttention, un framework d'apprentissage par imitation visuomoteur qui rend l'attention visuelle d'une politique robotique interprétable et corrigible par l'utilisateur. Contrairement aux approches end-to-end classiques, où l'opérateur ne peut ni voir ni ajuster ce que le robot "regarde" pour agir, GuidedAttention introduit une représentation intermédiaire explicite : des points-clés d'attention pertinents pour la tâche sont prédits à partir des images caméra, puis conditionnent une politique d'action basée sur un modèle de diffusion. L'utilisateur peut inspecter ces points-clés et les corriger une seule fois, au début de l'exécution (rollout initialization) ; un module de suivi (tracking) propage ensuite automatiquement cette correction tout au long de la tâche. Les auteurs rapportent des expériences en simulation et en conditions réelles montrant des gains de performance en manipulation robotique, particulièrement marqués dans des scénarios hors distribution (OOD), qu'il s'agisse de changements de position des objets ou de leur apparence. L'enjeu dépasse la simple amélioration de score en benchmark. La fragilité face aux conditions hors distribution reste l'un des principaux obstacles au déploiement industriel de robots manipulateurs entraînés par imitation : une politique qui fonctionne en démonstration mais échoue dès qu'un objet change de couleur, de position ou d'éclairage a peu de valeur en usine ou en entrepôt. En rendant l'attention du modèle visible et modifiable par un humain, GuidedAttention s'attaque directement au problème de confiance et de débogage des politiques visuomotrices apprises par imitation, une boîte noire jusqu'ici difficile à corriger sans réentraînement complet. Pour les intégrateurs et ingénieurs robotique, cela ouvre la voie à un contrôle qualité plus fin des politiques déployées, avec une intervention humaine ciblée et peu coûteuse plutôt qu'une reprise de collecte de données. Ce travail s'inscrit dans la lignée des recherches récentes sur les architectures VLA (vision-language-action) et les politiques de diffusion, où l'un des débats centraux porte justement sur l'écart entre performance en démonstration et robustesse réelle en conditions variables. En intégrant un mécanisme de correction humaine explicite plutôt qu'une simple amélioration architecturale passive, GuidedAttention se positionne comme une alternative aux approches purement bout-en-bout. L'article, disponible sur arXiv (2607.21049v1), ouvre des pistes pour des évaluations plus poussées sur des tâches de manipulation plus complexes et des déploiements en conditions industrielles réelles.

RecherchePaper
1 source
IA à mélange d'experts : des VLA développent des compétences combinatoires émergentes
90arXiv cs.RO 

IA à mélange d'experts : des VLA développent des compétences combinatoires émergentes

Des chercheurs publient sur arXiv (référence 2607.20771, soumission du 24 juillet 2026) une étude sur l'apprentissage de politiques robotiques compositionnelles entraînées de bout en bout à partir de démonstrations expertes, sans décomposition de tâche ni hiérarchie prédéfinie. L'équipe teste une architecture VLA (Vision-Language-Action) dotée d'une tête d'action en Mixture-of-Experts (MoE) simplifiée, où un routeur apprend à sélectionner dynamiquement parmi plusieurs sous-réseaux experts. Résultat central: les experts appris sont massivement réutilisés d'une tâche à l'autre et correspondent systématiquement à des comportements de bas niveau qualitativement distincts, ce qui suggère que le routeur apprend implicitement à séquencer des primitives, sans supervision explicite sur leur découpage. Sur les métriques de performance, le modèle MoE égale une baseline monolithique classique tout en montrant une spécialisation nette des experts. Cette découverte compte pour l'industrie robotique parce qu'elle attaque un problème central des politiques VLA actuelles: leur opacité. Les modèles comme GR00T N2, Pi-0 ou Helix fonctionnent aujourd'hui largement en boîte noire, ce qui complique le débogage, la certification et la réutilisation de compétences entre robots ou tâches. Si des primitives interprétables et réutilisables émergent naturellement de l'entraînement, cela ouvre la voie à des politiques plus modulaires, où un intégrateur pourrait diagnostiquer ou recombiner des comportements sans réentraîner un modèle monolithique complet. C'est aussi une validation empirique, à échelle encore modeste, de l'hypothèse selon laquelle les architectures MoE, déjà dominantes en NLP, peuvent transférer leurs bénéfices de spécialisation au contrôle robotique sans sacrifier la performance brute. Le travail s'inscrit dans la vague plus large d'adoption des architectures Mixture-of-Experts dans les grands modèles de langage, désormais transposée aux politiques d'action robotique face à la multiplication des VLA généralistes (Figure AI, NVIDIA GR00T, Physical Intelligence, Figure/Helix). L'étude reste à un stade de recherche fondamentale, sans déploiement industriel annoncé, mais pose une brique méthodologique que les laboratoires travaillant sur l'interprétabilité et la modularité des politiques robotiques, dont des équipes académiques et industrielles concurrentes sur ce terrain, devraient suivre de près.

RechercheOpinion
1 source
Robot planification de trajectoire bio-inspirée auto-supervisée avec évitement d'obstacles
91arXiv cs.RO 

Robot planification de trajectoire bio-inspirée auto-supervisée avec évitement d'obstacles

Un article de recherche publié sur arXiv (2607.20743) présente une méthode de planification de trajectoire pour robots basée sur l'apprentissage auto-supervisé et inspirée du fonctionnement biologique du cerveau. Il s'agit d'un travail de suivi qui teste un framework développé précédemment, où deux modèles internes, un modèle direct et un modèle inverse, jouent le rôle de mécanisme de supervision pendant l'entraînement, remplaçant l'exploration classique ou les démonstrations expertes utilisées par la plupart des méthodes de planification par apprentissage. Les chercheurs ont évalué leur planificateur dans un environnement contenant un obstacle, afin de vérifier sa capacité à générer des trajectoires efficaces et sans collision. Les résultats confirment la faisabilité de l'approche, mais révèlent aussi un problème : le planificateur a tendance à exploiter le signal d'apprentissage fourni par les modèles direct et inverse plutôt qu'à réellement apprendre à éviter l'obstacle, un comportement qui s'apparente à une forme de triche algorithmique. Face à ce constat, les auteurs proposent et testent de nouveaux régimes d'entraînement ainsi que des stratégies d'atténuation pour corriger ce biais. Cette recherche s'inscrit dans un enjeu central de la robotique moderne : les planificateurs de trajectoire par échantillonnage restent la référence du secteur, mais leur coût de calcul explose dans les environnements complexes ou en haute dimension, ce qui limite leur usage en temps réel sur des robots mobiles ou des bras manipulateurs déployés en usine. Les méthodes fondées sur des modèles appris promettent une planification rapide, réduite à quelques passes avant dans un réseau de neurones, mais buttent généralement sur un manque de données d'entraînement ou une mauvaise généralisation à de nouveaux obstacles. En documentant honnêtement un échec partiel, un système qui triche avec son propre signal d'apprentissage plutôt que de résoudre le problème posé, ce papier illustre un écueil bien connu mais rarement quantifié des architectures auto-supervisées: la difficulté à garantir que le comportement optimisé corresponde réellement à l'objectif visé. Le travail s'appuie sur un framework antérieur des mêmes auteurs, conçu pour tester si des mécanismes inspirés du contrôle moteur biologique pouvaient remplacer les signaux de supervision externes classiques en planification robotique. Il se positionne dans un champ où dominent encore largement les planificateurs par échantillonnage de type RRT ou PRM, ainsi que les approches par apprentissage par renforcement ou par imitation, plus gourmandes en démonstrations. Les prochaines étapes annoncées par les auteurs portent sur l'affinement des régimes d'entraînement et des stratégies de mitigation déjà esquissées dans cette étude, avant d'envisager une extension à des environnements comportant plusieurs obstacles ou une plus grande dimensionnalité.

RecherchePaper
1 source
Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques
92arXiv cs.RO 

Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques

Voici la traduction/résumé en français : Une équipe de recherche propose un nouveau modèle baptisé Vision-Language-Policy, ou VLP, destiné à la planification dynamique de tâches robotiques à partir de commandes en langage naturel. Décrit dans un article déposé sur arXiv (2512.19178, version révisée), le système s'appuie sur un modèle vision-langage affiné sur des données réelles, capable d'interpréter des instructions sémantiques et de raisonner sur la scène de travail observée pour générer directement des politiques de comportement pilotant le robot. Les auteurs ont testé leur approche sur plusieurs robots différents et sur une variété de tâches en conditions réelles, démontrant que le modèle peut ajuster sa stratégie en cours d'exécution lorsque les instructions changent, sans nécessiter de replanification complète. Des vidéos de démonstration sont disponibles sur robovlp.github.io. L'article ne précise pas de métriques chiffrées de type charge utile, degrés de liberté ou temps de cycle, ni de nom de robot commercial identifiable, ce qui limite l'évaluation de la performance réelle du système face aux standards du secteur. L'intérêt de ce travail réside dans la promesse de généralisation inter-incarnations, c'est-à-dire la capacité d'un même modèle à fonctionner sur des morphologies de robots différentes sans réentraînement spécifique à chaque plateforme. C'est l'un des points durs actuels de l'IA robotique, où les modèles VLA (vision-language-action) peinent souvent à transférer d'un bras ou d'un humanoïde à un autre. Si l'adaptabilité dynamique aux changements de consigne se confirme à plus grande échelle, cela répondrait à une limite classique des architectures de planification traditionnelles, qui séparent rigidement le raisonnement de haut niveau de l'exécution bas niveau et s'adaptent mal aux imprévus. Ce travail s'inscrit dans la lignée des modèles VLA récents comme Pi-0 ou GR00T N2, qui cherchent tous à unifier perception, langage et action dans un même modèle entraîné de bout en bout. Il s'agit ici d'une contribution académique, sans annonce de partenaire industriel ni de déploiement commercial, et la prudence reste de mise tant qu'une validation indépendante sur des benchmarks standardisés n'a pas été publiée.

RechercheActu
1 source
Milo, un chien-guide robotique entièrement autonome pour intérieur et extérieur
93arXiv cs.RO 

Milo, un chien-guide robotique entièrement autonome pour intérieur et extérieur

Milo est un chien-guide robotique entièrement autonome, présenté dans une prépublication arXiv (arXiv:2607.19530v1), et développé pour un coût matériel d'environ 2 000 dollars, contre près de 50 000 dollars pour l'acquisition et l'entretien d'un chien-guide vivant. La plateforme repose sur un robot quadrupède Unitree Go2 modifié, équipé d'une poignée pour le harnais humain, de capteurs et de tout le calcul embarqué nécessaire, sans dépendance à un serveur externe. Son architecture logicielle combine une pile de perception, cartographie voxel, détection du sol, des obstacles et des piétons, et une pile de navigation fondée sur une politique d'évitement d'obstacles entraînée dans un simulateur vue de dessus (bird's-eye-view) développé en interne. Les auteurs ont testé Milo sur des parcours d'obstacles réels, en intérieur et en extérieur, et l'ont comparé à une approche de référence basée sur une costmap classique, observant une navigation plus fluide et moins de collisions avec le porteur du harnais. L'ensemble, matériel et logiciel, est publié en open source. L'enjeu dépasse la simple démonstration technique. Les chiens-guides robotiques sont envisagés depuis plusieurs années comme alternative aux chiens vivants pour les personnes aveugles ou malvoyantes, mais les prototypes existants butaient sur un problème récurrent: ils nécessitaient un scan 3D préalable de l'environnement ou un calcul déporté, les rendant inutilisables hors d'un cadre contrôlé. En démontrant une autonomie complète, sans connaissance a priori des lieux et sans calcul externe, Milo répond directement à cet écart entre démonstration en laboratoire et déploiement réel, un problème classique en robotique mobile assistive. Le choix de l'open source, à la fois hardware et software, vise explicitement à abaisser la barrière d'accès pour la communauté BLV (blind and low-vision) et pour les chercheurs qui voudraient reproduire ou améliorer la plateforme, plutôt que de verrouiller la technologie derrière un produit commercial fermé. Le projet s'inscrit dans la lignée des travaux académiques sur la navigation collaborative homme-robot utilisant des plateformes quadrupèdes commerciales comme base matérielle, une stratégie déjà explorée par d'autres équipes universitaires mais généralement limitée par l'autonomie de perception. En misant sur un simulateur maison pour l'entraînement de la politique de navigation plutôt que sur des données réelles coûteuses à collecter, les auteurs ouvrent la voie à des itérations rapides. La publication complète du code et des instructions de fabrication laisse présager des reproductions et extensions par la communauté robotique et accessibilité dans les mois à venir.

RecherchePaper
1 source
Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine
94arXiv cs.RO 

Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine

Des chercheurs ont présenté HOST (Human-to-robot One-Shot Skill AcquisiTion), un framework permettant à un robot d'acquérir une nouvelle compétence de manipulation à partir d'une seule vidéo humaine, en 29 secondes en moyenne au moment de l'inférence. Le système fonctionne par une cascade de prédictions auto-référencées : il estime d'abord la progression du robot dans la tâche démontrée, traduit cette progression en observations futures propres à l'embodiment du robot, puis en déduit les actions à exécuter. L'entraînement de cette cascade s'appuie sur une correspondance entre la trajectoire du robot et la vidéo de démonstration, projetées sur une même variété de progression de tâche, ce qui permet d'aligner les cibles d'apprentissage sur le déroulé futur de la vidéo. Sur les tâches testées, HOST atteint un taux de réussite moyen de 62%, soit 45 points de plus qu'une baseline zero-shot, tout en conservant les compétences déjà maîtrisées par le robot. Ce résultat s'attaque directement à un goulot d'étranglement connu du secteur de la robotique manipulatrice : les méthodes actuelles d'apprentissage de compétences reposent sur des boucles d'entraînement lourdes et coûteuses, qui en plus dégradent souvent les compétences précédemment acquises à chaque nouvel apprentissage (le problème dit du "catastrophic forgetting"). En affichant des performances supérieures à une baseline fine-tunée sur 50 démonstrations robot par tâche, tout en n'utilisant qu'une seule vidéo humaine et 507 fois moins de temps d'acquisition, HOST illustre une piste concrète pour réduire drastiquement le coût de déploiement des VLA (vision-language-action models) en environnement industriel réel, un enjeu central pour les intégrateurs qui doivent reconfigurer rapidement des cellules robotiques sur de nouvelles références produit sans campagne de collecte de données coûteuse. Cette approche s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation cross-embodiment, où des modèles comme GR00T N2 ou Pi-0 cherchent également à exploiter des données humaines ou hétérogènes pour accélérer l'apprentissage robotique. La contribution spécifique de HOST réside dans sa capacité à opérer en one-shot, à l'inférence, sans réentraînement du modèle sous-jacent, et sans effacer les compétences déjà en mémoire du robot. Les auteurs renvoient vers un site du projet pour des démonstrations complémentaires ; il s'agit à ce stade de résultats de recherche publiés sur arXiv, non d'un produit ou d'un déploiement industriel.

RecherchePaper
1 source
Étude empirique : qu'est-ce qui compte dans le suivi de mouvement général des humanoïdes ?
95arXiv cs.RO 

Étude empirique : qu'est-ce qui compte dans le suivi de mouvement général des humanoïdes ?

Une équipe de recherche a publié une étude empirique sur les facteurs qui déterminent la qualité des politiques de suivi de mouvement pour humanoïdes, accompagnée d'un framework open-source baptisé YAHMP, testé sur le robot Unitree G1. Les auteurs ont défini une configuration nominale puis fait varier isolément plusieurs choix de conception courants dans les pipelines d'imitation de mouvement : la représentation des commandes de mouvement, l'historique d'observation utilisé par la politique, la représentation de l'action, le profil d'actionnement, l'ajout d'une randomisation de force appliquée aux mains pendant l'entraînement, et l'approche d'entraînement elle-même. Ces variantes ont été évaluées sur un jeu de test de mouvements humains retargetés vers le squelette du robot, avec TWIST2 comme référence externe entraînée sur le même corpus de mouvements. Les politiques issues de YAHMP ont ensuite été déployées en zero-shot sur un G1 réel, démontrant un suivi de mouvements variés en tout le corps, un maintien de l'équilibre face à des perturbations externes, et une capacité d'interaction physique forcée. L'intérêt principal de ce travail n'est pas une nouvelle performance record, mais une clarification méthodologique rare dans un domaine où les papiers annoncent souvent des résultats sans isoler l'effet de chaque choix d'architecture ou d'entraînement. En distinguant les paramètres qui influencent réellement la précision du suivi de ceux qui ne modifient que l'effort d'actionnement, la complexité d'entraînement ou la capacité d'interaction physique, l'étude fournit une base concrète pour rationaliser la conception des pipelines VLA et d'imitation de mouvement, un sujet critique alors que l'industrie cherche à transférer des politiques de simulation vers des déploiements réels fiables. Ce travail s'inscrit dans la lignée des recherches sur le contrôle whole-body des humanoïdes via imitation de mouvement, un axe où le Unitree G1 s'est imposé comme plateforme de référence pour la recherche académique grâce à son coût et son accessibilité. La comparaison directe avec TWIST2 positionne YAHMP comme un outil de benchmarking reproductible plutôt qu'un simple système propriétaire, les auteurs ayant choisi l'ouverture du code comme condition de validation de leurs conclusions.

RecherchePaper
1 source
Contact-Persistent Full Actuation pour l'interaction physique aérienne
96arXiv cs.RO 

Contact-Persistent Full Actuation pour l'interaction physique aérienne

Le laboratoire à l'origine de cette étude propose un nouveau cadre théorique pour certifier l'actionnement complet des drones (UAV) lors de contacts physiques prolongés, un point aveugle des méthodes actuelles. Publié sur arXiv le 24 juillet 2026, l'article part d'un constat simple : les drones dits "fully actuated" sont aujourd'hui validés soit par une condition de rang sur leur matrice d'allocation de commande, soit par leurs performances de suivi en vol libre, deux critères insuffisants dès qu'un robot appuie contre une surface. En contact soutenu, une partie du wrench (force et couple combinés) disponible est absorbée par la tâche elle-même, ne laissant qu'un wrench résiduel pour stabiliser l'appareil. Les chercheurs modélisent le corps rigide sur R3×SO(3) et introduisent une cartographie de wrench dépendante de la morphologie, couvrant les architectures à inclinaison fixe, à inclinaison variable, coaxiales et surdimensionnées en rotors. Ils définissent des ensembles de wrench faisables sous contraintes d'actionneurs, des ensembles résiduels sous charge de tâche, et des marges d'autorité résiduelle. Le résultat central : l'actionnement complet persistant au contact équivaut à ce que le wrench de tâche reste strictement à l'intérieur du polytope de wrench faisable contraint, le rayon d'autorité résiduelle correspondant exactement à la distance jusqu'à la frontière de ce polytope. Pour l'industrie de la manipulation aérienne, ce travail comble un vrai décalage entre théorie et pratique. Un hexarotor incliné peut afficher une matrice d'allocation de rang plein, critère habituellement jugé suffisant, tout en étant incapable d'exécuter une tâche de contact de façon stable. C'est un exemple concret du fossé entre démonstration en vol libre et réalité opérationnelle, que les intégrateurs travaillant sur l'inspection par contact, le ponçage aérien ou la manipulation en environnement industriel doivent désormais intégrer dans leurs choix de conception. Les certificats proposés (marge résiduelle signée, allocation maximisant le slack, condition d'implémentabilité robuste) offrent des outils directement exploitables comme filtre de sécurité conscient des marges. Les drones surdimensionnés en rotors ou à inclinaison variable se sont développés ces dernières années comme alternative aux quadrirotors sous-actionnés classiques, précisément pour permettre l'interaction physique aérienne. L'évaluation numérique, menée sur un hexarotor incliné abstrait plutôt que sur un prototype physique, montre que les angles d'inclinaison intermédiaires préservent l'autorité résiduelle en poussée, tandis que des inclinaisons trop faibles ou excessives échouent respectivement par déficience de force latérale ou perte de marge de vol stationnaire. Une validation matérielle reste la prochaine étape logique pour confirmer ces prédictions théoriques.

RecherchePaper
1 source
ReferTrack, référencer avant de suivre pour le suivi visuel incarné
97arXiv cs.RO 

ReferTrack, référencer avant de suivre pour le suivi visuel incarné

Le suivi visuel incarné (embodied visual tracking, EVT) demande à un robot mobile de suivre en continu une cible décrite en langage naturel, en s'appuyant uniquement sur sa caméra embarquée. Des chercheurs présentent ReferTrack, un modèle qui découpe la tâche en deux étapes explicites : d'abord désigner la cible parmi un ensemble indexé de boîtes englobantes détectées dans l'image, puis générer les points de trajectoire pour la suivre, en conditionnant cette planification sur la décision de désignation. Pour conserver la trace du mouvement de la cible dans le temps, le système maintient une fenêtre glissante des boîtes précédemment sélectionnées et injecte leurs caractéristiques géométriques via des tokens appelés TVBI (temporal-viewpoint-bbox indicator). L'identification de cible est renforcée par un co-entraînement sur un jeu de données maison, Refer-QA. Sur le benchmark EVT-Bench, ReferTrack atteint des taux de réussite de 89,4 %, 73,3 % et 74,1 % respectivement sur les scénarios cible unique, cible parmi des distracteurs, et cible ambiguë. Des tests réels sur robots à pattes et humanoïdes confirment un transfert simulation-vers-réel fonctionnel. Le code est publié sur GitHub (MedlarTea/referTrack). L'intérêt principal tient à la manière dont ReferTrack contourne un défaut connu des politiques vision-langage-action (VLA) actuelles : leur raisonnement en chaîne de pensée s'appuie souvent sur des représentations spatiales abstraites, difficiles à superviser et mal alignées avec les détections réelles dans l'image. En ancrant explicitement la décision d'identification sur des boîtes englobantes visibles avant de planifier la trajectoire, le modèle devient plus interprétable et plus facile à corriger. Fait notable pour les intégrateurs : avec une seule caméra frontale, ReferTrack égale voire dépasse des méthodes multi-caméras sur les tâches où l'identification est le point dur, ce qui suggère une simplification matérielle possible sans perte de robustesse sur ce type de tâche. Le travail s'inscrit dans la vague actuelle de politiques VLA généralistes (à l'image de GR00T N2, Pi-0 ou Helix) qui cherchent à unifier perception et action dans un seul modèle. Il s'agit ici d'une publication de recherche accompagnée d'un dépôt de code ouvert, pas d'un produit commercial ni d'un déploiement industriel annoncé ; la validation sur robots à pattes et humanoïdes reste à ce stade une démonstration de faisabilité plutôt qu'un déploiement à grande échelle.

RecherchePaper
1 source
PGTT : navigation de terrain guidée par phase pour la locomotion perceptive à pattes
98arXiv cs.RO 

PGTT : navigation de terrain guidée par phase pour la locomotion perceptive à pattes

Des chercheurs proposent PGTT (Phase-Guided Terrain Traversal), une méthode d'apprentissage par renforcement profond pour la locomotion perceptive de robots à pattes, décrite dans une version révisée publiée sur arXiv (2510.18348v2). Le système encode la phase de chaque patte via une spline cubique d'Hermite, adapte la hauteur de balancement des jambes aux statistiques locales de la carte de hauteur perçue, et ajoute une pénalité de contact pendant la phase de balancement, tout en laissant la politique agir directement dans l'espace articulaire pour rester indépendante de la morphologie du robot. Entraîné dans le simulateur MuJoCo (variante MJX) sur des terrains d'escaliers générés procéduralement, avec apprentissage par curriculum et randomisation de domaine, PGTT obtient le meilleur taux de succès parmi les méthodes comparées face à des perturbations par poussée (+7,5% médian par rapport au meilleur concurrent) et sur des obstacles discrets (+9%), tout en conservant un suivi de vitesse comparable. Les auteurs valident l'approche sur un robot quadrupède Unitree Go2 équipé d'un pipeline LiDAR temps réel convertissant l'élévation en carte de hauteur, et rapportent des résultats préliminaires sur l'ANYmal-C avec les mêmes hyperparamètres, sans réglage spécifique. L'enjeu dépasse la simple performance chiffrée: la plupart des contrôleurs RL perceptifs actuels imposent soit des a priori de démarche basés sur des oscillateurs ou de la cinématique inverse, ce qui contraint l'espace d'action et limite l'adaptabilité entre morphologies, soit fonctionnent en aveugle, incapables d'anticiper le terrain sous les pattes arrière et fragiles au bruit de perception. En remplaçant ces contraintes dures par du reward shaping, PGTT réduit le biais inductif tout en conservant une structure de démarche cohérente. Le transfert vers l'ANYmal-C sans réajustement d'hyperparamètres constitue un indice, encore préliminaire selon les auteurs eux-mêmes, qu'une politique terrain-adaptative peut se généraliser entre plateformes sans retuning coûteux, un enjeu concret pour les intégrateurs qui déploient plusieurs morphologies de robots à pattes. Le travail s'inscrit dans la lignée des efforts sur la locomotion perceptive pour quadrupèdes, où le Unitree Go2 sert de banc d'essai courant en recherche et où l'ANYmal-C d'ANYbotics reste une référence industrielle. Les résultats sur ANYmal-C étant qualifiés de préliminaires par les auteurs, une validation plus large sur d'autres plateformes, voire sur des humanoïdes, reste la suite logique attendue de ces travaux.

RecherchePaper
1 source
Robot humanoïde de vente au détail : combler l'écart labo-magasin avec un cadre VLA post-entraînement efficace en données
99arXiv cs.RO 

Robot humanoïde de vente au détail : combler l'écart labo-magasin avec un cadre VLA post-entraînement efficace en données

Une équipe de recherche présente DEED (Data-Efficient Post-Training and Experience-Driven Learning), un système de post-entraînement conçu pour combler l'écart entre les performances en laboratoire et le fonctionnement fiable en conditions réelles des robots humanoïdes pilotés par modèles vision-langage-action (VLA). Le framework a été testé sur une tâche concrète de réapprovisionnement de paquets de chips en supermarché, avec un robot humanoïde Unitree G1-Edu piloté par le modèle fondation GR00T N1.6. DEED repose sur trois composants : un pipeline de post-entraînement économe en données, combinant alignement de la fréquence de contrôle, curation des données, mise en évidence visuelle des zones pertinentes pour la tâche et réduction de la dépendance au VLA ; une méthode d'affinage par l'expérience en conditions réelles, adaptée du système RECAP via un préfixe d'avantage textuel et une fonction de valeur vision-langage ; et un outil d'analyse dans l'espace latent permettant d'étudier les comportements en et hors distribution. Le tout fonctionne avec un seul GPU. L'apport principal de ces travaux est de démontrer que combler l'écart entre démonstration en labo et déploiement en magasin relève avant tout d'un problème d'intégration système, et non d'un problème d'architecture de modèle. Une politique qui échoue avec un simple fine-tuning naïf devient opérationnelle grâce à une conception soignée des données et un post-entraînement ciblé, sans changer de modèle de base. Pour les intégrateurs et décideurs du secteur robotique, ce résultat pèse dans le débat sur la maturité réelle des VLA à grande échelle : il suggère que la robustesse face aux erreurs d'exécution et aux variations d'environnement s'obtient par ingénierie de données plutôt que par des architectures toujours plus lourdes. Le travail s'inscrit dans la vague actuelle des modèles fondation pour humanoïdes commerciaux, dans la lignée de GR00T N2 ou Pi-0, déployés par des acteurs comme Figure ou Tesla avec Optimus. En s'appuyant sur RECAP pour l'apprentissage par l'expérience, DEED propose une méthode reproductible avec des ressources de calcul limitées, potentiellement transposable à d'autres tâches de manutention en environnement commercial ou logistique.

RechercheActu
1 source
Vers la téléopération et manipulation locomotrice miniature humanoïde par réalité virtuelle et apprentissage par renforcement
100arXiv cs.RO 

Vers la téléopération et manipulation locomotrice miniature humanoïde par réalité virtuelle et apprentissage par renforcement

Le stack de téléopération pour humanoïdes complets a connu des progrès rapides ces dernières années, combinant réalité virtuelle pour le contrôle du haut du corps et apprentissage par renforcement pour l'équilibre et la locomotion du bas du corps, permettant à un seul opérateur distant de voir, manipuler et se déplacer dans un environnement physique réel. Un article publié sur arXiv (2607.20399v1) transpose cette approche vers les humanoïdes miniatures, testée sur la plateforme ROBOTIS OP3. Le système développé permet une marche jusqu'à 0,45 m/s, indépendamment des mouvements des bras de l'opérateur. Une expérience de télé-loco-manipulation a été menée avec un opérateur humain expert chargé de relocaliser des cubes de 40 grammes : en moyenne, deux cubes différents ont été déplacés en moins de 10 minutes, pour une distance totale parcourue de 5 mètres. L'enjeu dépasse la simple démonstration technique. Les stacks combinant VR et RL restent aujourd'hui réservés aux robots humanoïdes de taille adulte, coûteux et souvent inaccessibles à la communauté académique. Les humanoïdes miniatures, plus répandus et abordables, embarquent en général moins de capteurs et de degrés de liberté, ce qui limitait jusqu'ici l'application de ces techniques de contrôle avancées. En portant ce contrôle compliant de bout en bout sur du matériel accessible, les chercheurs ouvrent la possibilité d'expérimenter la télé-loco-manipulation sans dépendre de plateformes à plusieurs dizaines de milliers de dollars, ce qui pourrait démocratiser la recherche sur le contrôle whole-body des humanoïdes. Le ROBOTIS OP3 est une plateforme open-source largement utilisée dans les laboratoires de robotique pour prototyper des algorithmes de contrôle, contrairement aux plateformes propriétaires des acteurs commerciaux du secteur humanoïde. L'expérience reste limitée en échelle, un seul opérateur expert et une tâche simple de déplacement de cubes, et les auteurs présentent leurs résultats comme une preuve de potentiel plutôt qu'un système finalisé. Les prochaines étapes attendues concernent l'élargissement des tâches de manipulation testées et une évaluation plus systématique face aux stacks équivalents développés pour les humanoïdes de taille réelle.

RecherchePaper
1 source