Aller au contenu principal
RecherchearXiv cs.RO 

Praxis : des a priori d'interaction physique de vidéos égocentriques pour une manipulation généralisable du corps entier

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint publié le 28 septembre 2026 sur arXiv (2609.30735) décrit Praxis, un framework de manipulation corps-entier pour robots humanoïdes mobiles, capable d'apprendre une compétence à partir d'une seule démonstration vidéo égocentrique, sans réentraînement de politique spécifique à la tâche. Le système enchaîne trois étapes : une navigation guidée par un modèle vision-langage vers l'objet cible, une calibration de posture en boucle fermée qui aligne l'espace de travail bras-main, puis une manipulation dextre avec coordination synchronisée du haut et du bas du corps. Un retour visuel en ligne réajuste la géométrie d'interaction démontrée face à de nouvelles poses d'objets, tandis qu'un retour tactile adapte les mouvements de la main aux conditions de contact réelles. Testé sur cinq tâches de manipulation à horizon long, le système montre une généralisation spatiale, visuelle et inter-objets, ainsi qu'une récupération après perturbation physique externe à chacune des trois étapes.

L'intérêt pour l'industrie tient à la réduction du coût de collecte de données : la plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action ou sur l'apprentissage par renforcement, exigent des centaines de démonstrations téléopérées par tâche pour généraliser correctement. En ne nécessitant qu'un seul enregistrement vidéo humain par compétence et aucune caméra embarquée sur robot pendant la collecte, Praxis s'attaque directement au goulot d'étranglement qui freine le déploiement d'humanoïdes polyvalents chez les intégrateurs. La combinaison de retours visuel et tactile pour récupérer d'une perturbation en conditions réelles, plutôt que de rejouer une trajectoire figée, touche un point sensible du secteur : l'écart persistant entre démonstrations soignées et robustesse en usage industriel réel.

Praxis s'inscrit dans la lignée des recherches sur l'apprentissage par imitation à partir de vidéos humaines, une alternative moins coûteuse à la téléopération massive utilisée par les grands modèles vision-langage-action. Il s'agit à ce stade d'un résultat de recherche publié en preprint, sans nom de produit ni partenaire industriel annoncé, testé sur cinq tâches en conditions expérimentales contrôlées et non en déploiement réel chez un client. L'étape suivante, non détaillée dans le résumé, consisterait à étendre le nombre de compétences apprises simultanément et à valider l'approche sur des plateformes robotiques commerciales avant toute évaluation par des intégrateurs.

À lire aussi

RoboReact : distillation de compétences à base d'agents à partir de vidéos égocentriques générées pour une manipulation généralisable du corps entier
1arXiv cs.RO 

RoboReact : distillation de compétences à base d'agents à partir de vidéos égocentriques générées pour une manipulation généralisable du corps entier

RoboReact est une méthode qui génère automatiquement des compétences de manipulation pour robots humanoïdes à partir d'une seule observation égocentrique RGB-D, sans télé-opération ni démonstration humaine. Un modèle génératif vidéo synthétise des séquences de manipulation, dont le système extrait des images clés d'interaction par reconstruction 3D préservant la géométrie du contact main-objet, avant de les retargeter vers des plateformes humanoïdes à haut nombre de degrés de liberté (DoF). Pour combler l'écart entre le geste imaginé et l'exécution physique, RoboReact recale en ligne la position de l'objet et s'appuie sur une boucle de raffinement guidée par un modèle vision-langage, qui corrige le geste en cas d'écart géométrique. Les compétences affinées sont exécutées par un contrôleur corps-entier. Sur des robots réels, les auteurs rapportent une généralisation à des configurations d'objets variées et une récupération après perturbation, sans télé-opération. L'enjeu dépasse la simple prouesse technique : collecter des démonstrations diverses pour entraîner des robots humanoïdes coûte cher, entre matériel, télé-opération et annotation, ce qui freine les modèles vision-langage-action (VLA) génériques du type Pi-0, GR00T N2 ou Helix. En transformant une vidéo générée par IA en compétence exécutable sur un robot réel sans capture de mouvement humain, RoboReact propose une voie pour multiplier les données d'entraînement à moindre coût, un enjeu central pour combler l'écart entre simulation et réel. Il s'agit toutefois d'une publication de recherche (arXiv, catégorie "new"), pas d'un produit commercial ni d'un déploiement industriel : le papier ne chiffre pas précisément le nombre de tâches ou d'objets testés, ce qui invite à la prudence sur la portée réelle de la généralisation annoncée. Cette approche s'inscrit dans une tendance large : utiliser des modèles génératifs vidéo comme source de données d'entraînement pour la robotique, en alternative aux pipelines de collecte par télé-opération ou capture de mouvement, coûteux à faire passer à l'échelle. Elle rejoint les efforts des laboratoires développant des modèles VLA généralistes, tous en quête d'un moyen de réduire la dépendance aux démonstrations humaines directes. Le papier ne cite aucun partenaire industriel ni site de déploiement ; les suites attendues sont l'extension à davantage de tâches et une validation indépendante avant tout usage en conditions réelles.

RechercheActu
1 source
EgoPriMo : génération de mouvement égocentrique pour le contrôle interactif d'humanoïdes
2arXiv cs.RO 

EgoPriMo : génération de mouvement égocentrique pour le contrôle interactif d'humanoïdes

Des chercheurs ont publié le 9 juin 2026 sur arXiv (réf. 2606.08495) EgoPriMo, un cadre unifié d'apprentissage de prior de mouvement pour robots humanoïdes, entraîné exclusivement à partir de démonstrations humaines en vue égocentrique (caméra portée sur la personne). Le système prend en entrée une séquence vidéo égocentrique et un prompt texte, puis reconstruit, génère ou prédit des mouvements corps entier au format SMPL (Skinned Multi-Person Linear model, le standard académique de représentation du squelette humain). L'architecture centrale est un Triple-stream Diffusion Transformer (DiT) qui modélise conjointement la dynamique corporelle, le contexte visuel égocentriique et le langage naturel via un seul checkpoint partagé, des masques de conditionnement de tâche routant les trois cas d'usage sans architecture distincte. Évalué sur les datasets Nymeria et EgoExo4D, EgoPriMo surpasse UniEgoMotion sur la génération égocentrique, et les trajectoires SMPL produites ont été exécutées avec succès sur le contrôleur humanoïde Unitree (probablement G1 ou H1). Il s'agit d'un papier de recherche, pas d'un déploiement industriel. L'intérêt de cette approche tient à son vecteur de données : les vidéos égocentrique humaines (Nymeria, EgoExo4D) sont disponibles à grande échelle, contrairement aux démonstrations téléopérées sur robots qui restent coûteuses et lentes à collecter. En utilisant le langage comme signal de contrôle haut niveau plutôt que comme spécification complète du mouvement, EgoPriMo vise la généralisation comportementale sans avoir à décrire exhaustivement chaque trajectoire, ce qui est l'un des verrous historiques des systèmes VLA (Vision-Language-Action). Le fait qu'un seul checkpoint gère reconstruction, génération et prévision simplifie le déploiement et réduit la dette de maintenance. La validation sur Unitree démontre une transition sim-to-real partielle, bien qu'aucun chiffre de robustesse en environnement non contrôlé ne soit communiqué dans l'abstract. Ce travail s'inscrit dans une compétition dense autour des priors de mouvement pour humanoïdes. Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Figure (03) investissent massivement dans des pipelines VLA capables de généraliser à des tâches variées. L'originalité d'EgoPriMo est de contourner la dépendance aux données robot en exploitant l'observation humaine égocentrique, une direction explorée également par des travaux issus de CMU et Stanford sur l'imitation via vidéo. Le choix de Unitree comme cible hardware est cohérent avec sa diffusion large dans les labos académiques. Les prochaines étapes naturelles seraient une validation en environnement semi-industriel et une intégration dans une boucle de contrôle fermée, deux dimensions absentes de ce preprint.

RechercheOpinion
1 source
Sumo : la loco-manipulation dynamique et généralisable du corps entier
3arXiv cs.RO 

Sumo : la loco-manipulation dynamique et généralisable du corps entier

Un institut de recherche a publié via arXiv (article 2604.08508, troisième révision) un travail intitulé "Sumo: Dynamic and Generalizable Whole-Body Loco-Manipulation", mené sur les serveurs du RAI Institute (ex-Boston Dynamics AI Institute, hébergé sur rai-inst.com). La méthode combine sim-to-real et pilotage en temps réel: une politique de contrôle corps entier pré-entraînée est guidée au moment de l'exécution par un planificateur basé sur l'échantillonnage, sans réentraînement supplémentaire. Les chercheurs ont testé l'approche sur un robot quadrupède Spot (Boston Dynamics) dans le monde réel, avec deux tâches marquantes: redresser un pneu plus lourd que la capacité de levage nominale du robot, et traîner une barrière anti-émeute plus grande et plus haute que l'engin lui-même. Le système s'est aussi montré capable de généraliser à une variété d'objets et de tâches sans réglage additionnel, la fonction de coût pouvant être ajustée à la volée. En simulation uniquement, les auteurs étendent la méthode à un humanoïde pour ouvrir une porte et pousser une table. Code et vidéos sont publiés sur sumo.rai-inst.com. L'intérêt principal tient à la généralisation obtenue sans réentraînement par objet: une seule politique, pilotée différemment selon le contexte, remplace la logique habituelle d'entraînement dédié à chaque tâche de manipulation. Pour les intégrateurs et les équipes de R&D en robotique mobile, cela suggère une voie pour dépasser les limites de charge utile nominale annoncées par les constructeurs, un enjeu concret en logistique, chantier ou intervention d'urgence où les objets à déplacer dépassent souvent les specs du robot. Il faut toutefois noter que les résultats humanoïdes ne sont validés qu'en simulation, sans transfert réel démontré, et qu'aucun chiffre précis de masse, de temps de cycle ou de taux de réussite n'est communiqué dans le résumé, ce qui invite à la prudence avant de parler de percée généralisée. Le RAI Institute a été fondé par Marc Raibert, également fondateur de Boston Dynamics, comme structure de recherche indépendante à but non lucratif détachée de la feuille de route produit de Boston Dynamics. Spot reste la plateforme quadrupède commerciale de Boston Dynamics, ici réutilisée comme banc d'essai académique plutôt que comme produit vendu. Ce travail se distingue des approches dominantes du moment fondées sur des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, en misant sur la planification par échantillonnage plutôt que sur un grand modèle appris de bout en bout. Les prochaines étapes attendues concernent la validation réelle du volet humanoïde, actuellement cantonné à la simulation.

RecherchePaper
1 source
SiMDex : exploiter des vidéos égocentriques similaires pour la manipulation dextre inter-incarnation
4arXiv cs.RO 

SiMDex : exploiter des vidéos égocentriques similaires pour la manipulation dextre inter-incarnation

Des chercheurs présentent SiMDex, un framework de curation de données par similarité pour l'entraînement des modèles vision-langage-action (VLA) appliqués à la manipulation dextre robotique, publié début août 2026 sur arXiv. Le système traite un problème concret: parmi des millions de vidéos égocentriques humaines disponibles, lesquelles sont réellement utiles pour apprendre à un bras ou une main robotique à manipuler des objets? SiMDex formule cette sélection comme un problème de recommandation, avec un pipeline en trois étapes (rappel, classement, reclassement) qui extrait, pour chaque démonstration robotique, les sous-ensembles pertinents dans un réservoir d'environ 32 millions d'échantillons vidéo égocentriques. L'espace d'action utilisé est agnostique à la morphologie, donc aucune modification de l'architecture VLA ni du processus d'entraînement n'est requise pour l'intégrer. Face à une base de référence entraînée avec un volume équivalent de données humaines choisies aléatoirement, SiMDex n'utilise que 1,49 million d'échantillons triés, soit moins de 5% du réservoir total, tout en faisant grimper le taux de réussite global de 47,7% à 61,1%. Cet écart de plus de 13 points obtenu avec dix fois moins de données a une portée directe pour le secteur: il suggère que le frein au post-entraînement des VLA n'est pas le volume de vidéos humaines disponibles, mais leur pertinence pour la tâche visée. Depuis deux ans, la course à la manipulation dextre mise surtout sur la mise à l'échelle brute de jeux de données égocentriques pour combler l'écart entre démonstration et déploiement réel. SiMDex questionne cette logique indiscriminée: pour les laboratoires et intégrateurs qui entraînent des politiques de manipulation, un curatoriat ciblé peut réduire fortement les coûts de calcul et de stockage tout en améliorant la performance, sans toucher au modèle lui-même. Le travail s'inscrit dans la recherche sur l'apprentissage cross-embodiment, où des vidéos de mains humaines servent à préentraîner des politiques ensuite transférées à des mains ou bras robotiques de morphologie différente, une piste explorée par plusieurs équipes travaillant sur des VLA généralistes. Les résultats restent pour l'instant limités à des benchmarks internes: rien n'indique encore une validation en déploiement réel, ni si le code ou le jeu de données mineur seront rendus publics.

RechercheActu
1 source