Aller au contenu principal
RecherchearXiv cs.RO 

HIGenNTO : génération évolutive d'interactions humanoïdes par optimisation de trajectoire dans l'espace de bruit

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent HIGenNTO (Humanoid Interaction Generation via Noise-space Trajectory Optimization), décrit dans un article publié sur arXiv le 22 septembre 2026 (arXiv:2609.22611v1). Le framework s'attaque à un problème concret de l'apprentissage par imitation chez les robots humanoïdes : les références de mouvement issues de capture de mouvement (motion capture) se dégradent en cas d'occlusion ou de contact physique rapproché, et le retargeting vers un squelette robotique introduit des incohérences géométriques et de contact. La méthode optimise le bruit initial d'un modèle de mouvement pré-entraîné et conditionné par texte, sous des contraintes spatio-temporelles et de scène éparses, afin de générer des trajectoires d'interaction humanoïde-scène qui respectent les contacts souhaités, évitent les collisions et conservent un appui stable, tout en préservant le réalisme du modèle de base. Ces mouvements, générés depuis zéro ou composés en séquences longues par étapes, sont ensuite exécutés par des politiques de suivi en simulation, puis utilisés pour entraîner des politiques visuomotrices conditionnées par la profondeur, fonctionnant uniquement avec les capteurs embarqués. L'équipe a déployé ces politiques sur un robot Unitree G1 pour quatre tâches riches en contacts, parmi huit tâches évaluées au total, dont trois ont été proposées et compilées (prompts, contraintes, scènes) par un agent de codage autonome.

L'intérêt principal tient au contournement d'un goulot d'étranglement connu du secteur : la difficulté d'obtenir des données de démonstration fiables pour des interactions physiques complexes (s'asseoir, pousser, manipuler un objet), sans dépendre de capture de mouvement humaine coûteuse et imparfaite. Le recours à un agent de codage pour générer automatiquement des spécifications de tâches ouvre une piste de mise à l'échelle des pipelines de données, un enjeu central pour les laboratoires qui développent des modèles VLA comme Pi-0, GR00T N2 ou Helix. Il faut toutefois noter l'échelle limitée de la démonstration, huit tâches seulement, dont quatre validées sur robot réel, ce qui en fait une preuve de concept académique plutôt qu'un système prêt pour un déploiement industriel.

Le choix du Unitree G1, plateforme largement utilisée en recherche académique pour son coût accessible, situe ce travail dans la lignée des efforts combinant modèles génératifs de mouvement et politiques d'exécution par simulation, sans acteur commercial ni implication d'un intégrateur français ou européen. Aucun calendrier de pilote industriel n'est annoncé, le travail restant à ce stade cantonné à la validation en laboratoire et à l'extension future du nombre de tâches couvertes.

À lire aussi

Pilotage sûr et en temps réel des politiques par optimisation de trajectoire dans l'espace du bruit pour des politiques génératives en une étape
1arXiv cs.RO 

Pilotage sûr et en temps réel des politiques par optimisation de trajectoire dans l'espace du bruit pour des politiques génératives en une étape

Une publication déposée sur arXiv (référence 2609.21220, catégorie "new") présente INSPO, une méthode pour piloter en temps réel des politiques robotiques génératives sans les réentraîner. Le problème visé est le suivant : les politiques préentraînées de type diffusion ou flow matching génèrent des comportements variés et multimodaux, mais restent difficiles à adapter aux contraintes imposées au moment du déploiement, comme l'évitement de collision ou le maintien d'une orientation donnée, sans repasser par un guidage par gradient coûteux appliqué tout au long d'un processus itératif, trop lent pour du contrôle temps réel. INSPO reformule le problème comme une optimisation de trajectoire dans l'espace du bruit d'entrée de la politique : au lieu de modifier directement les actions générées, l'algorithme optimise le bruit injecté en évaluant les contraintes sur la trajectoire d'état qui en résulte, avec un terme de régularisation qui garde la solution proche de la distribution d'entrée native du modèle, le tout résolu en ligne par optimisation par essaim de particules. Les auteurs testent la méthode sur des politiques spécifiques à une tâche, à base d'état ou d'image, et sur des politiques généralistes vision-langage-action, avec trois bancs d'essai simulés : Push-T, la préhension-dépose de boîtes de conserve (Can pick-and-place) et LIBERO-Spatial. Pour l'industrie robotique, ce travail cible un verrou concret : les politiques génératives promettent plus de diversité comportementale que les politiques déterministes classiques, mais leur nature stochastique complique la garantie de contraintes de sécurité strictes une fois déployées sur un bras ou un robot mobile réel. Jusqu'ici, imposer ces contraintes passait soit par un rejet coûteux d'échantillons (best-of-N sampling), soit par une projection a posteriori des actions générées, soit par un guidage par gradient trop lent pour le temps réel. INSPO affiche de meilleurs taux de réussite et de respect des contraintes que les deux premières approches, tout en égalant le guidage par gradient avec un temps d'exécution plus faible, ce qui, si cela se confirme sur du matériel physique, réduirait un frein réel à l'usage industriel des politiques VLA génériques du type Pi-0 ou GR00T, où la sécurité à l'inférence limite encore la commercialisation au-delà des démonstrations. Ce travail s'inscrit dans la vague des politiques robotiques fondées sur la diffusion ou le flow matching, et plus particulièrement dans le virage récent vers des politiques génératives "en une étape", plus rapides à échantillonner que les processus itératifs classiques mais qui rendent obsolètes certaines méthodes de guidage par gradient conçues pour ces derniers. À ce stade, INSPO n'a été validé que sur des bancs d'essai simulés standards de la littérature, sans démonstration sur robot physique ni comparaison avec un système commercial : il s'agit d'une contribution méthodologique amont plutôt que d'un produit ou d'un déploiement annoncé. Aucun acteur français ou européen n'apparaît dans cette publication.

RecherchePaper
1 source
Traj-VLN : apprentissage de l'interaction dans l'espace des pixels par génération autorégressive de trajectoire
2arXiv cs.RO 

Traj-VLN : apprentissage de l'interaction dans l'espace des pixels par génération autorégressive de trajectoire

Des chercheurs présentent Traj-VLN, une méthode publiée en prépublication sur arXiv (référence 2607.10744) pour la navigation vision-langage en environnements continus (VLN-CE), où un agent embarqué doit se déplacer dans un lieu inconnu en suivant des instructions en langage naturel du type « marche jusqu'au bout du canapé et tourne à gauche ». Plutôt que d'injecter des données de profondeur ou une géométrie 3D explicite dans le modèle vision-langage (VLM), les auteurs proposent de faire apprendre directement au VLM, par fine-tuning, à générer une trajectoire dans l'espace des pixels de l'image 2D, de façon autorégressive : à partir de l'instruction et de l'historique d'observations, le modèle prédit une séquence de coordonnées de pixels formant un chemin depuis le centre bas de l'image courante. Les auteurs indiquent que cette supervision par trajectoire en pixels, dont un signal proche (le pixel-goal) avait déjà montré sa supériorité sur l'apprentissage d'actions discrètes dans des travaux antérieurs, améliore sensiblement les performances de navigation, et que leur modèle principal atteint un niveau état de l'art avec des ressources de calcul et un volume de données d'entraînement relativement limités. L'intérêt dépasse l'exercice académique : la navigation vision-langage en continu reste un verrou central pour tout robot mobile ou humanoïde censé exécuter des instructions naturelles dans un environnement non cartographié au préalable, un scénario clé pour la logistique d'entrepôt, l'assistance domestique ou l'inspection industrielle. Le choix de contourner la profondeur et la géométrie 3D est significatif : les VLM généralistes sont entraînés quasi exclusivement sur des conversations autour d'images RGB, et leur faire ingérer des cartes de profondeur ou des nuages de points exige d'ordinaire des architectures spécialisées ou des données rares. En reformulant le problème comme une génération de trajectoire en pixels, modalité que ces modèles maîtrisent déjà nativement, Traj-VLN illustre une tendance de fond du secteur : réutiliser les priors des VLM plutôt que d'entraîner des chaînes de perception 3D dédiées, ce qui pourrait réduire le coût d'intégration pour les fabricants de robots mobiles autonomes (AMR) et les intégrateurs cherchant à connecter leurs plateformes à des VLM existants. Ce travail s'inscrit dans la lignée des approches vision-langage-action (VLA) qui, ces deux dernières années, cherchent à faire des sorties en pixels ou en points-objectifs une interface universelle entre perception et action, aussi bien pour la manipulation que pour la navigation. Le résumé du papier ne précise ni les benchmarks utilisés, ni les chiffres de performance exacts, ni la disponibilité du code ou des poids, ce qui invite à la prudence tant que ces éléments ne sont pas comparés indépendamment aux systèmes concurrents. Publié comme simple prépublication arXiv (catégorie « cross »), Traj-VLN n'est rattaché à aucun laboratoire nommé ni à un acteur français ou européen dans les informations disponibles ; la suite logique, comme pour la plupart des travaux VLN académiques, sera une évaluation sur des benchmarks standards du domaine (R2R, RxR ou équivalents en continu) et, potentiellement, un transfert au delà de la simulation vers des plateformes robotiques réelles.

RechercheOpinion
1 source
Robots humanoïdes : accélérer la génération de trajectoires par diffusion et distillation par cohérence
3arXiv cs.RO 

Robots humanoïdes : accélérer la génération de trajectoires par diffusion et distillation par cohérence

Une équipe de recherche propose un framework de planification de trajectoires contraintes pour bras manipulateurs en interaction homme-robot (HRI). Le point de départ : quand la pose de l'effecteur terminal est entièrement fixée, imposer en plus l'évitement de collisions et d'auto-collisions comme simple tâche secondaire dans l'espace nul devient difficile, ce qui complique la génération de trajectoires sûres. Les chercheurs génèrent d'abord, via les algorithmes RRT et RRT*, un jeu de données de trajectoires respectant ces contraintes, puis entraînent dessus un modèle de diffusion produisant des trajectoires articulaires par échantillonnage guidé. Une distillation de cohérence réduit ensuite le temps d'inférence, et un terme de régularisation du jerk pondéré par articulation est ajouté à la fonction de perte pour lisser les trajectoires. En simulation, le modèle de cohérence génère 150 candidats en moins de 100 millisecondes, avec un taux de réussite élevé, et la régularisation du jerk réduit nettement les à-coups articulaires et à l'effecteur terminal. Ce résultat vise un verrou concret pour les robots collaboratifs travaillant près d'humains : les planificateurs classiques par échantillonnage comme RRT sont trop lents pour du replanning temps réel, tandis que les modèles de diffusion, efficaces pour capturer des distributions de trajectoires contraintes, restent coûteux en inférence à cause du débruitage itératif. En ramenant la génération à quelques étapes sans perte visible de qualité, la distillation de cohérence rapproche les planificateurs appris de la latence exigée par un usage embarqué, un enjeu direct pour les intégrateurs de cobots industriels et les concepteurs de systèmes HRI, où la sécurité ne doit pas se payer en réactivité. Le travail s'inscrit dans la lignée des approches par diffusion appliquées à la planification de mouvement et à l'apprentissage par imitation en robotique, où la vitesse de génération reste le principal obstacle face aux contrôleurs classiques. Les modèles de cohérence, conçus à l'origine pour accélérer la génération d'images, sont ici transposés à la manipulation robotique pour contourner ce compromis vitesse-qualité. Les résultats restent toutefois cantonnés à la simulation : la validation sur bras robotique physique, avec perception humaine réelle, constitue l'étape logique suivante avant tout déploiement en environnement collaboratif.

RecherchePaper
1 source
Optimisation des arbres de trajectoires dans l'espace des croyances : de la commande prédictive à la planification de tâches et de mouvements
4arXiv cs.RO 

Optimisation des arbres de trajectoires dans l'espace des croyances : de la commande prédictive à la planification de tâches et de mouvements

Des chercheurs proposent, dans un preprint arXiv soumis début mai 2026 (arXiv:2605.01860), de planifier des trajectoires arborescentes (trajectory-trees) dans l'espace des croyances (belief space) plutôt que les trajectoires séquentielles classiques. Quand un robot évolue en environnement partiellement observable, la trajectoire optimale dépend d'observations futures encore inconnues: les trajectory-trees branchent à chaque point où l'état de croyance est susceptible de diverger en scénarios distincts. Le papier présente deux contributions: un contrôleur prédictif partiellement observable (PO-MPC) à branchement unique, optimisé par un algorithme parallélisé baptisé D-AuLa (Distributed Augmented Lagrangian) conçu pour satisfaire les contraintes temps-réel du MPC; et un planificateur tâche-et-mouvement (PO-LGP) combinant arbres de décision symboliques et trajectory-trees cinématiques, en étendant le cadre Logic-Geometric-Programming (LGP) aux problèmes partiellement observables. Les validations expérimentales portent sur la conduite autonome pour le MPC et des scénarios de manipulation robotique pour le TAMP. L'enjeu industriel est direct: les environnements réels sont rarement entièrement observables. Un bras triant des pièces dont l'orientation n'est connue qu'après préhension, ou un AGV naviguant en zone d'incertitude sensorielle, nécessitent précisément ce type de planification contingente. Les trajectoires séquentielles obligent le robot à choisir un plan unique à l'avance, ce qui se traduit par des comportements sous-optimaux ou des replanifications coûteuses. L'approche PO-MPC réduit les coûts de contrôle en anticipant les branches d'observation possibles; PO-LGP génère des politiques d'exploration utilisables comme macro-actions dans un plan global. D-AuLa répond à l'objection classique contre la planification en espace de croyance: sa complexité computationnelle prohibitive pour le temps-réel, en exploitant la décomposabilité du problème pour paralléliser l'optimisation. Le cadre LGP étendu par ces travaux a été développé par le groupe de Marc Toussaint (TU Berlin), et constitue l'une des approches TAMP les plus rigoureuses pour la manipulation multi-étapes. La planification en POMDP (Partially Observable Markov Decision Processes) est un domaine actif depuis les années 1990, mais son couplage avec le contrôle continu et la planification symbolique reste un défi ouvert. Des approches concurrentes basées sur l'apprentissage par renforcement (notamment les méthodes VLA et politiques diffusion) ou sur des planificateurs sampling-based adressent des problèmes voisins avec des compromis différents en matière de généralisation et de garanties formelles. Les auteurs reconnaissent eux-mêmes que la méthode est validée sur des belief states de taille restreinte et exclusivement en simulation; la prochaine étape naturelle est une validation hardware sur robots réels avec perception embarquée et latences de capteurs.

UELes travaux étendent le cadre LGP développé par le groupe de Marc Toussaint à TU Berlin, consolidant le leadership académique européen en planification tâche-et-mouvement rigoureuse pour la manipulation robotique multi-étapes.

RecherchePaper
1 source