Aller au contenu principal
PredActor : diffusion d'action prédictive pour un contrôle humanoïde embarqué et pilotable
RecherchearXiv cs.RO 

PredActor : diffusion d'action prédictive pour un contrôle humanoïde embarqué et pilotable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PredActor, une politique de diffusion d'action prédictive pour le contrôle embarqué d'humanoïdes, est détaillée dans une publication arXiv de septembre 2026 (2609.24840). À la différence des architectures hiérarchiques classiques, qui séparent trajectoire de référence et tracker de suivi, elle s'exécute seule, conditionnée sur l'historique proprioceptif et un contexte de tâche optionnel, sans état corporel complet mesuré en externe, et génère à la fois les actions et une trajectoire d'état futur interne, guidée par classifier-free guidance pour le texte et par guidage de classifieur pour les objectifs de test. En simulation, elle atteint les 15 cibles testées, avec un score de récupération de texte de 0,580 contre 0,373 pour une diffusion d'action classique, et une résistance aux perturbations comparable. Sur une carte Jetson Orin NX, le cycle de calcul tombe à 16,790 ms en médiane et 19,383 ms au 95e percentile, sous les 20 ms requis ; déployée sur un robot Unitree G1, elle a démontré mouvement piloté par texte, réaction aux perturbations, contrôle au joystick et interpolation sémantique.

Ce résultat répond à un point de friction du secteur : les politiques de diffusion pour humanoïdes fonctionnent bien hors ligne mais restent rarement pilotables en temps réel embarqué. En tenant le calcul sous les 20 ms sur du matériel edge accessible, sans tracker séparé ni perception externe de l'état corporel complet, PredActor allège la pile logicielle qu'un intégrateur doit maintenir et contredit l'idée qu'un pilotage sémantique par texte ou joystick exige une architecture hiérarchique lourde. Pour des décideurs industriels évaluant des humanoïdes pour des tâches réelles, la robustesse conservée malgré cette contrainte est encourageante, même si les métriques reposent sur un nombre limité de cibles et un score de récupération de texte propre au papier, peu comparable aux autres benchmarks du secteur.

PredActor s'inscrit dans la lignée des politiques de diffusion pour le contrôle robotique et des modèles vision-langage-action, aux côtés d'approches comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, dont il se distingue en évitant tout tracker de mouvement ou état privilégié externe. Classée comme nouvelle soumission sur arXiv, la publication ne précise ni laboratoire porteur ni entreprise associée et ne mentionne aucun calendrier de déploiement commercial : il s'agit d'un travail de recherche validé en simulation et sur un seul robot physique, sans pilote industriel annoncé.

À lire aussi

ADAPT : des amorces de diffusion agiles et pilotables pour un contrôle robuste d'humanoïdes en ligne, guidé par texte
1arXiv cs.RO 

ADAPT : des amorces de diffusion agiles et pilotables pour un contrôle robuste d'humanoïdes en ligne, guidé par texte

Un preprint publié sur arXiv (référence 2609.00677v1) décrit ADAPT (Agile Diffusion Action Priors), un framework de contrôle interactif du corps entier de robots humanoïdes piloté par texte. Contrairement aux pipelines texte-vers-mouvement dominants, qui génèrent une trajectoire suivie ensuite par un contrôleur séparé, ADAPT fonctionne en boucle fermée de bout en bout : le robot répond en continu aux commandes tout en gardant l'équilibre et des transitions fluides. Il apprend un prior d'action par diffusion à partir de trajectoires état-action annotées en texte, complété par une politique résiduelle d'apprentissage par renforcement entraînée sur le contrôleur gelé pour améliorer la robustesse entre consignes. L'abstract ne précise ni plateforme robotique testée, ni charge utile, degrés de liberté ou temps de cycle. L'intérêt tient à la fusion, en une seule boucle, de la génération de mouvement et de son exécution : les systèmes actuels séparent souvent un module texte-vers-mouvement d'un contrôleur bas niveau, ce qui crée latence et ruptures dès qu'une commande change. ADAPT vise des humanoïdes plus réactifs au langage naturel, un enjeu pour les intégrateurs voulant doter leurs robots d'interfaces conversationnelles en entrepôt ou en usine. Il suggère aussi que les priors d'action par diffusion combinés au renforcement, dans la lignée de travaux comme Pi-0 ou GR00T N2, forment une base viable pour du contrôle général, sans toutefois de déploiement physique ni de comparaison chiffrée démontrés : la contribution reste académique, non encore validée par relecture par les pairs. Ce travail s'inscrit dans la course menée par des laboratoires et entreprises comme Figure AI avec Helix, NVIDIA avec GR00T N2 ou Physical Intelligence avec Pi-0, pour doter les humanoïdes de piles vision-langage-action capables de suivre des instructions en langage naturel plutôt que des routines préprogrammées. Là où ces acteurs couplent souvent de grands modèles multimodaux à des primitives de mouvement, ADAPT propose des priors d'action par diffusion entraînés sur des données texte-état-action, complétés par du renforcement, comme alternative plus légère en boucle fermée. Aucun acteur français ou européen du secteur, comme Wandercraft ou Pollen, n'apparaît dans cette publication. Les suites attendues, non détaillées dans l'abstract, sont une réplication indépendante et une validation sur robot physique.

RechercheActu
1 source
Propriétés dynamiques et reproductibilité d'un torse humanoïde pneumatique compact pour le contrôle piloté par données
2arXiv cs.RO 

Propriétés dynamiques et reproductibilité d'un torse humanoïde pneumatique compact pour le contrôle piloté par données

Une équipe de recherche a publié sur arXiv (réf. 2603.14787v2) le développement d'un robot humanoïde compact à 13 degrés de liberté (DOF), actionné exclusivement par pneumatique et conçu pour l'interaction physique humain-robot (pHRI). Avant de concevoir un contrôleur global, les chercheurs ont d'abord caractérisé les propriétés dynamiques du système, notamment les délais d'actionnement, et confirmé que le comportement mécanique est hautement reproductible. S'appuyant sur cette reproductibilité, ils ont implémenté un contrôleur data-driven sur un sous-système de bras à 4 DOF, fondé sur un perceptron multicouche (MLP) avec compensation explicite des délais temporels. Le réseau a été entraîné sur des données de mouvements aléatoires pour apprendre à générer des commandes de pression capables de suivre des trajectoires arbitraires. Comparé à un régulateur PID classique sur les mêmes trajectoires, le contrôleur neuronal affiche une précision de suivi supérieure. La démonstration que des actionneurs pneumatiques à haut nombre de DOF peuvent être pilotés efficacement par apprentissage machine est un résultat concret. Les pneumatiques sont intrinsèquement non-linéaires : leur comportement dépend de la pression d'alimentation, de la température et des frictions internes, ce qui rend toute modélisation analytique coûteuse à construire et fragile en exploitation. En montrant que le système présente une reproductibilité suffisante pour être appris directement depuis les données, les chercheurs contournent ce problème sans passer par un modèle physique complet. Pour les intégrateurs et décideurs B2B qui évaluent des solutions de robotique collaborative, ce type d'approche pourrait accélérer le déploiement de systèmes pneumatiques dans des environnements de contact humain, où la compliance naturelle des actionneurs offre une sécurité passive que les moteurs électriques rigides ne peuvent pas égaler structurellement. La course aux humanoïdes est aujourd'hui dominée par des architectures électriques : Figure Robotics (Figure 02), Tesla (Optimus Gen 2) et Boston Dynamics (Atlas HD) misent toutes sur des moteurs à couple direct ou à réducteur harmonique. La pneumatique reste un axe de niche, exploré par des laboratoires académiques et des industriels comme l'allemand Festo pour ses propriétés de compliance et de sécurité intrinsèque. Le résumé arXiv ne précise pas l'affiliation institutionnelle des auteurs. L'étape naturelle suivante serait d'étendre le contrôleur MLP du bras à 4 DOF à l'ensemble des 13 DOF du torse complet, puis de valider en conditions d'interaction physique réelle. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé ; le travail reste au stade de la publication académique préliminaire.

RecherchePaper
1 source
VAIC : contrôle humanoïde agile d'interaction avec des objets par vision et commandes découplées
3arXiv cs.RO 

VAIC : contrôle humanoïde agile d'interaction avec des objets par vision et commandes découplées

Des chercheurs ont publié en juin 2026 sur arXiv (référence 2606.09286) VAIC, un cadre de contrôle unifié pour robots humanoïdes capable d'interagir avec des objets en milieu non structuré. La contribution principale est l'élimination de deux hypothèses restrictives qui limitent la transposition terrain des contrôleurs existants : les trajectoires de référence denses et l'observabilité complète de l'état. VAIC opère exclusivement à partir d'un flux de profondeur embarqué et de la proprioception historique, via une interface de commandes découplées composée de cibles de vitesse multi-axes et d'un indicateur d'interaction par segment corporel. L'apprentissage suit un paradigme de distillation en deux étapes : une politique "enseignant" privilégiée, entraînée avec accès complet à la cinématique des objets et à l'état environnemental exact, transfère ses compétences à une politique "étudiant" déployable qui reconstruit implicitement la dynamique des objets depuis le flux de profondeur brut via un module d'adaptation récurrent. Sur robot humanoïde (non nommé dans le preprint), cette politique unique exécute en conditions réelles trois familles de tâches dynamiques : transport de carton, interaction avec un chariot, et skateboard, surpassant selon les auteurs les approches baseline comparées. Ce résultat, s'il se confirme à plus grande échelle, adresse directement le "deployment gap" qui freine la commercialisation des humanoïdes : la quasi-totalité des démos publiques repose encore sur des systèmes de capture de mouvement externe ou sur des objets instrumentés avec tracking précis. Proposer une politique unique généraliste, sans trajectoires de référence et fonctionnant sur capteurs embarqués bas coût, réduirait significativement la friction d'intégration pour les opérateurs industriels et les intégrateurs robotiques. La distillation enseignant-étudiant avec module d'adaptation récurrent n'est pas une architecture inédite, mais son application à des tâches aussi hétérogènes sur un humanoïde réel constitue un pas mesurable vers la généralisation. À noter que le preprint ne fournit ni métriques de cycle time par tâche, ni taux de succès quantifiés, ni spécification du robot utilisé, ce qui limite l'évaluation indépendante des performances annoncées. Ce travail s'inscrit dans une course aux contrôleurs généralisés qui oppose des équipes académiques (Berkeley, CMU, ETH Zurich) aux acteurs commerciaux : Figure Robotics avec son pipeline VLA sur Figure 02/03, Physical Intelligence et sa politique Pi-0, 1X Technologies et Unitree, tous actifs simultanément sur le sim-to-real et les architectures polyvalentes. L'approche de VAIC, centrée sur la profondeur et la proprioception plutôt que sur les vision-language models à grande échelle, constitue un positionnement différenciant en termes de coût de calcul embarqué et de simplicité sensorielle. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé dans ce preprint : il s'agit à ce stade d'une démonstration de recherche, dont la validation sur plusieurs plateformes robotiques et environnements variés reste entièrement à mener.

RecherchePaper
1 source
D-SafeMPC : commande prédictive sûre par diffusion avec fonctions barrières de contrôle en temps discret
4arXiv cs.RO 

D-SafeMPC : commande prédictive sûre par diffusion avec fonctions barrières de contrôle en temps discret

Traduction et résumé en cours pour cet article de recherche sur D-SafeMPC. Des chercheurs présentent D-SafeMPC, une méthode qui combine modèles de diffusion et commande prédictive (MPC) pour générer des trajectoires robotiques à la fois sûres et faisables physiquement. Le problème de départ est connu : les modèles de diffusion, très utilisés en planification de mouvement, ne garantissent intrinsèquement ni la sécurité ni le respect des contraintes dynamiques, ce qui produit parfois des trajectoires irréalisables. Coupler diffusion et MPC existait déjà, mais l'approche restait instable, car une mauvaise initialisation de trajectoire par le modèle de diffusion empêchait le MPC de converger vers une solution correcte. D-SafeMPC guide le processus de diffusion inverse à l'aide de fonctions barrières de contrôle (CBF) et de fonctions de Lyapunov de contrôle (CLF), avec un schéma de projection itératif où le MPC affine la trajectoire à chaque étape de débruitage. Les tests ont porté sur un bras manipulateur Franka, en simulation sur quatre scénarios (un obstacle statique, trois configurations à obstacles dynamiques), puis en conditions réelles sur un robot Franka physique via une expérience de transfert sim-to-real. Le code source et les configurations expérimentales sont publiés sur GitHub (erdiphd/D-SafeMPC). L'intérêt de ces travaux dépasse le cas d'usage du bras manipulateur : ils s'attaquent directement à un point de friction connu entre planification générative et robotique déployable. Les modèles de diffusion produisent des trajectoires plausibles statistiquement, mais rien ne garantit qu'elles respectent les contraintes physiques d'un robot réel ou évitent des obstacles mobiles, un écart classique entre démonstration et fiabilité opérationnelle. En stabilisant l'interaction diffusion-MPC dès la phase de débruitage plutôt qu'en post-traitement, D-SafeMPC vise à fournir des points de démarrage fiables ("warm starts") au contrôleur, ce qui améliore selon les auteurs le taux de succès des tâches et l'efficacité de planification par rapport aux méthodes de référence de l'état de l'art. Pour les équipes travaillant sur la manipulation en environnement partagé avec des humains ou des obstacles mobiles, c'est un signal que les architectures hybrides génératif-contrôle progressent sur la sécurité formelle, un enjeu central pour toute certification industrielle. Ce travail s'inscrit dans une lignée de recherches cherchant à réconcilier planification par apprentissage profond et garanties de sécurité issues du contrôle classique, un axe actif depuis l'essor des politiques de diffusion en robotique (type Diffusion Policy). Les CBF et CLF sont des outils établis en commande sûre, mais leur intégration fine dans une boucle de diffusion itérative reste un domaine ouvert. La validation sim-to-real sur Franka, bras couramment utilisé en recherche académique, reste un test de complexité modérée comparé à des déploiements industriels ou humanoïdes ; la suite logique serait une extension à des plateformes à plus haute dimensionnalité ou à des tâches multi-obstacles plus denses.

RecherchePaper
1 source