Aller au contenu principal
RecherchearXiv cs.RO 

Continuer, abandonner ou tomber : sélection de politique tenant compte de la viabilité (VAPS) pour l'acrobatie humanoïde sûre

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent VAPS (Viability-Aware Policy Selection), un cadre de sécurité pour les mouvements acrobatiques de robots humanoïdes, comme les flips, où une erreur de politique, une perturbation ou un écart sim-to-real peut endommager le matériel. Le problème de départ est simple: une politique de suivi de mouvement n'offre aucune issue une fois que le robot s'écarte de sa trajectoire de référence. Les auteurs entraînent donc, en plus d'une politique de chute protectrice, une politique d'abandon capable d'interrompre le mouvement à tout instant et de réceptionner le robot sur ses pieds. À chaque pas de contrôle, des prédicteurs appris estiment si la politique nominale de suivi et la politique d'abandon restent viables sur un horizon court. Une hiérarchie dite « du moindre sacrifice » conserve alors le comportement le plus ambitieux encore viable: continuer, abandonner ou tomber.

En simulation, avec des perturbations aléatoires, VAPS réduit nettement les contacts de la tête et des mains, principales sources de dommages matériels. Les tests couvrent deux plateformes, l'Unitree G1 et le LimX Oli. Sur l'Oli, les prédicteurs de viabilité et le contrôleur complet ont été validés pour des flips latéraux. Les auteurs indiquent que VAPS domine au sens de Pareto les meilleures alternatives à réseau unique qu'ils ont pu entraîner, dont une politique de suivi sûr de bout en bout et des politiques élèves distillées à partir des décisions de leur propre oracle de routage, à la fois sur le succès de la tâche et sur l'impact à la tête. Le cadre sert aussi à superviser des politiques sous-entraînées. Le résumé ne donne aucun chiffre précis de réduction des contacts, de taux de succès ou de nombre d'essais sur matériel réel, et la validation sur l'Oli semble limitée au flip latéral.

L'intérêt pour l'industrie tient à un angle souvent absent des démonstrations: le coût de l'échec. Les vidéos d'acrobaties humanoïdes montrent les réussites, rarement les chutes qui détruisent un poignet ou un capteur de tête. Une couche de supervision qui décide à chaque instant s'il faut poursuivre, se rattraper ou amortir la chute est une condition pour répéter ces mouvements sur des machines coûteuses, et plus largement pour déployer des humanoïdes dans des environnements où l'écart entre simulation et réalité ne disparaît pas. Le résultat suggère aussi qu'un routage explicite entre politiques spécialisées bat les politiques monolithiques, même distillées, ce qui nuance l'idée d'un réseau unique capable de tout gérer.

Ce travail s'inscrit dans la vague de politiques de suivi de mouvement pour humanoïdes, qui ont rendu les flips et autres mouvements dynamiques courants en recherche, et dans une littérature sur la chute sûre et la récupération. Il s'agit d'un preprint arXiv (v1), non évalué par les pairs, validé principalement en simulation. L'usage de l'Oli de LimX, aux côtés du G1 d'Unitree, reflète la diffusion de ces plateformes dans les laboratoires. La suite logique serait une validation matérielle plus large, sur davantage de mouvements et avec des statistiques d'essais, avant toute intégration dans des produits commerciaux.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

MAVP : politiques visuomotrices tenant compte de la carte pour la manipulation mobile
1arXiv cs.RO 

MAVP : politiques visuomotrices tenant compte de la carte pour la manipulation mobile

Un travail de recherche en robotique publié sur arXiv le 23 septembre 2026 sous la référence 2609.26378v1 présente MAVP (Map-Aware Visuomotor Policies), un framework destiné à fiabiliser l'exécution des robots à manipulation mobile, c'est-à-dire combinant base roulante et bras articulé. Le constat de départ : les politiques entraînées par démonstration peinent souvent à reproduire fidèlement le déplacement de la base, ce qui provoque un désalignement spatial et fait échouer la manipulation qui suit. MAVP reconstruit une carte statique à partir de démonstrations téléopérées, exprime les trajectoires de base démontrées dans ce référentiel cartographique commun, puis, à l'exécution, prédit conjointement des poses cibles de base, des actions du bras et de la pince à partir d'images RGB, de l'état des articulations et de la pose courante du robot sur la carte. Un contrôleur de bas niveau suit ensuite ces cibles par anticipation de mouvement et retour d'erreur de pose, avec un bruit ajouté sur la pose pendant l'entraînement pour renforcer la robustesse. Sur six tâches de manipulation réelles et trois familles de politiques testées, MAVP obtient un taux de succès supérieur au contrôle de vitesse "non ancré" dans l'ensemble des cas, sans que le résumé ne publie de chiffres agrégés précis. Le résultat cible un point de friction bien identifié dans l'apprentissage par imitation appliqué à la manipulation mobile : le contrôle de vitesse pur de la base dérive avec le temps et casse la coordination entre déplacement et geste de préhension, un problème qui freine aujourd'hui le passage des démonstrations de laboratoire à des déploiements fiables en usine ou en entrepôt. En ancrant explicitement chaque politique à une carte et à une pose absolue plutôt qu'à une commande de vitesse relative, MAVP s'attaque directement à l'écart documenté entre démonstrations réussies et exécution robuste en conditions réelles, un enjeu central pour les intégrateurs qui évaluent des politiques génératives type VLA pour des robots mobiles manipulateurs ou des humanoïdes à base roulante. Pour les décideurs B2B, l'apport n'est pas un nouveau modèle de fondation mais une brique de contrôle complémentaire, validée sur trois familles de politiques différentes, ce qui suggère une méthode transposable plutôt qu'une solution propriétaire liée à un seul modèle. Le travail s'inscrit dans la lignée des recherches académiques cherchant à corriger les limites du contrôle de vitesse non ancré, pratique héritée de la robotique mobile classique et transposée telle quelle aux politiques d'apprentissage par imitation. Le site dédié au projet, hébergé sous une adresse GitHub Pages anonymisée, suggère un papier soumis en évaluation en double aveugle à une conférence de robotique ou d'apprentissage automatique, sans que les auteurs ni leur affiliation ne soient révélés à ce stade : il s'agit donc d'une contribution de recherche et non d'un produit commercial. Aucun acteur français ou européen n'apparaît dans ces travaux. Les auteurs annoncent la mise à disposition de vidéos et de résultats complémentaires en ligne, mais ne communiquent ni feuille de route produit ni partenariat industriel ; la suite logique, en cas d'acceptation, sera l'extension de la méthode à davantage de tâches et de plateformes pour confirmer sa généralité au-delà des six cas testés.

RecherchePaper
1 source
Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde
2arXiv cs.RO 

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde

Des chercheurs publient Uni-VLaT, une méthode qui greffe un sens du toucher distribué sur tout le corps à des politiques VLA (vision-langage-action) préentraînées pour piloter un humanoïde en loco-manipulation. Le principe est d'ajouter une voie tactile dont l'état latent n'est pas seulement entraîné à produire des actions, mais aussi à prédire les représentations tactiles, proprioceptives et visuelles futures. Ce second objectif construit un contexte multimodal ancré dans le tactile. Les auteurs testent le système sur cinq tâches réelles : locomotion déclenchée par le toucher, interaction physique prolongée, contact avec un humain et loco-manipulation. Le taux de réussite moyen atteint 75 %, soit 43 points de plus qu'une base sans entrée tactile et 7 points de plus qu'une base tactile sans supervision prédictive. Sur deux architectures VLA préentraînées, le balayage de table gagne 30 points sur chacune, et la tâche « Back-Tap Walking » (marcher en réponse à une tape dans le dos) progresse de 85 à 90 points. Les ablations indiquent que la prédiction tactile contextualisée et les cibles futures absolues sont déterminantes. L'enjeu est de combler un angle mort des VLA actuels, qui reposent sur la vision et la proprioception. Quand la zone de contact est masquée, par exemple un bras qui frotte une surface ou une main humaine posée sur le dos, ces deux signaux ne suffisent pas à caractériser l'interaction. Contrairement aux capteurs de force ou de couple placés en quelques points prédéfinis, une peau tactile distribuée conserve la cartographie spatiale du contact sur tout le corps. Le résultat le plus parlant pour un intégrateur est la distinction entre simple ajout d'un capteur et apprentissage prédictif : la modalité brute apporte 36 points sur les 43 gagnés, mais la supervision prédictive rend la fusion plus robuste. Cela suggère que les politiques généralistes peuvent être étendues à de nouvelles modalités sans repartir de zéro, un point utile pour la cobotique humanoïde en contact avec des opérateurs. Les limites sont nettes : cinq tâches seulement, un robot de laboratoire, aucun chiffre sur les temps de cycle, la robustesse à long terme ou la durabilité des capteurs. Ce n'est ni un produit ni un déploiement. Ce travail s'inscrit dans la montée en puissance des modèles VLA pour humanoïdes, dont Pi-0, GR00T ou Helix, pour l'essentiel centrés sur la vision, le langage et la proprioception. Le tactile reste le parent pauvre de ces architectures, freiné par le coût, la fragilité et le câblage des peaux électroniques. La question d'une sensibilité corps entier concerne aussi des acteurs européens comme Wandercraft ou Enchanted Tools, dont les robots opèrent près des humains, même si l'article ne cite aucun partenaire industriel. Les prochaines étapes probables sont une validation sur davantage de plateformes et de capteurs, puis une comparaison avec des approches de contrôle en force, avant tout transfert industriel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Exploration des espaces de préhension robotique tenant compte de la connectivité
3arXiv cs.RO 

Exploration des espaces de préhension robotique tenant compte de la connectivité

Des chercheurs publient sur arXiv (arXiv:2609.22983v1, prépublication non encore évaluée par les pairs) une étude sur la structure spatiale des prises robotiques réussies dans l'espace SE(3), c'est-à-dire l'ensemble à six degrés de liberté des positions et orientations possibles d'un préhenseur. Plutôt que de traiter chaque pose de saisie comme un problème binaire isolé (valide ou non), les auteurs s'intéressent à la façon dont les prises réussies s'organisent entre elles au sein de cet espace. En exploitant un jeu de données de saisie à grande échelle, ils montrent que les ensembles de prises valides forment, pour un objet donné, une structure de connectivité hétérogène mais reproductible d'un objet à l'autre. Ils introduisent ensuite une stratégie d'échantillonnage dite « connectivity-aware », qui explore de façon incrémentale l'espace de prise observé en priorisant quatre types de candidats : les ponts potentiels entre composantes déconnectées, les frontières structurelles, les extensions de bordure et la nouveauté géométrique. Dans des expériences de reconstruction contrôlées, cette méthode retrouve la topologie des ensembles de prises réussies nettement plus vite que les deux références standard du domaine, l'échantillonnage aléatoire et le farthest-point sampling. Pour l'industrie de la manipulation robotique, bin-picking, pick-and-place industriel, l'enjeu est la réduction du nombre d'essais physiques ou simulés nécessaires pour cartographier les prises viables d'un nouvel objet, un poste de coût récurrent pour les intégrateurs. Les auteurs testent aussi si la structure de connectivité apprise sous viabilité partiellement masquée accélère la découverte de nouvelles prises, et si l'expérience structurelle acquise sur des objets déjà explorés se transfère à des objets inédits, une piste pertinente pour généraliser sans réentraîner à chaque nouvelle référence produit. Il s'agit toutefois de résultats de recherche en environnement contrôlé, pas d'un système déployé en usine. Ce travail s'inscrit dans la lignée des détecteurs de prise par apprentissage et des planificateurs par échantillonnage, qui évaluent traditionnellement des poses candidates indépendamment les unes des autres sans modéliser leur organisation géométrique collective. En pointant une structure exploitable au-delà de la viabilité individuelle de chaque pose, l'étude ouvre la voie à des méthodes d'exploration sensibles à la géométrie de l'espace d'action, avec des travaux futurs attendus sur le passage à des objets réels et des scènes de manipulation plus complexes.

RecherchePaper
1 source
HuGo : des LLM comme concepteurs de code de politique corps entier pour la loco-manipulation humanoïde
4arXiv cs.RO 

HuGo : des LLM comme concepteurs de code de politique corps entier pour la loco-manipulation humanoïde

Le laboratoire ICON Lab, associé à Negar Mehr et présenté sur iconlab.negarmehr.com, publie sur arXiv (2609.30594) une méthode nommée HuGo, pour Humanoid policy code Generation. Un grand modèle de langage y génère, à partir d'une description de tâche, du code exécutable en boucle fermée qui pilote un humanoïde au-dessus d'une politique de contrôle corps entier bas niveau laissée figée. Ce code est ensuite affiné automatiquement grâce aux trajectoires numériques et à des images vidéo sélectionnées des essais, sans récompense ni démonstration spécifiques à la tâche. Sur cinq tâches de loco-manipulation simulées et deux politiques bas niveau, HuGo dépasse nettement une base d'apprentissage par renforcement et se rapproche d'une base fondée sur des démonstrations ; un transfert zero-shot vers du matériel réel est également rapporté, amélioré par la même boucle d'affinement appliquée aux essais réels, sans démonstration experte ni réentraînement. Ce travail cible un goulot d'étranglement connu de la robotique humanoïde : produire une politique de loco-manipulation par tâche exige aujourd'hui une ingénierie de récompense coûteuse ou la collecte de démonstrations suivie d'un entraînement dédié, deux voies difficiles à faire passer à l'échelle. En déplaçant la logique de tâche vers du code généré par un LLM plutôt que vers des poids appris, HuGo se positionne comme une alternative aux modèles vision-langage-action tels que Pi-0, GR00T N2 ou Helix, qui reposent sur de vastes jeux de démonstrations pour entraîner des politiques bout en bout. Si l'approche se confirme à plus grande échelle, elle ouvrirait une voie moins gourmande en données pour ajouter des tâches à un humanoïde déjà déployé, un enjeu que suivent de près les intégrateurs. Le périmètre testé, cinq tâches simulées, reste restreint et appelle vérification sur des benchmarks plus larges. Cette publication s'inscrit dans une lignée de recherches sur le contrôle hiérarchique, où une couche bas niveau entraînée une fois reste figée pendant qu'une couche supérieure générée par LLM pilote la tâche. Il s'agit pour l'instant d'un preprint arXiv classé comme nouvelle soumission, sans robot ni entreprise commerciale nommés ni pilote industriel annoncé. Les auteurs renvoient vers le site du projet, iconlab.negarmehr.com/HuGo, pour les démonstrations, sans calendrier pour une extension à davantage de tâches ou de plateformes.

RecherchePaper
1 source