Aller au contenu principal
Accrochez-vous : le calage environnemental conditionné par la tâche pour une manipulation humanoïde forcée
RecherchearXiv cs.RO 

Accrochez-vous : le calage environnemental conditionné par la tâche pour une manipulation humanoïde forcée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent, dans un preprint arXiv (2609.25486), la Supporting Hand Strategy (SHS), une méthode qui permet à un robot humanoïde de s'appuyer sur l'environnement avec une main pendant qu'il exerce une force avec l'autre. Le système combine deux politiques d'apprentissage par renforcement synchronisées, guidées par une configuration d'appui optimisée selon la tâche, sans données de mouvement humain ni planification de trajectoire corps entier en temps réel. Testé sur un Unitree G1, il atteint des forces de contact exploitables jusqu'à 60 newtons, contre 13,5 newtons au maximum sans appui environnemental, avec un suivi de force nettement amélioré par rapport à une configuration d'appui générique et non spécifique à la tâche. Les mêmes politiques se généralisent à d'autres zones de tâche sans réentraînement.

Ce résultat s'attaque à une limite connue des humanoïdes bipèdes : toute force exercée par un bras via un contact avec l'environnement peut déséquilibrer le robot, ce qui cantonne aujourd'hui les tâches dites forcées, comme visser, tirer, pousser ou actionner un outil, à des efforts légers. Multiplier par plus de quatre la force utilisable, sans recourir à de la téléopération humaine ni à une replanification complexe de la posture corps entier, ouvre une piste peu coûteuse pour rapprocher les humanoïdes de tâches industrielles réelles telles que l'assemblage ou la maintenance. Le résultat reste toutefois un test de laboratoire sur une seule plateforme et une tâche conditionnée : il documente un gain de capacité mesurable, pas un produit ni un déploiement.

La manipulation forcée demeure un angle mort de la course aux humanoïdes, largement concentrée jusqu'ici sur la locomotion et les démonstrations de préhension fine chez des acteurs comme Figure ou Tesla avec Optimus. Le choix du Unitree G1, plateforme chinoise abordable très utilisée en recherche académique, en fait un banc d'essai courant avant un éventuel transfert vers des humanoïdes industriels plus robustes. L'approche, fondée sur du renforcement synchronisé sans capture de mouvement humain, tranche avec les méthodes par téléopération ou imitation privilégiées ailleurs et alimente le débat sur la viabilité du sim-to-real pour le contrôle corps entier. Publié en preprint, le travail n'annonce ni pilote ni calendrier de déploiement ; sa prochaine étape logique serait une validation sur des tâches industrielles concrètes et sur d'autres plateformes humanoïdes.

Dans nos dossiers

À lire aussi

Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement
1arXiv cs.RO 

Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement

Un article de recherche publie sur arXiv (2609.21467v1) présente Distance-Conditioned Reference Recomposition (DCRR), une méthode pour entrainer des robots humanoïdes a la loco-manipulation d'objets a partir d'un seul clip de mouvement démontre. Les auteurs identifient un biais qu'ils nomment le "termination-versus-passage gap": une politique de suivi de mouvement entraînée sur une trajectoire fixe ne reproduit fidèlement que le point d'arrivée démontre, alors que la source visite déjà des positions intermédiaires de l'objet. DCRR déplace le segment de fin de démonstration vers ces états intermédiaires, les rejoue via un teacher de suivi fige, puis distille les résultats reetiquetes dans une politique sans référence. Sur quatre taches (porter, pousser au pied, pousser accroupi, trainer), DCRR-BC obtient une erreur moyenne normalisée de 0,15 contre 0,28 pour un clonage comportemental classique; un affinage par renforcement améliore ensuite la robustesse, confirmée sur robot physique. Cette contribution s'attaque a une limite connue des pipelines d'imitation pour humanoïdes: une politique apprise par retargeting d'un mouvement humain unique reproduit généralement une seule démonstration figée, sans capacité a viser une distance de transport arbitraire a l'inférence. Pour un intégrateur industriel, déposer une caisse a 30 centimètres ou a 1,20 mètre exigerait normalement autant de démonstrations que de distances cibles. En montrant qu'un clip source unique, recompose puis redistribue, suffit a produire un comportement conditionne par la distance, l'étude réduit le besoin de collecte de données, un goulot d'étranglement reconnu face aux approches VLA gourmandes en téléopération. Elle rappelle aussi que le transfert simulation-vers-réel reste teste, non acquis: les auteurs vérifient d'abord la robustesse en sim-to-sim avant le matériel. Il s'agit d'une publication de recherche (arXiv, catégorie "new"), sans robot ni entreprise identifies dans le résume: la méthode est validée en simulation puis sur du matériel générique, sans que la plateforme humanoïde soit précisée. Elle s'inscrit dans la lignée des travaux combinant retargeting de mouvement humain et apprentissage par renforcement pour la loco-manipulation, une famille distincte des modèles VLA comme Pi-0, GR00T N2 ou Helix, qui s'appuient sur de vastes corpus multi-taches plutôt que sur un clip unique. Aucun pilote industriel ni calendrier de déploiement n'est annonce: c'est un résultat méthodologique destine a de futures politiques de transport conditionne, pas un produit prêt a intégrer.

RecherchePaper
1 source
KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde
2arXiv cs.RO 

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde

Des chercheurs présentent KINO (arXiv:2609.18869v1), un framework hiérarchique pour la loco-manipulation de robots humanoïdes qui insère des « keyframes » de mouvement comme représentation intermédiaire entre un modèle vision-langage (VLM) chargé de la planification et un contrôleur par renforcement (RL) chargé de l'exécution corps entier. Chaque keyframe encode une pose cible pour l'ensemble du corps du robot et, si nécessaire, la pose de l'objet manipulé. À partir d'une instruction en langage naturel, d'observations de la scène et d'un retour d'exécution, le VLM sélectionne successivement des keyframes pertinentes dans une bibliothèque prédéfinie ; ces keyframes sont ensuite réajustées à la scène courante pour tenir compte de la position et des dimensions des objets, avant qu'une politique conditionnée par keyframe ne génère les actions articulaires. Les auteurs introduisent une stratégie d'échantillonnage de keyframes basée sur la saillance pour l'entraînement de la politique bas niveau, qui fait passer le taux de réussite de bout en bout de 44 % à 92 % lorsque le VLM ne fournit que des keyframes éparses. Le système a été évalué sur des tâches de prise, transport et dépose d'objets, en simulation et sur un humanoïde Unitree G1, avec manipulation à une et deux mains. Ce résultat s'inscrit dans un débat central du secteur robotique : comment relier des modèles vision-langage capables de raisonner sur des instructions abstraites à des contrôleurs bas niveau capables de produire des mouvements corps entier stables. Plutôt que de miser sur une architecture VLA (vision-language-action) de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, KINO mise sur une représentation intermédiaire discrète et interprétable, ce qui pourrait faciliter le débogage et le contrôle qualité pour des intégrateurs industriels tout en limitant la fréquence des appels au VLM, coûteux en calcul. Le saut de 44 % à 92 % de succès reste toutefois une mesure obtenue en conditions contrôlées de recherche, pas un chiffre de déploiement industriel, et mériterait d'être confirmé sur des tâches plus variées. Le travail s'inscrit dans la vague de recherches académiques cherchant à rendre les humanoïdes capables de manipulation généraliste sans réentraînement massif pour chaque nouvelle scène, un axe exploré en parallèle par les architectures VLA de Physical Intelligence, NVIDIA ou Figure. Le choix du Unitree G1, plateforme humanoïde accessible et déjà utilisée dans de nombreux laboratoires, en fait un banc d'essai plutôt qu'un produit fini : aucun partenariat industriel ni calendrier de commercialisation n'est mentionné dans l'article. Les auteurs indiquent que le système généralise à des emplacements de dépose non vus pendant l'entraînement, un point clé pour juger de sa robustesse au-delà des démonstrations sélectionnées, mais le nombre d'essais et les conditions exactes de ces tests de généralisation ne sont pas précisés.

RecherchePaper
1 source
ForceDelta-VLA : distiller les corrections d'action conditionnées par la force pour la manipulation à contact riche
3arXiv cs.RO 

ForceDelta-VLA : distiller les corrections d'action conditionnées par la force pour la manipulation à contact riche

Des chercheurs publient sur arXiv (2609.18242v1) ForceDelta-VLA, une méthode destinée à améliorer les politiques Vision-Language-Action (VLA) sensibles à la force pour la manipulation robotique en contact riche, comme l'insertion ou l'assemblage de pièces. Le problème de départ: les VLA actuels fusionnent mouvement de tâche et ajustement de contact en une seule prédiction, sans distinguer une action de référence réutilisable d'une correction. ForceDelta-VLA construit cette correction à partir des prédictions d'un modèle enseignant gelé, comparées en mode conditionné par la force et en mode agnostique, complétées par une correction de délai gérant le décalage de l'action de référence. La politique légère qui en résulte ajuste les actions via l'historique de force récent, sans régénérer de séquences complètes à chaque contact. Sur neuf tâches en bras unique et bimanuelles, le taux de réussite moyen atteint 82,2%, contre 54,4% pour la référence ForceVLA; le "Stage-1 Temporal Teacher" seul atteint 70,6%, et le système complet réduit la force de contact de crête d'environ 26% sur les deux plateformes testées. Ce résultat vise d'abord les chercheurs et intégrateurs travaillant sur la manipulation fine (insertion de connecteurs, assemblage, montage électronique), un point faible connu des VLA généralistes, plus à l'aise sur la préhension grossière que sur les tâches exigeant un retour de force précis. En découplant mouvement macro et correction de contact, ForceDelta-VLA évite de régénérer un chunk d'action complet à chaque micro-ajustement, ce qui allège le calcul et améliore la réactivité pour un déploiement industriel manipulant des pièces fragiles ou mal positionnées. La baisse de 26% du pic de force est aussi pertinente pour la sécurité du matériel et la durée de vie des effecteurs. Ces gains restent toutefois mesurés sur seulement neuf tâches en environnement de recherche, sans indication de déploiement industriel ni de plateforme commerciale nommée. ForceDelta-VLA se positionne comme une amélioration du système ForceVLA, pris comme référence de comparaison tout au long de l'article, et s'inscrit dans la lignée des modèles Vision-Language-Action, à l'image de Pi-0, GR00T N2 ou Helix, qui cherchent à généraliser la manipulation robotique à partir de démonstrations, la manipulation à contact riche restant un angle mort persistant de ces architectures. Publié sans affiliation industrielle citée, le travail ne mentionne ni entreprise ni date de déploiement: c'est une contribution méthodologique pour la communauté robotique, dont l'extension à davantage de tâches et de plateformes physiques serait la suite logique.

RechercheActu
1 source
ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier
4arXiv cs.RO 

ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier

Une équipe de recherche présente ULTRA, un framework unifié pour le contrôle autonome de la loco-manipulation du corps entier chez les humanoïdes, publié en version révisée sur arXiv (2603.03279v2). Le système combine un algorithme de retargeting neuronal guidé par la physique, qui transpose des captures de mouvement à grande échelle vers la morphologie du robot en préservant la plausibilité physique des contacts, et un contrôleur multimodal unique traitant références denses et consignes de tâches éparses, à partir d'un état précis ou d'une vision égocentrique bruitée. La méthode distille une politique de suivi universelle, compresse les compétences motrices dans un espace latent compact, puis l'affine par apprentissage par renforcement pour améliorer la robustesse hors distribution. ULTRA a été validé en simulation et sur un robot humanoïde réel Unitree G1. L'apport central est de faire passer le contrôle humanoïde du suivi de trajectoires prédéfinies à une génération de comportement pilotée par la perception et des objectifs de haut niveau, sans référence de mouvement au moment du test, un verrou connu du secteur qui tient à la rareté des données de retargeting et à la couverture limitée des répertoires de compétences. En obtenant un comportement coordonné du corps entier à partir d'une intention éparse et d'une perception embarquée seule, sur matériel réel et pas seulement en simulation, les auteurs apportent un élément factuel au débat sur l'écart entre démonstrations scriptées et autonomie réelle, avec des résultats supérieurs aux méthodes de suivi pur à répertoire limité, un signal utile pour intégrateurs et laboratoires. Ce travail s'inscrit dans la lignée des contrôleurs de suivi par imitation pour humanoïdes, dont les limites sont pointées par les auteurs: données retargetées rares, difficulté à passer à l'échelle, dépendance à des références figées. ULTRA cherche à lever ce verrou en unifiant imitation à grande échelle et apprentissage par renforcement dans un seul contrôleur, validé sur Unitree G1, plateforme de recherche courante dans les laboratoires travaillant sur la loco-manipulation humanoïde. L'article ne précise ni affiliation institutionnelle ni calendrier de déploiement industriel: il s'agit d'une contribution de recherche, à comparer aux prochaines générations de contrôleurs généralistes pour humanoïdes plutôt qu'à un produit commercial.

RecherchePaper
1 source