Aller au contenu principal
RecherchearXiv cs.RO 

ReCo : locomotion cohérente avec la réponse de la politique grâce à une MPC adaptée, pour la manipulation par robots à pattes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv ReCo (Response-Consistent Locomotion), un cadre logiciel pour la manipulation continue sur robots à pattes, c'est-à-dire la tâche qui consiste à suivre précisément une trajectoire avec l'effecteur d'un bras pendant que la base continue de marcher. L'approche combine apprentissage par renforcement (RL) et commande prédictive (MPC). La politique apprise assure une locomotion robuste, tandis que le MPC coordonne la base et le bras pour compenser les erreurs de suivi. La contribution tient en deux briques. Un « response shaping » entraîne la politique à répondre aux commandes de façon cohérente et répétable malgré des dynamiques randomisées. Un modèle de réponse en boucle fermée, identifié ensuite, permet au MPC de planifier conjointement les commandes de locomotion et le mouvement du bras. Sur un benchmark en simulation, ReCo réduit l'erreur quadratique moyenne (RMSE) de position de 28,7 % et celle d'orientation de 27,4 % par rapport au meilleur point de comparaison pour chaque métrique. Des essais sur robot réel démontrent une manipulation continue embarquée, base et bras coordonnés. Le résumé ne précise ni la plateforme, ni la charge utile, ni les temps de cycle.

L'enjeu est un problème que connaissent bien les intégrateurs de robots mobiles manipulateurs. Le MPC ne peut compenser que le mouvement de base qu'il sait prédire. Or la réponse d'une politique RL à une commande de vitesse varie avec la phase de marche, les contacts et la charge portée. Cette variabilité rend la compensation imprécise précisément quand le robot transporte quelque chose ou marche sur un sol irrégulier. Rendre la réponse de la politique prévisible plutôt que la corriger après coup est une voie pragmatique pour rapprocher les politiques apprises des contrôleurs à modèle, sans renoncer à la robustesse du RL. Pour un décideur industriel, cela concerne la précision en conditions réelles, souvent le point faible des démonstrations de manipulation sur quadrupèdes. Les gains annoncés restent toutefois mesurés en simulation, face à des références choisies par les auteurs, et la validation matérielle semble qualitative. Il s'agit d'un résultat de recherche, sans produit ni déploiement associé.

Ces travaux s'inscrivent dans la lignée de la manipulation « loco-manipulation » sur quadrupèdes équipés d'un bras, où deux écoles s'opposent. L'une repose sur des politiques RL de bout en bout pour l'ensemble du corps. L'autre est hybride, avec un RL pour la marche et une optimisation pour le bras. ReCo se range dans la seconde. Elle vise à combler l'écart entre une politique de marche opaque et un planificateur qui a besoin d'un modèle fiable. La suite logique serait des essais sur d'autres plateformes, avec des charges variées et des tâches plus longues, ainsi qu'une comparaison avec des politiques de corps entier entraînées de bout en bout. Le texte n'annonce aucun calendrier de ce type.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

GeCCo : une politique généraliste conditionnée par le contact pour la loco-manipulation des robots à pattes
1arXiv cs.RO 

GeCCo : une politique généraliste conditionnée par le contact pour la loco-manipulation des robots à pattes

GeCCo, pour Generalist Contact-Conditioned Policy, est une politique de bas niveau entraînée par apprentissage par renforcement profond (DRL) capable de suivre des points de contact arbitraires sur un robot quadrupède, décrite dans un article arXiv (2509.17582v2, version révisée). Plutôt que d'apprendre une politique de bout en bout spécifique à chaque tâche, les auteurs proposent une architecture hiérarchique modulaire où cette unique politique de suivi de contacts sert d'interface entre un planificateur de haut niveau et le contrôle bas niveau du robot. Le système a été testé sur un large éventail de tâches de locomotion et de manipulation avec une seule politique généraliste : différentes allures, franchissement de terrains complexes comme des escaliers et des pentes, traversée de pierres de gué et de poutres étroites jamais vues à l'entraînement, ainsi que des interactions physiques comme appuyer sur un bouton ou pousser un tonneau. L'intérêt principal pour l'industrie robotique tient à la promesse de rompre avec le goulot d'étranglement classique du RL en locomotion quadrupède : la définition et l'ajustement itératifs de fonctions de récompense pour chaque nouvelle application, un processus chronophage qui limite le passage à l'échelle. En stabilisant l'exécution des contacts malgré l'incertitude dynamique et les erreurs de planification, GeCCo permet d'échanger ou de composer des planificateurs (codés à la main, appris ou basés sur de l'optimisation) sans réentraîner la couche de contrôle. Pour des intégrateurs cherchant à combiner locomotion et manipulation sur une même plateforme, cela suggère la possibilité de construire de nouveaux comportements en assemblant un planificateur spécifique à la tâche avec une politique pré-entraînée générique, plutôt qu'en repartant de zéro à chaque fois. L'article se positionne face aux méthodes dominantes de RL end-to-end en locomotion quadrupède, qu'il cherche explicitement à dépasser en généralité et en modularité. Aucune affiliation industrielle ni partenaire commercial n'est mentionné dans le résumé, ce qui situe ce travail comme une contribution de recherche plutôt qu'une annonce produit. Des démonstrations vidéo sont disponibles sur le site du projet, vassil-atn.github.io/gecco.github.io, mais l'article ne précise ni feuille de route de déploiement ni pilote industriel annoncé.

RecherchePaper
1 source
SegDiff : diffusion de trajectoires segmentées pour une manipulation robotique cohérente et adaptative
2arXiv cs.RO 

SegDiff : diffusion de trajectoires segmentées pour une manipulation robotique cohérente et adaptative

SegDiff, présenté dans un article déposé sur arXiv (2607.11027v1), est une nouvelle politique visuomotrice en boucle fermée pour l'apprentissage par imitation en robotique manipulation. La méthode découpe les démonstrations humaines en segments de mouvement délimités par des keyposes (poses clés), puis apprend à prédire la trajectoire continue reliant l'état courant à la prochaine keypose. Elle s'appuie sur des modèles de diffusion combinés à l'inversion DDIM pour introduire un mécanisme appelé Dynamic Temporal Ensembling, conçu pour répondre efficacement aux environnements dynamiques et lisser les discontinuités provoquées par un échantillonnage multi-modal incohérent. Les auteurs rapportent des gains de performance significatifs par rapport aux approches existantes, testés à la fois en simulation et sur des scénarios réels de manipulation robotique. L'enjeu technique visé est concret : les méthodes actuelles d'apprentissage par imitation doivent choisir entre deux limites. La prédiction continue à court horizon accumule des erreurs qui se propagent au fil de l'exécution et gère mal les distributions d'actions multi-modales (plusieurs façons valides d'atteindre un objectif). Les méthodes par keyposes évitent ce problème mais nécessitent un planificateur externe pour relier les points clés, ce qui casse le temps réel. SegDiff prétend combiner les deux avantages, hypothèse centrale pour l'industrie : produire une politique robotique capable de raisonner sur des horizons temporels longs tout en restant réactive et stable, sans dépendance à un module de planification séparé, un point clé pour les intégrateurs qui cherchent des politiques déployables directement sur du matériel. Le travail s'inscrit dans la lignée des politiques de diffusion appliquées à la robotique (type Diffusion Policy), déjà largement adoptées comme alternative aux transformeurs d'action classiques. Il ne s'agit pas ici d'un produit commercial ni d'un déploiement industriel : c'est un article de recherche fraîchement publié, sans affiliation industrielle mentionnée dans l'abstract, et ses résultats restent à confirmer par la communauté et par des essais indépendants avant toute reprise en conditions de production.

RecherchePaper
1 source
SABER : apprentissage d'une affordance sémantique par attention pour la locomotion des robots à pattes
3arXiv cs.RO 

SABER : apprentissage d'une affordance sémantique par attention pour la locomotion des robots à pattes

SABER, une politique d'apprentissage par renforcement sans planificateur, est présentée dans un article publié sur arXiv le 21 septembre 2026 (2609.21572). Elle ajoute à la géométrie du terrain, déjà exploitée par les politiques de locomotion perceptive, une couche de permission de contact sémantique : chaque cellule d'une carte terrain unifiée encode la géométrie 3D locale et un coût de contact. Son mécanisme central modifie la cross-attention par un biais sémantique signé et appris, pondéré selon ce coût et la distance au pied le plus proche, si bien qu'un obstacle n'influence l'attention que tant qu'il peut affecter le prochain appui. Testée en conditions réelles sur un robot quadrupède Unitree B2, en intérieur et extérieur, face à quatre classes d'obstacles sémantiques, la politique montre par ablation qu'un retrait du seul biais sémantique fait grimper les contacts interdits de 55%, sans dégrader le suivi de vitesse. Ce résultat cible un angle mort concret pour la robotique industrielle : une politique purement géométrique peut juger traversable un tuyau, une pelouse ou un carton fragile, alors qu'un contact à cet endroit peut endommager l'équipement, déstabiliser le robot ou mettre en danger le site. Pour les intégrateurs déployant des robots à pattes en usine ou en entrepôt, SABER comble une limite connue des politiques apprises : la géométrie seule ne garantit pas un comportement sûr autour d'objets sensibles. Son apport principal tient à l'absence de coût mesurable sur le suivi de trajectoire, ce qui contredit l'hypothèse répandue selon laquelle des règles de sécurité supplémentaires dégraderaient nécessairement l'agilité. Cela confirme aussi que les mécanismes d'attention, déjà centraux dans les modèles vision-langage-action, peuvent structurer des politiques bas niveau pour la locomotion. SABER prolonge une recherche sur la locomotion perceptive qui a surtout intégré la géométrie du terrain, sans traiter systématiquement le sens des surfaces. Contrairement aux approches à planificateur explicite, elle reste une politique bout-en-bout entraînée directement par renforcement. Le choix du Unitree B2, quadrupède très utilisé en recherche académique, situe ce travail comme une validation scientifique sim-to-real, sans partenaire industriel ni pilote annoncé, les suites possibles visant d'autres morphologies, davantage de classes sémantiques, ou une intégration à des piles combinant perception, navigation et manipulation.

RecherchePaper
1 source
Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
4arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source