Aller au contenu principal
Commande barrière progressive par apprentissage pour bras manipulateurs dont les erreurs initiales dépassent les bornes de suivi prescrites
RecherchearXiv cs.RO 

Commande barrière progressive par apprentissage pour bras manipulateurs dont les erreurs initiales dépassent les bornes de suivi prescrites

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un contrôleur à barrière progressive pour bras manipulateurs capable de démarrer une tâche avec une erreur de suivi supérieure à la tolérance imposée. Publiée sur arXiv (2503.14669, version 2), la méthode contracte graduellement la borne d'erreur initiale jusqu'à la valeur requise, dans un temps prescrit. Le robot peut donc commencer en dehors de la borne finale, que l'erreur directe de position articulaire respecte une fois la transition achevée. La loi de commande, en forme fermée, associe un retour à barrière progressive et un terme de couple adaptatif en ligne, fondé sur une structure acteur-critique. Une analyse de Lyapunov établit la bornitude des signaux en boucle fermée et donne des conditions suffisantes pour respecter la borne finale. Les simulations portent sur un bras à deux axes, avec grandes erreurs initiales, saturation des actionneurs, variations dynamiques, perturbations et erreurs de mesure. Le terme adaptatif réduit de 45,1 % l'erreur quadratique moyenne médiane par rapport au même contrôleur sans adaptation (poids nuls). Les auteurs cartographient aussi les erreurs initiales acceptables selon le temps de transition, à limites de couple fixées. Un essai sur un Niryo Ned3 Pro, avec positions mesurées et courants moteur, illustre le suivi.

Pour les intégrateurs, le point utile est pratique. Les contrôleurs à barrière classiques (contraintes de type barrier Lyapunov) supposent que l'erreur initiale est déjà dans la tolérance. C'est souvent faux en production, après un arrêt d'urgence, un changement d'outil, une reprise de tâche ou un recalage imparfait. Ce travail traite cette limite de façon explicite et chiffre le compromis entre durée de transition et erreur initiale absorbable sous couples bornés. Cette cartographie est exploitable pour dimensionner un démarrage sûr. La portée reste limitée, car les résultats viennent surtout d'un modèle à deux axes en simulation et d'une seule expérience qualitative sur un bras éducatif. Rien n'indique de test sur un manipulateur industriel à six axes ou sept axes, ni de comparaison avec des commandes déjà déployées. La réduction de 45,1 % est un gain relatif face à une variante du même contrôleur, pas face à un état de l'art industriel.

Ce travail prolonge la ligne des commandes à contraintes de sortie, issues des fonctions de barrière de Lyapunov et du contrôle à performance prescrite, que les adaptations par réseaux de neurones ou apprentissage par renforcement ont ensuite enrichies. Il se distingue des politiques apprises de bout en bout (VLA comme Pi-0 ou GR00T N2), qui ne fournissent pas de garantie formelle de suivi. Ici, la garantie vient de la couche de commande bas niveau. La suite logique serait une validation sur bras industriels à plus grand nombre de degrés de liberté. Les auteurs n'annoncent ni pilote ni calendrier. La version 2 porte la mention « replace », ce qui indique une révision d'un texte déjà publié.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

DART : commande prédictive augmentée par apprentissage pour la manipulation bi-bras non préhensile
1arXiv cs.RO 

DART : commande prédictive augmentée par apprentissage pour la manipulation bi-bras non préhensile

Des chercheurs ont publié sur arXiv (référence 2604.17833) les travaux autour de DART, un framework bimanuel conçu pour la manipulation non préhensile d'objets posés sur un plateau. L'approche repose sur un contrôleur prédictif non linéaire (MPC) couplé à un contrôleur d'impédance par optimisation, permettant de déplacer des objets sur le plateau sans les saisir directement. Le système évalue trois stratégies de modélisation de la dynamique plateau-objet : un modèle analytique physique, un modèle par régression en ligne adaptatif en temps réel, et un modèle de dynamique entraîné par apprentissage par renforcement (RL), ce dernier offrant une meilleure généralisation sur des objets aux propriétés variées. Les évaluations ont été réalisées en simulation sur des objets de masses, géométries et coefficients de friction différents. Les auteurs revendiquent que DART constitue le premier framework dédié à ce type de tâche en configuration bimanuelle. L'intérêt technique de DART réside dans la comparaison rigoureuse des trois approches de modélisation sur des métriques concrètes : temps de stabilisation, erreur en régime permanent, effort de contrôle et généralisation. Ce benchmark interne est utile pour les équipes d'intégration robotique qui doivent choisir entre modèles physiques (précis mais rigides), adaptation en ligne (réactive mais computationnellement coûteuse) et RL (flexible mais plus difficile à certifier). L'association MPC et contrôleur d'impédance est une piste crédible pour la manipulation d'objets fragiles ou instables, un verrou important en robotique de service. Toutefois, la validation reste strictement en simulation : le passage au réel implique des défis de perception, de latence et de calibration que le papier ne traite pas encore. Ce travail s'inscrit dans un intérêt croissant pour la robotique de service en hôtellerie et restauration, où des acteurs comme Bear Robotics (Servi), Keenon Robotics ou encore Enchanted Tools (Miroki, développé en France) positionnent leurs plateformes sur des tâches de transport et de service en salle. Les approches dominantes jusqu'ici privilégient la navigation autonome avec préhension classique ; la manipulation non préhensile sur plateau reste peu explorée à l'échelle produit. La prochaine étape naturelle pour DART serait une validation sur plateforme physique, avec des bras commerciaux type Franka Research 3 ou Universal Robots, avant d'envisager une intégration dans un robot mobile de service.

UEEnchanted Tools (Miroki, France) est cité comme acteur du service robotique susceptible de bénéficier de ce type de manipulation non préhensile sur plateau, mais le travail reste en simulation sans transfert réel annoncé.

RecherchePaper
1 source
Apprentissage de la prise-et-dépose dynamique pour un manipulateur à pattes
2arXiv cs.RO 

Apprentissage de la prise-et-dépose dynamique pour un manipulateur à pattes

Des chercheurs ont publié le 21 mai 2026 sur arXiv (réf. 2605.15713) un framework d'apprentissage par renforcement hiérarchique permettant à un robot quadrupède équipé d'un bras à 6 degrés de liberté (6-DOF) d'effectuer des tâches de pick-and-place dynamiques avec des charges allant jusqu'à 2,3 kg en simulation et 1,3 kg en environnement réel. Le système intègre un module explicite d'estimation de masse qui adapte en temps réel le contrôle whole-body en fonction du poids de l'objet saisi. En simulation, le taux de succès atteint 86,05 %. Sur six scénarios réels combinant variations de taille, de masse et de hauteur de dépôt, le système affiche un taux de succès moyen de 73,3 % dans un espace de travail vertical allant du sol à des surfaces à 1,1 m de hauteur, avec un temps d'exécution moyen de 4,06 secondes par cycle. Ce résultat est notable pour deux raisons techniques. D'abord, le système exécute locomotion et manipulation en simultané, abandonnant l'approche séquentielle (se déplacer, s'arrêter, saisir) qui dominait les travaux antérieurs et limitait la cadence opérationnelle. Ensuite, le module d'estimation de masse compense dynamiquement les variations de charge, ce qui est un prérequis pour tout déploiement industriel réel où les objets ne sont pas homogènes. La chute de performance entre simulation et réel (de 86 % à 73 %) illustre que le sim-to-real gap n'est pas encore résolu, mais reste dans une plage acceptable pour des scénarios semi-contrôlés. Les charges manipulées restent modestes comparées aux bras industriels fixes, et les vidéos de démonstration sélectionnées ne couvrent pas de conditions adverses (surfaces glissantes, occlusions). Le robot quadrupède mobile doté d'un bras manipulateur est un segment en forte croissance, porté par des plateformes commerciales comme le Spot d'Boston Dynamics (avec son bras optionnel), l'ANYmal d'ANYbotics, ou le B2 d'Unitree couplé à des bras tiers. Ce travail de recherche, non affilié à un produit commercial annoncé, s'inscrit dans la lignée des travaux sur les manipulateurs mobiles à pattes publiés ces deux dernières années par ETH Zurich, CMU et des équipes chinoises. La prochaine étape attendue dans ce domaine est la généralisation à des objets non rigides ou à géométrie inconnue, ainsi qu'une intégration de la perception visuelle en boucle fermée pour réduire la dépendance aux modèles d'objet préenregistrés.

RecherchePaper
1 source
Pince à granulaire renforcée par support pour la préhension par apprentissage par renforcement avec des manipulateurs continuum
3arXiv cs.RO 

Pince à granulaire renforcée par support pour la préhension par apprentissage par renforcement avec des manipulateurs continuum

Un article publié le 25 septembre 2026 sur arXiv sous la référence 2609.29093 décrit un gripper à jamming granulaire renforcé par une structure de support, conçu spécifiquement pour les manipulateurs continuum, ces bras robotiques souples capables de se faufiler dans des espaces confinés. Le dispositif reste compliant tant que le jamming, durcissement obtenu par mise sous vide d'une membrane remplie de particules, n'est pas activé, puis transmet directement les efforts jusqu'à l'extrémité du bras une fois durci. Les auteurs ont testé matériaux de membrane, types de particules, taux de remplissage et structures de support internes, puis cartographié les limites de préhension selon le décalage de contact et la forme des objets. Ils ont assemblé un système complet associant manipulateur continuum, gripper, retour visuel, actionnement par câbles et contrôle pneumatique, puis déployé sur ce système réel un contrôleur d'atteinte entraîné par apprentissage par renforcement en simulation randomisée, pour une tâche de saisie et relâchement d'objets. Aucun chiffre de charge utile, de degrés de liberté ou de cadence n'est communiqué : c'est une démonstration de faisabilité en laboratoire, non un produit. L'enjeu dépasse l'exercice académique. Les manipulateurs continuum intéressent l'inspection en espace confiné et la chirurgie mini-invasive, mais leur souplesse génère hystérésis et déformations dépendantes de la charge qui compromettent le contact fiable avec des pinces rigides classiques. En rendant le gripper lui-même adaptatif, souple avant serrage puis rigide après, les auteurs déplacent une partie de la difficulté de modélisation et de contrôle de position vers la mécanique. C'est une illustration du principe d'intelligence incarnée : la structure physique compense les imperfections du positionnement plutôt que d'exiger un apprentissage capable de combler entièrement l'écart simulation-réel, une piste pour rendre les bras continuum exploitables sans précision submillimétrique. Les pinces à jamming granulaire ne sont pas nouvelles : popularisées au début des années 2010 par des travaux universitaires américains puis commercialisées sous le nom Versaball par Empire Robotics, elles sont connues pour saisir des objets de formes irrégulières sans planification fine. La nouveauté tient à l'adaptation de ce principe, via une structure de support interne, à l'extrémité d'un manipulateur continuum, couplée à un contrôle appris par renforcement plutôt que programmé. Soumis comme nouvel article arXiv, le travail n'a pas encore été relu par les pairs, ne cite aucune entreprise partenaire et ne fixe aucun calendrier de transfert produit.

RecherchePaper
1 source
RARM : modèle de récompenses de progression à seuil de confiance pour l'apprentissage par renforcement en manipulation
4arXiv cs.RO 

RARM : modèle de récompenses de progression à seuil de confiance pour l'apprentissage par renforcement en manipulation

Des chercheurs ont publié sur arXiv (réf. 2606.22027) RARM, pour Reference-Anchored Reward Model, une approche visant à résoudre un verrou central de l'apprentissage par renforcement (RL) en manipulation robotique : la conception des fonctions de récompense. La méthode repose sur un comparateur visuel léger qui, à partir d'une seule démonstration réussie, génère automatiquement un signal de récompense dense et progressif. RARM est pré-entraîné une unique fois sur des vidéos généralistes via un objectif de contraste temporel, sans données robot-spécifiques ni étiquetage manuel. Au déploiement, il compare des extraits de la tentative courante à des clips de référence et ne délivre une récompense que lorsque la correspondance dépasse un seuil de confiance (d'où l'appellation confidence-gated). Évalué sur 9 tâches de manipulation simulées issues des benchmarks LIBERO et MetaWorld ainsi que sur 4 tâches réelles, RARM obtient les meilleurs taux de succès globaux en entraînement RL, avec des gains particulièrement marqués sur des tâches longue durée comme le pliage de tissu. Le verrou qu'attaque RARM est fondamental : les récompenses éparses (succès/échec en fin de séquence) produisent un signal trop faible pour les tâches longues, tandis que les récompenses denses codées manuellement exigent une ingénierie fastidieuse et se généralisent mal d'une tâche à l'autre. Les approches de progression existantes souffraient d'un biais critique : elles attribuaient des récompenses élevées à des états visuellement plausibles mais physiquement incorrects, ce que la porte de confiance de RARM réduit directement. L'implication concrète pour les intégrateurs est qu'une seule vidéo de démonstration humaine suffit désormais à bootstrapper l'entraînement RL sur une nouvelle tâche, sans ré-ingénierie de la fonction de récompense. RARM se positionne en concurrence directe avec EUREKA (OpenAI, génération de récompenses via LLM) et les méthodes d'imitation inverse (IRL), dont il se distingue par sa légèreté et l'absence de données robot-spécifiques. Son objectif de généralisation le rapproche des ambitions des modèles VLA comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA). La publication reste un preprint arXiv, pas encore un produit ni un déploiement industriel ; les prochaines étapes attendues incluent une validation sur des plateformes hardware diversifiées et une intégration dans des pipelines de fine-tuning de modèles fondationnels robotiques.

RecherchePaper
1 source