Aller au contenu principal
RecherchearXiv cs.RO 

CoAd : planification à temps constant pour la manipulation continue d'objectifs avec bibliothèque compressée et adaptation en ligne

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le laboratoire elpis-lab a publié une version révisée de son article CoAd sur arXiv (arXiv:2603.12488). Le travail vise un cas fréquent en manipulation robotique : un robot qui résout à répétition des problèmes de planification ne différant que par la position de l'objet cible et de son obstacle, l'espace de travail restant fixe. Plutôt que de stocker une solution par configuration comme les bibliothèques d'expérience existantes, CoAd découpe l'espace continu des objectifs en zones appelées Task Coverage Regions et ne calcule hors ligne que des solutions "racines" représentatives de chacune ; à l'exécution, il récupère la racine correspondante en temps constant puis l'adapte via interpolation linéaire, primitives de mouvement dynamiques (DMP) ou optimisation de trajectoire simplifiée. Testé sur plusieurs bras manipulateurs, en simulation et en réel, le système affiche des requêtes sous la milliseconde et une bibliothèque fortement compressée par rapport aux méthodes de référence ; le code est publié sur GitHub sous elpis-lab/CoAd.

Pour les intégrateurs qui automatisent la prise et dépose à cadence élevée, la promesse touche un vrai goulot d'étranglement : les planificateurs par expérience gagnent en vitesse mais n'offrent aucune garantie de couvrir tout l'espace continu des positions cibles, ou exigent des bibliothèques de trajectoires trop volumineuses pour du matériel embarqué. En ne stockant que des solutions racines et en déportant le reste vers une adaptation calculée à la volée, CoAd propose un compromis mémoire-latence plus favorable pour du calcul contraint. Il s'agit toutefois d'une évaluation interne aux auteurs, sans partenaire industriel ni déploiement en production annoncé : les chiffres de compression et de latence n'ont pas été vérifiés de façon indépendante.

Le travail répond aux limites des approches de planification par expérience antérieures, capables d'accélérer les requêtes répétées mais sans garantie de couverture continue et au prix de bibliothèques de solutions volumineuses. CoAd relève de la planification de mouvement classique et hybride, à l'écart des politiques bout-en-bout apprises par des modèles vision-langage-action qui dominent l'actualité de la robotique humanoïde. Le passage en version 2 sur arXiv signale une révision de l'article, sans calendrier de publication finale ni suite industrielle précisée. Le code étant déjà public sur GitHub, une reproduction et une évaluation indépendante par la communauté robotique restent possibles dès maintenant.

À lire aussi

MetaPusher : méta-apprentissage et planification pour la manipulation non préhensile d'objets inconnus avec adaptation rapide en ligne
1arXiv cs.RO 

MetaPusher : méta-apprentissage et planification pour la manipulation non préhensile d'objets inconnus avec adaptation rapide en ligne

Un article publié le 21 septembre 2026 sur arXiv (2609.21122) présente MetaPusher, un système de méta-apprentissage et de planification adaptative pour la manipulation non-préhensile (pousser, faire glisser sans saisir) d'objets jamais rencontrés par le robot. Un modèle dynamique méta-appris s'ajuste en quelques interactions pendant l'exécution de la tâche, tandis qu'un planificateur kinodynamique met à jour ses plans à long horizon en réutilisant son arbre de recherche existant plutôt qu'en repartant de zéro, sans phase de collecte de données dédiée à l'objet. Testé en simulation et en transfert simulation-vers-réel contre quatre méthodes de référence (fine-tuning, apprentissage actif, contrôle MPPI, politique de renforcement), MetaPusher réduit l'erreur de prédiction dynamique et améliore le taux de réussite des tâches jusqu'à 20 %. Les propriétés physiques d'un objet inconnu, comme sa friction ou la distribution de sa masse, ne se déduisent pas de la seule perception visuelle, ce qui limite les politiques de manipulation entraînées sur un catalogue fermé d'objets. Le problème pratique que cible ce travail est bien identifié par les intégrateurs : actualiser un modèle dynamique en cours de tâche invalide généralement la trajectoire déjà planifiée, forçant un choix entre geler le modèle au prix de la précision, ou replanifier entièrement au prix du temps de cycle. En couplant les deux, MetaPusher illustre une piste pour réduire, dans le tri ou la logistique industrielle, la dépendance à des bases d'objets préalablement appris. Ce travail s'inscrit dans une recherche plus large sur la réduction de l'écart entre simulation et réel sans réentraînement massif par objet. Plutôt que de se comparer à des systèmes commerciaux, l'équipe confronte sa méthode aux approches classiques de la littérature (fine-tuning, apprentissage actif, MPPI, apprentissage par renforcement), sur lesquelles elle affiche son gain de 20 % en réussite des tâches. Il s'agit à ce stade d'une contribution académique évaluée en simulation et sur des scénarios de transfert contrôlés, sans mention de déploiement industriel, de partenariat ni de calendrier au-delà de la publication.

RecherchePaper
1 source
ACDC : planification de curriculum adaptatif avec contrôle contrastif dynamique pour l'apprentissage par renforcement conditionné par objectifs en manipulation robotique
2arXiv cs.RO 

ACDC : planification de curriculum adaptatif avec contrôle contrastif dynamique pour l'apprentissage par renforcement conditionné par objectifs en manipulation robotique

Des chercheurs proposent ACDC (Adaptive Curriculum planning with Dynamic Contrastive control), une nouvelle méthode d'apprentissage par renforcement conditionné par objectif (goal-conditioned RL) pour la manipulation robotique, dans une version mise à jour (v3) d'un article déposé sur arXiv. Le système combine deux mécanismes. D'un côté, un planificateur de curriculum adaptatif multidimensionnel (AC) qui ajuste dynamiquement l'équilibre entre exploration diversifiée et exploitation ciblée, en fonction du taux de réussite de l'agent et de sa progression d'entraînement. De l'autre, un module de contrôle contrastif dynamique (DC) qui traduit ce plan de curriculum en sélection d'expériences guidée par la norme, via un apprentissage contrastif contraint. Les auteurs annoncent des résultats supérieurs aux méthodes de référence de l'état de l'art sur plusieurs tâches de manipulation robotique complexes, tant en efficacité d'échantillonnage qu'en taux de réussite final. L'article ne précise ni les environnements de test exacts, ni les valeurs chiffrées des gains obtenus, ni le laboratoire ou l'affiliation des auteurs. Pour la recherche en robotique, ACDC s'attaque à une limite connue des approches actuelles de goal-conditioned RL : leur dépendance à des schémas de priorisation de l'expérience collectée, souvent statiques, qui produisent des performances inégales selon la diversité des tâches. En rapprochant la stratégie d'apprentissage du curriculum progressif observé chez l'humain, plutôt que d'un simple rejeu d'expérience priorisé, l'approche vise une meilleure généralisation entre tâches de manipulation, un enjeu clé pour les intégrateurs qui cherchent à réduire le volume de données nécessaire à l'entraînement de politiques robotiques. Le travail s'inscrit dans une lignée de recherches combinant curriculum learning et contrastive learning pour améliorer l'efficacité d'échantillonnage en RL, un axe actif depuis les méthodes de hindsight expérience replay. Le statut "replace" sur arXiv indique une révision par rapport à une version antérieure, sans qu'on sache si l'article a été accepté dans une conférence ou une revue à comité de lecture. Aucune suite (code source, benchmark public, application industrielle) n'est mentionnée à ce stade.

RecherchePaper
1 source
Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne
3arXiv cs.RO 

Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne

Une équipe de chercheurs propose sur arXiv (2511.02342v3) un cadre de planification de mouvement corps entier pour manipulateurs aériens : des drones multirotors équipés de bras robotiques conçus pour opérer dans des espaces encombrés. Le système repose sur une représentation par superquadriques (SQ), surfaces paramétriques différentiables qui modélisent avec précision la géométrie du véhicule, du bras embarqué et des obstacles environnants. Un planificateur à clairance maximale fusionne diagrammes de Voronoï et formulation de variété d'équilibre pour générer des trajectoires lisses, tandis qu'un contrôleur de sécurité applique simultanément les limites de poussée et l'évitement de collision via des fonctions de barrière d'ordre supérieur (high-order CBFs). En simulation, l'approche surpasse les planificateurs par échantillonnage en vitesse, sécurité et fluidité ; des expériences sur une plateforme physique réelle confirment la cohérence des performances sim-to-real. La manipulation aérienne bute depuis longtemps sur le conservatisme des abstractions géométriques classiques : boîtes englobantes et ellipsoïdes surestiment l'encombrement du système, imposent des déviations inutiles et ferment des passages pourtant praticables. Les superquadriques résolvent ce problème en modélisant les surfaces réelles avec une fidélité géométrique fine, sans le coût computationnel des maillages. Pour les intégrateurs et équipes R&D, cela se traduit par des cycles plus courts et la capacité d'opérer dans des espaces confinés, directement pertinents pour l'inspection de structures, la maintenance en hauteur ou l'intervention en zone difficile d'accès. La validation hardware distingue ce travail de nombreuses publications restées cantonnées à la simulation, et les garanties formelles des CBF d'ordre supérieur constituent un argument de poids pour des déploiements en environnements réels. La manipulation aérienne est un champ de recherche actif depuis une décennie, motivé par l'inspection d'éoliennes, de pylônes et d'infrastructures inaccessibles aux robots terrestres. La représentation par superquadriques, issue des travaux de Barr dans les années 1980 et revisitée par la robotique de manipulation terrestre, gagne en traction pour les contextes où la précision géométrique est critique. Parmi les équipes actives sur des problèmes voisins figurent l'ETH Zurich (ASL), le LAAS-CNRS côté français, ainsi que plusieurs groupes nord-américains et asiatiques. Ce preprint ne mentionne aucun partenaire industriel ni horizon de déploiement commercial, ce qui le positionne comme une contribution académique fondamentale avec validation expérimentale.

UELe LAAS-CNRS est explicitement cité parmi les équipes actives sur des problèmes voisins ; cette contribution pourrait alimenter les travaux européens sur la manipulation aérienne pour l'inspection d'infrastructures.

RecherchePaper
1 source
LAMP : planification adaptative de manipulation à long horizon pour la collaboration multi-robots en espace encombré
4arXiv cs.RO 

LAMP : planification adaptative de manipulation à long horizon pour la collaboration multi-robots en espace encombré

Une équipe de chercheurs a publié sur arXiv (référence 2606.29358v1) un nouveau cadre de planification intitulé LAMP, pour Long-horizon Adaptive Manipulation Planning, conçu pour coordonner plusieurs robots manipulateurs dans des environnements très encombrés. Le système repose sur deux planificateurs complémentaires : LAMPA*, qui effectue une recherche systématique dans l'espace couplé objets-robots, et LAMP-Lazy, un planificateur dit "paresseux" qui diffère certaines évaluations pour permettre une replanification en temps réel. Les expériences ont été menées dans des environnements simulés à haute densité d'obstacles, où les méthodes existantes échouent à trouver des solutions. Aucun déploiement physique ni timeline de commercialisation n'est annoncé. Le verrou technique que LAMP cherche à lever est fondamental pour l'industrie : coordonner plusieurs bras robotiques sur des tâches longues dans des espaces confinés implique de raisonner simultanément sur les contacts physiques, les dynamiques couplées entre robots, et l'évitement de collision. Les deux approches dominantes aujourd'hui se heurtent à des murs de scalabilité distincts. L'apprentissage par renforcement end-to-end peine à généraliser dès que l'horizon de tâche s'allonge ou que le nombre de robots augmente. Les méthodes hybrides, qui planifient les trajectoires d'objets et apprennent des primitives de contact à courte portée, ne tiennent pas dans des scènes très denses. LAMP propose de rendre ce problème tractable via un modèle génératif appris, combiné à une stratégie de recherche adaptative, ce qui constitue une approche architecturalement différente des VLA (Vision-Language-Action models) qui dominent l'espace humanoïde. La planification multi-robot en environnement encombré est un problème central pour l'automatisation logistique et industrielle, où des acteurs comme Exotec (France) déploient des flottes de robots AMR dans des entrepôts à haute densité. La recherche en robotique académique a longtemps traité la manipulation et la coordination de flotte séparément ; des travaux comme LAMP signalent une convergence vers des systèmes unifiés capables de gérer les deux dimensions. Cependant, l'absence totale de validation sur hardware réel est une limite importante : le sim-to-real gap reste le principal obstacle entre des résultats de simulation convaincants et une industrialisation effective. Les prochaines étapes naturelles seraient des tests sur bancs physiques multi-bras, dans des configurations représentatives de cellules de picking ou d'assemblage.

RecherchePaper
1 source