Aller au contenu principal
ActivePusher : apprentissage actif et planification par physique résiduelle pour la manipulation non-préhensile
RecherchearXiv cs.RO 

ActivePusher : apprentissage actif et planification par physique résiduelle pour la manipulation non-préhensile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche du laboratoire elpis-lab a publié sur arXiv en juin 2025 (identifiant 2506.04646, désormais à sa quatrième révision) un framework baptisé ActivePusher, dédié à la manipulation non-préhensile, c'est-à-dire le déplacement d'objets par poussée ou roulement, sans saisie. L'approche combine deux blocs techniques : un modèle de dynamique par physique résiduelle, qui superpose un correctif appris par réseau de neurones à un modèle physique analytique de base, et un mécanisme d'apprentissage actif guidé par l'incertitude, qui oriente automatiquement la collecte de données vers les paramètres de compétence les moins bien couverts. Le framework s'intègre avec des planificateurs kinodynamiques à base de modèle, en pondérant l'échantillonnage de commandes selon les zones de faible incertitude du modèle appris. Les auteurs valident l'approche en simulation et sur robot réel, avec des taux de succès de planification supérieurs aux méthodes de référence, à volume de données d'entraînement égal.

L'enjeu est significatif pour les intégrateurs et équipes R&D travaillant sur la manipulation en environnement non structuré. La manipulation non-préhensile reste un goulot d'étranglement dans de nombreuses lignes d'assemblage et de tri, précisément parce que les modèles analytiques (friction, contact multipoint) sont difficiles à calibrer et fragiles face aux variations de surface ou de géométrie. ActivePusher attaque ce problème sous deux angles simultanément : réduire le coût de collecte de données en évitant les interactions aléatoires peu informatives, et rendre la planification longue-portée plus fiable en évitant les régions d'incertitude élevée. C'est une réponse directe au "sim-to-real gap" structurel qui plombe les déploiements industriels de bras manipulateurs sur tâches de contact.

La manipulation non-préhensile est un axe de recherche actif depuis les travaux fondateurs sur la mécanique du contact des années 1990, mais les approches purement analytiques ont montré leurs limites face à la variabilité du monde réel. Des frameworks comme MPPI (Model Predictive Path Integral) ou les planificateurs kinodynamiques basés sur des modèles appris (travaux de Karol Hausman, Pieter Abbeel) forment le paysage concurrent direct. ActivePusher se distingue par le couplage explicite entre acquisition active et planification, là où la plupart des approches traitent ces deux problèmes séparément. Le code source est disponible publiquement sur GitHub (elpis-lab/ActivePusher), ce qui devrait favoriser la reproductibilité. Aucun partenaire industriel ni timeline de transfert n'est mentionné : il s'agit d'une contribution académique, sans déploiement annoncé à ce stade.

Dans nos dossiers

À lire aussi

MetaPusher : méta-apprentissage et planification pour la manipulation non préhensile d'objets inconnus avec adaptation rapide en ligne
1arXiv cs.RO 

MetaPusher : méta-apprentissage et planification pour la manipulation non préhensile d'objets inconnus avec adaptation rapide en ligne

Un article publié le 21 septembre 2026 sur arXiv (2609.21122) présente MetaPusher, un système de méta-apprentissage et de planification adaptative pour la manipulation non-préhensile (pousser, faire glisser sans saisir) d'objets jamais rencontrés par le robot. Un modèle dynamique méta-appris s'ajuste en quelques interactions pendant l'exécution de la tâche, tandis qu'un planificateur kinodynamique met à jour ses plans à long horizon en réutilisant son arbre de recherche existant plutôt qu'en repartant de zéro, sans phase de collecte de données dédiée à l'objet. Testé en simulation et en transfert simulation-vers-réel contre quatre méthodes de référence (fine-tuning, apprentissage actif, contrôle MPPI, politique de renforcement), MetaPusher réduit l'erreur de prédiction dynamique et améliore le taux de réussite des tâches jusqu'à 20 %. Les propriétés physiques d'un objet inconnu, comme sa friction ou la distribution de sa masse, ne se déduisent pas de la seule perception visuelle, ce qui limite les politiques de manipulation entraînées sur un catalogue fermé d'objets. Le problème pratique que cible ce travail est bien identifié par les intégrateurs : actualiser un modèle dynamique en cours de tâche invalide généralement la trajectoire déjà planifiée, forçant un choix entre geler le modèle au prix de la précision, ou replanifier entièrement au prix du temps de cycle. En couplant les deux, MetaPusher illustre une piste pour réduire, dans le tri ou la logistique industrielle, la dépendance à des bases d'objets préalablement appris. Ce travail s'inscrit dans une recherche plus large sur la réduction de l'écart entre simulation et réel sans réentraînement massif par objet. Plutôt que de se comparer à des systèmes commerciaux, l'équipe confronte sa méthode aux approches classiques de la littérature (fine-tuning, apprentissage actif, MPPI, apprentissage par renforcement), sur lesquelles elle affiche son gain de 20 % en réussite des tâches. Il s'agit à ce stade d'une contribution académique évaluée en simulation et sur des scénarios de transfert contrôlés, sans mention de déploiement industriel, de partenariat ni de calendrier au-delà de la publication.

RecherchePaper
1 source
DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique
2arXiv cs.RO 

DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique

Des chercheurs ont publié le 23 septembre 2026 sur arXiv (2609.25631v1) DynaForge, un framework destiné à générer automatiquement des démonstrations de manipulation dynamique d'objets pour l'entraînement de politiques robotiques par apprentissage par imitation. Le système combine une planification globale à basse fréquence avec une cinématique inverse centrée sur l'objet à haute fréquence, puis applique une politique résiduelle pour corriger les actions au moment critique du contact. Un curriculum implicite regroupe les tentatives par conditions similaires et privilégie les lots à succès mixte, concentrant l'apprentissage par renforcement résiduel sur la frontière de compétence en évolution. Sur les tâches Can et Bottle, DynaForge nécessite 0,73 fois moins d'étapes d'optimisation que l'algorithme GRPO standard pour un budget d'étapes d'environnement identique, avec un taux de succès final supérieur. Sur neuf tâches de simulation, le taux moyen de génération de démonstrations réussies passe de 41,30% avec la seule planification a priori à 78,37% avec DynaForge. Avec 800 démonstrations par tâche, des politiques DP3 entraînées sur ces données atteignent 49,11% de succès moyen, contre 7,07% pour des données générées par la méthode concurrente DOMINO. Sur trois tâches dynamiques réelles, les politiques entraînées avec DynaForge obtiennent entre 30% et 60% de succès, contre 0% à 10% pour celles issues de DOMINO. La manipulation dynamique, lancer, attraper au vol, gestes exigeant une réaction rapide au contact, reste un point faible des pipelines d'apprentissage par imitation, car les démonstrations générées automatiquement échouent souvent près du contact ou simplifient excessivement l'interaction physique, comme le fait le rejeu à la DOMINO. En améliorant nettement le taux de génération de démonstrations exploitables tout en réduisant le coût de calcul par rapport à des méthodes de renforcement classiques comme GRPO, DynaForge s'attaque directement au goulot d'étranglement des données qui freine l'entraînement de politiques à grande échelle, qu'il s'agisse de politiques de diffusion comme DP3 ou de modèles vision-langage-action plus larges. L'écart de 20 à 50 points de succès observé en conditions réelles suggère que ces démonstrations reflètent mieux la dynamique physique que les méthodes précédentes, un enjeu central pour les intégrateurs qui cherchent à transférer des politiques entraînées en simulation vers du matériel réel sans réentraînement coûteux. DynaForge se positionne explicitement face à deux familles de méthodes existantes: les approches purement basées sur la planification, sujettes à l'échec au moment du contact, et DOMINO, qui simplifie les interactions dynamiques au prix du réalisme. Le recours à GRPO, algorithme d'optimisation de politique par groupe popularisé dans l'entraînement de modèles de langage, illustre la porosité croissante entre techniques de renforcement issues du traitement du langage et robotique. Le résumé ne précise ni affiliation institutionnelle ni disponibilité du code, et la validation réelle reste limitée à trois tâches sans détail sur le nombre d'essais, ce qui invite à la prudence avant toute extrapolation à un déploiement industriel.

RecherchePaper
1 source
Manipulation inverse par planification symbolique et apprentissage d'opérateurs résiduels
3arXiv cs.RO 

Manipulation inverse par planification symbolique et apprentissage d'opérateurs résiduels

Des chercheurs publient sur arXiv (2606.05248) un cadre hybride pour la manipulation inverse en robotique : restaurer l'état initial d'un objet après qu'un bras manipulateur a exécuté une tâche. Le système extrait automatiquement des opérateurs de type STRIPS à partir de démonstrations humaines, via des prédicats géométriques souples (soft geometric predicates). Pour chaque opérateur, il dérive un objectif de restauration inverse qui préserve les préconditions, restaure les effets supprimés et annule les effets ajoutés. Quand le planificateur symbolique ne parvient pas à tout résoudre seul, les prédicats irrésolus déclenchent un apprentissage résiduel par algorithme Soft Actor-Critic (SAC). L'évaluation porte sur la tâche PushCube du benchmark de simulation ManiSkill3 : le plan symbolique effectue une restauration grossière par pick-and-place, puis le SAC affine la pose du cube pour satisfaire les prédicats restants. Ce travail s'attaque à un problème industriellement critique mais peu formalisé : inverser une tâche robotique ne se résume ni à rejouer les trajectoires moteur à rebours, ni à inverser les transitions symboliques d'un plan. La dynamique continue des contacts physiques crée des effets irréversibles qu'aucune de ces deux approches seules ne corrige. En combinant planification symbolique pour la restauration grossière et RL résiduel pour le raffinement précis, les auteurs montrent qu'un inverse approximatif peut devenir une compétence physiquement fondée. Pour les intégrateurs industriels, cela ouvre la voie à des systèmes capables de récupération d'erreur automatique sans reprogrammation manuelle, une lacune réelle des installations robotiques actuelles. Ce preprint s'inscrit dans la tension croissante entre deux paradigmes : les modèles tout-neuronal de type VLA (Vision-Language-Action) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui misent sur l'apprentissage de bout en bout, et les approches hybrides symbolique-neuronal. Les auteurs parient sur STRIPS, formalisé en 1971, comme couche de représentation structurée des effets d'actions. ManiSkill3 est un benchmark de simulation standardisé développé à l'Université de San Diego ; les résultats restent donc entièrement en simulation, sans transfert sim-to-real démontré ni partenaire industriel annoncé. L'extension à des tâches aux effets réellement irréversibles (assemblage, coupe, collage) constitue la prochaine étape non résolue, et conditionnera l'intérêt concret de cette approche pour le déploiement réel.

RecherchePaper
1 source
DART : commande prédictive augmentée par apprentissage pour la manipulation bi-bras non préhensile
4arXiv cs.RO 

DART : commande prédictive augmentée par apprentissage pour la manipulation bi-bras non préhensile

Des chercheurs ont publié sur arXiv (référence 2604.17833) les travaux autour de DART, un framework bimanuel conçu pour la manipulation non préhensile d'objets posés sur un plateau. L'approche repose sur un contrôleur prédictif non linéaire (MPC) couplé à un contrôleur d'impédance par optimisation, permettant de déplacer des objets sur le plateau sans les saisir directement. Le système évalue trois stratégies de modélisation de la dynamique plateau-objet : un modèle analytique physique, un modèle par régression en ligne adaptatif en temps réel, et un modèle de dynamique entraîné par apprentissage par renforcement (RL), ce dernier offrant une meilleure généralisation sur des objets aux propriétés variées. Les évaluations ont été réalisées en simulation sur des objets de masses, géométries et coefficients de friction différents. Les auteurs revendiquent que DART constitue le premier framework dédié à ce type de tâche en configuration bimanuelle. L'intérêt technique de DART réside dans la comparaison rigoureuse des trois approches de modélisation sur des métriques concrètes : temps de stabilisation, erreur en régime permanent, effort de contrôle et généralisation. Ce benchmark interne est utile pour les équipes d'intégration robotique qui doivent choisir entre modèles physiques (précis mais rigides), adaptation en ligne (réactive mais computationnellement coûteuse) et RL (flexible mais plus difficile à certifier). L'association MPC et contrôleur d'impédance est une piste crédible pour la manipulation d'objets fragiles ou instables, un verrou important en robotique de service. Toutefois, la validation reste strictement en simulation : le passage au réel implique des défis de perception, de latence et de calibration que le papier ne traite pas encore. Ce travail s'inscrit dans un intérêt croissant pour la robotique de service en hôtellerie et restauration, où des acteurs comme Bear Robotics (Servi), Keenon Robotics ou encore Enchanted Tools (Miroki, développé en France) positionnent leurs plateformes sur des tâches de transport et de service en salle. Les approches dominantes jusqu'ici privilégient la navigation autonome avec préhension classique ; la manipulation non préhensile sur plateau reste peu explorée à l'échelle produit. La prochaine étape naturelle pour DART serait une validation sur plateforme physique, avec des bras commerciaux type Franka Research 3 ou Universal Robots, avant d'envisager une intégration dans un robot mobile de service.

UEEnchanted Tools (Miroki, France) est cité comme acteur du service robotique susceptible de bénéficier de ce type de manipulation non préhensile sur plateau, mais le travail reste en simulation sans transfert réel annoncé.

RecherchePaper
1 source