Aller au contenu principal
Apprentissage de dynamiques d'objets équivariantes augmentées par réseau de neurones à partir de peu d'interactions
RecherchearXiv cs.RO 

Apprentissage de dynamiques d'objets équivariantes augmentées par réseau de neurones à partir de peu d'interactions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PIEGraph est un modèle hybride de dynamique d'objets pour la manipulation robotique, présenté dans un preprint arXiv publié en mai 2025 (arXiv:2605.02699). Conçu pour opérer avec peu de données d'interaction réelles, il repose sur deux composants couplés : un modèle analytique basé sur des particules physiquement informé, implémenté comme un système masse-ressort, et un réseau de neurones graphique équivariant (GNN équivariant) qui exploite les symétries des interactions entre particules pour corriger et guider ce modèle analytique. Les objets sont représentés comme des ensembles de particules 3D, une convention répandue dans la recherche en manipulation d'objets déformables. PIEGraph a été évalué sur des tâches de réorientation et de repositionnement impliquant des cordes, du tissu, des peluches et des objets rigides, à la fois en simulation et sur hardware robotique physique, où il surpasse les approches de référence actuelles selon les auteurs.

Le problème que PIEGraph cherche à résoudre est bien identifié dans le domaine : les modèles purement neuronaux de dynamique de particules perdent la cohérence physique sur des horizons temporels longs et exigent de larges volumes de données d'entraînement, deux contraintes rédhibitoires pour un déploiement industriel. L'approche hybride, avec des contraintes physiques analytiques comme biais inductif et une correction par GNN équivariant, démontre que l'intégration explicite de symétries et de lois physiques dans l'architecture améliore la généralisation à partir de peu d'expériences réelles. Pour les intégrateurs robotiques qui manipulent des pièces souples (textiles, câbles, joints), c'est un signal pertinent : le sim-to-real gap pour les objets déformables n'est pas uniquement un problème de qualité de simulation, mais aussi de structure du modèle d'apprentissage lui-même.

La représentation d'objets par nuages de particules 3D est au cœur de travaux antérieurs comme DPI-Net, RoboCraft ou les approches issues de PlasticineLab. Les GNN purs ont montré leurs limites pour la prédiction à long terme et hors distribution d'entraînement. La direction "physique hybride et apprentissage" est partagée par plusieurs groupes, notamment autour de DiffTaichi et des formulations position-based dynamics (PBD). PIEGraph s'inscrit dans cette lignée en ajoutant l'équivariance comme levier supplémentaire de data-efficiency. Une limite notable : le résumé disponible ne quantifie pas précisément le nombre d'interactions réelles nécessaires, un chiffre décisif pour juger de l'applicabilité industrielle. Les prochaines étapes naturelles seraient de tester sur des tâches impliquant des contacts déformable-rigide et de publier ces métriques de sample efficiency.

À lire aussi

Apprentissage de la dynamique de contact par le toucher : réseaux de neurones sur graphes conditionnés par l'action pour l'insertion de tiges robotique
1arXiv cs.RO 

Apprentissage de la dynamique de contact par le toucher : réseaux de neurones sur graphes conditionnés par l'action pour l'insertion de tiges robotique

Une équipe de recherche publie sur arXiv (2509.12151, version 3) un modèle physique apprenable capable de prédire le mouvement de l'effecteur terminal d'un robot ainsi que la force et le couple de réaction lors de manipulations à contact riche. L'architecture représente l'effecteur et l'environnement comme des maillages en interaction organisés en graphe, et conditionne explicitement ses prédictions sur la commande de contrôle appliquée : elle prédit directement la mise à jour de pose au niveau de l'objet, tandis que le couple de réaction émerge d'un champ de force calculé par sommet du maillage. L'entraînement est auto-supervisé, à partir des seules données des encodeurs articulaires et du capteur de force-couple, pendant que le robot touche aléatoirement son environnement sans consigne de tâche. En simulation, ce modèle se transfère à une tâche d'insertion de pièce (peg insertion) sur des géométries concaves inédites : un agent de commande prédictive (MPC) qui l'utilise atteint jusqu'à 98% de taux de réussite, et après un réglage fin sur des données auto-collectées, il égale un agent planifiant avec la dynamique de référence au jeu le plus serré testé, 1 mm. Dans le monde réel, ce modèle surpasse un modèle MuJoCo calibré par identification de système classique de 45% en précision de position, et de 74% et 63% respectivement en erreur de force et de couple. L'enjeu dépasse la démonstration académique : l'insertion de pièces à tolérances serrées reste un point de blocage classique pour l'assemblage robotique de précision, car les simulateurs physiques standards peinent à modéliser fidèlement le frottement et la déformation de contact, ce qui creuse l'écart simulation-réel et oblige les intégrateurs à des campagnes coûteuses de calibration manuelle. En montrant qu'un modèle appris à partir de simples contacts aléatoires, sans démonstration de tâche, généralise à des géométries jamais vues et rivalise avec une dynamique de référence à 1 mm de clearance, ce travail suggère une voie pour réduire la dépendance à l'identification de système traditionnelle et améliorer la robustesse hors simulation, un enjeu direct pour les intégrateurs travaillant sur l'assemblage électronique ou mécanique fin. Les résultats restent toutefois circonscrits à une tâche unique testée en conditions contrôlées, avec une comparaison réelle limitée à un seul modèle de référence, et non à un déploiement industriel à l'échelle. Cette approche s'inscrit dans un courant de recherche appliquant les réseaux de neurones sur graphes à la simulation physique à base de maillages, et l'étend ici à la dynamique de contact robot-environnement conditionnée par l'action. Elle se distingue des politiques de bout en bout de type vision-langage-action, qui apprennent un comportement directement à partir de démonstrations massives et spécifiques à la tâche, en misant plutôt sur un modèle dynamique générique et réutilisable appris de façon indépendante de la tâche. Le principal point de comparaison méthodologique reste l'identification de système classique utilisée dans des moteurs comme MuJoCo, que ce travail cherche explicitement à dépasser sur la fidélité des forces de contact. Le fait que le papier en soit à sa troisième version sur arXiv signale des itérations après relecture, sans partenariat industriel, pilote ou calendrier de déploiement mentionné à ce stade ; les suites attendues porteraient sur l'extension à d'autres tâches d'assemblage à tolérances serrées et une validation sur davantage de plateformes robotiques réelles.

RecherchePaper
1 source
Apprendre aux robots à interpréter les interactions sociales via l'apprentissage sur graphes dynamiques guidé par le lexique
2arXiv cs.RO 

Apprendre aux robots à interpréter les interactions sociales via l'apprentissage sur graphes dynamiques guidé par le lexique

Une équipe de chercheurs publie SocialLDG (Social Lexically-guided Dynamic Graph learning), un cadre d'apprentissage multi-tâches destiné à doter les robots d'intelligence sociale. Déposé sur arXiv (2604.10895v2), le travail vise un problème central de l'interaction humain-robot : inférer les états internes d'un utilisateur (émotions, intentions, états cognitifs non directement observables), prédire ses comportements futurs et y répondre de façon adaptée. Le cadre modélise six tâches distinctes représentant la relation dynamique entre états latents et actions observables, en intégrant un modèle de langage pour introduire des priors lexicaux par tâche, et un apprentissage par graphe dynamique pour suivre l'évolution temporelle des affinités entre tâches. Les auteurs rapportent des performances état de l'art sur deux jeux de données publics d'interaction sociale humain-robot, sans que le résumé disponible précise les benchmarks ni les marges de gain exactes. L'apport le plus concret pour les équipes de R&D en robotique sociale est la résistance au catastrophic forgetting : SocialLDG intègre de nouvelles tâches comportementales sans dégrader les capacités acquises, une propriété critique pour des déploiements réels où l'étendue des interactions croît progressivement. L'usage de priors linguistiques pour structurer le raisonnement sur graphe est également original : il permet d'exploiter la sémantique du langage naturel comme contrainte sur la modélisation sociale du robot, ouvrant la voie à une adaptation sans réentraînement complet. La lisibilité des affinités entre tâches offre en outre un levier d'interprétabilité utile pour le debug et la validation industrielle. La compréhension sociale en robotique est un chantier actif de longue date, avec des contributions notables de CMU, du MIT, et des travaux sur OpenFace ou EMOTIC. SocialLDG se distingue des approches actuelles qui traitent séparément reconnaissance d'émotion, détection d'intention et prédiction de geste, en proposant un cadre unifié inspiré des sciences cognitives. Les travaux récents sur les vision-language agents et les VLA adressent partiellement ce champ, mais restent centrés sur la manipulation physique plutôt que sur la dynamique socio-cognitive. En tant que prépublication non encore évaluée par les pairs, les performances annoncées restent à confirmer indépendamment avant toute intégration.

RecherchePaper
1 source
Apprentissage continu de politiques robotiques via des dynamiques neuronales variationnelles
3arXiv cs.RO 

Apprentissage continu de politiques robotiques via des dynamiques neuronales variationnelles

Des chercheurs ont publié en juin 2026 (arXiv:2606.27353) un framework d'apprentissage continu permettant à un robot de s'adapter en temps réel à des dynamiques changeantes et non observées, sans nécessiter de réentraînement complet. Le système combine un modèle de dynamique analytique (prior physique) avec un résidu neuronal entraîné à capturer les effets non modélisés. Un encodeur récurrent infère en ligne la "condition cachée" courante du robot, c'est-à-dire l'état du système non directement mesurable (charge utile variable, usure mécanique, perturbations aérologiques), à partir des trajectoires état-action récentes. Cette condition estimée pilote à la fois le modèle résiduel et la politique de contrôle. Lors de l'apprentissage, la politique est optimisée par simulation différentiable en échantillonnant un ensemble de dynamiques plausibles issues du modèle latent. Sur un quadrotor réel soumis à des vents récurrents, le système récupère une perturbation connue en environ 1 seconde, soit cinq fois plus rapidement qu'un réentraînement résiduel en ligne classique, et réduit les erreurs de vol stationnaire et de suivi de trajectoire respectivement de 65,7 % et 53,3 % par rapport aux approches d'adaptation en ligne de l'état de l'art. L'enjeu industriel est direct : la quasi-totalité des contrôleurs appris actuels sont entraînés une fois, puis déployés statiquement, comme si la dynamique du robot restait constante. En pratique, batteries qui se déchargent, charges qui changent de mission en mission, surfaces de contact qui évoluent, conditions météo variables, tout cela dégrade les performances sans mécanisme de correction. L'originalité de cette approche tient à la distinction entre "reconnaissance" et "réadaptation" : plutôt que de réajuster un modèle depuis zéro à chaque perturbation rencontrée (coûteux en données et en temps), le système reconnaît une dynamique déjà vue et l'applique immédiatement via l'encodeur récurrent. Ce paradigme est particulièrement pertinent pour les intégrateurs de drones industriels, de robots manipulateurs en logistique ou de plateformes mobiles en environnement extérieur, où les cycles de déploiement sont longs et les recalibrages manuels coûteux. Les résultats valident aussi une hypothèse clé du champ sim-to-real : qu'un prior physique structuré couplé à un résidu neuronal permet de généraliser à des conditions non vues lors de l'entraînement, à condition que ces conditions aient été préalablement "vécues" lors d'autres déploiements. Ce travail s'inscrit dans une lignée de recherches sur l'adaptation dynamique de politiques robotiques incluant la randomisation de domaine (popularisée par OpenAI Robotics dès 2018), les approches méta-learning type MAML, et les méthodes d'adaptation en ligne par processus gaussiens. Le réentraînement résiduel en ligne, utilisé comme baseline de comparaison, est une technique établie mais limitée par sa latence de convergence, problème central que ce framework adresse directement par la reconnaissance latente. L'article est à ce stade un preprint non relu par les pairs, et les expériences réelles restent limitées au quadrotor ; la généralisation à des robots à pattes ou à des bras manipulateurs industriels reste à démontrer. Aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné. Les prochaines étapes probables incluent des tests sur des plateformes à dynamiques plus complexes et une validation sur des dynamiques à distribution plus large.

RecherchePaper
1 source
PokeNet : apprentissage de modèles cinématiques d'objets articulés à partir d'observations humaines
4arXiv cs.RO 

PokeNet : apprentissage de modèles cinématiques d'objets articulés à partir d'observations humaines

PokeNet, un nouveau framework de recherche présenté dans un article arXiv (2602.02741v2, version révisée), apprend le modèle cinématique complet d'un objet articulé à partir d'une seule démonstration humaine, sans connaissance préalable du nombre ou du type d'articulations. Le système reçoit une séquence d'observations en nuages de points capturant une personne en train de manipuler un objet inconnu (porte, tiroir, appareil à plusieurs axes), et en déduit trois choses simultanément : les paramètres des articulations (position et orientation des axes), l'ordre dans lequel les liaisons doivent être actionnées, et l'évolution de l'état de chaque articulation au fil du temps. Sur un ensemble d'objets variés, y compris des catégories jamais vues à l'entraînement, PokeNet améliore la précision d'estimation des axes et des états articulaires de plus de 27% en moyenne par rapport aux meilleures méthodes existantes, avec des résultats validés à la fois en simulation et en conditions réelles. L'enjeu dépasse la simple prouesse technique : la modélisation d'articulations est une brique de base pour toute manipulation robotique d'objets du quotidien, en amont de l'apprentissage de compétences ou de la planification de mouvements. Les approches précédentes butaient sur plusieurs limites pratiques, à commencer par la dépendance à des priors sur l'objet, l'incapacité à récupérer des articulations occultées qui ne se révèlent que pendant l'interaction, ou le besoin de dizaines d'images multi-vues par objet, difficilement compatible avec un déploiement réel. PokeNet s'attaque aussi à un point souvent négligé : l'ordre des manipulations, crucial pour des objets à plusieurs degrés de liberté comme un lave-vaisselle, où il faut ouvrir la porte avant de pouvoir sortir le panier. Un robot capable d'apprendre ce modèle à partir d'une simple démonstration humaine, sans instrumentation lourde, se rapproche d'un déploiement générique en environnement domestique ou industriel non structuré. Le travail s'inscrit dans la lignée des méthodes de "articulation modeling" qui cherchent à généraliser au-delà des catégories d'objets prédéfinies, un axe de recherche actif en robotique de manipulation ces dernières années. En s'appuyant uniquement sur une observation humaine plutôt que sur une exploration robotique coûteuse en essais, PokeNet ouvre la voie à des pipelines où un robot apprend par observation avant d'agir. Les auteurs ne précisent pas de calendrier d'intégration dans un système robotique complet, mais les résultats en environnement réel suggèrent une maturité suffisante pour des tests d'intégration à court terme sur des plateformes de manipulation existantes.

RecherchePaper
1 source