Aller au contenu principal
Secouer pour apprendre : interrogation dynamique de la physique cachée des objets par calcul à réservoir physique
RecherchearXiv cs.RO 

Secouer pour apprendre : interrogation dynamique de la physique cachée des objets par calcul à réservoir physique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une prépublication arXiv (2609.20970v1) décrit un bras robotique souple inspiré de l'origami capable d'inférer des propriétés physiques cachées d'un objet, notamment la position de son centre de masse, simplement en le secouant après l'avoir saisi. Le bras fonctionne comme un "réservoir computer" physique : une vibration fixe est appliquée à sa base après la prise, et la réponse transitoire qui suit, le "ringdown", est captée par caméra ou par des capteurs embarqués, la dynamique du système bras-objet couplé encodant directement l'information recherchée, qu'un simple lecteur linéaire suffit ensuite à décoder. Le système a rempli trois tâches de difficulté croissante : déterminer l'orientation du centre de masse caché, estimer sa distance au point de préhension, puis exploiter cette estimation pour réaliser un regrasp mieux adapté. Une représentation résumée du signal de ringdown, développée par les auteurs, améliore encore la précision des prédictions.

Cette démonstration propose une alternative aux approches de perception robotique reposant sur la vision ou des capteurs de force et de couple dédiés, inefficaces face à des objets scellés ou opaques dont le contenu et le centre de masse restent invisibles. En déportant une partie du calcul vers la dynamique mécanique du bras lui-même plutôt que vers un traitement numérique lourd, la méthode ouvre une piste peu coûteuse en énergie et en puissance de calcul, pertinente pour des intégrateurs travaillant sur la manipulation d'objets hétérogènes en logistique ou en tri. Elle montre surtout qu'une brève interaction physique, une simple secousse, peut remplacer des capteurs internes complexes pour guider une décision de re-prise. Il s'agit néanmoins d'un résultat de laboratoire, validé sur un nombre limité de tâches et d'objets, loin d'un système prêt pour un déploiement industriel.

Ce travail relève du réservoir computing physique, un champ qui utilise un système physique non linéaire, ici un actionneur souple en origami, comme substrat de calcul plutôt qu'un réseau de neurones numérique classique, une approche déjà explorée avec des matériaux souples ou des structures mécaniques. Il rejoint les recherches en robotique souple sur la manipulation sous incertitude, où la plupart des méthodes existantes reposent sur l'estimation inertielle ou sur la vision plutôt que sur la réponse dynamique du couple robot-objet. Les auteurs présentent leurs résultats comme une validation de principe, baptisée "shake-to-learn", et évoquent l'extension de cette interrogation mécanique à d'autres propriétés cachées et à des scénarios de manipulation plus complexes, sans calendrier annoncé pour un transfert vers des applications industrielles.

Dans nos dossiers

À lire aussi

BoxTwin : apprendre la dynamique d'objets articulés élastoplastiques à partir de vidéos
1arXiv cs.RO 

BoxTwin : apprendre la dynamique d'objets articulés élastoplastiques à partir de vidéos

BoxTwin est un framework de jumeau numérique interactif conçu pour apprendre, à partir de simples vidéos, la dynamique complète des objets articulés élastoplastiques (EAO) : des objets comme des boîtes en carton ou des structures pliables qui combinent élasticité non linéaire, déformation plastique irréversible et accumulation de dommages au fil des manipulations. Le pipeline reconstruit d'abord la scène filmée, puis identifie pour chaque objet un modèle constitutif informé par la physique, c'est-à-dire une représentation mathématique de son comportement mécanique réel plutôt qu'une approximation générique. Les auteurs ont testé leur méthode sur deux scénarios : le pliage manuel d'objets et leur manipulation par un bras robotique double (dual-arm). Résultat annoncé : le système suit précisément les trajectoires articulaires et reproduit le comportement plastique post-contact sur de longs horizons temporels, y compris après plusieurs cycles de déformation. Le travail est publié en préprint sur arXiv sous la référence 2607.17132v1. L'enjeu concret touche la logistique et la manipulation industrielle, deux domaines où le carton, les boîtes pliables et autres contenants déformables sont omniprésents mais mal pris en charge par les simulateurs actuels, la plupart supposant des objets rigides ou purement élastiques sans mémoire de déformation. Cette limite alimente l'écart classique entre simulation et réel (sim-to-real gap) : un robot entraîné sur un jumeau numérique qui ignore l'usure et le fluage plastique d'un carton risque d'échouer en conditions réelles après quelques manipulations répétées. En captant ce comportement directement depuis la vidéo plutôt que via un modelage manuel coûteux, BoxTwin ouvre une piste pour entraîner des politiques de manipulation plus robustes sur des entrepôts ou lignes d'emballage, notamment pour les systèmes de préparation de commandes ou de tri assistés par bras robotiques. Le sujet s'inscrit dans un champ de recherche encore restreint, à la croisée de la reconstruction 3D par vidéo, de la simulation physique différentiable et de la manipulation robotique de matériaux déformables (tissus, cartons, structures pliables), un terrain nettement moins mature que celui des jumeaux numériques pour robots rigides ou humanoïdes. S'agissant d'un préprint tout juste publié, aucun partenaire industriel, aucune intégration produit ni calendrier de déploiement n'est mentionné à ce stade : il s'agit d'une contribution académique, dont la suite logique serait une intégration dans des boucles de contrôle robotique pour une manipulation adaptative d'objets déformables en environnement non structuré, sans qu'un pilote concret soit annoncé pour l'instant.

RecherchePaper
1 source
ChainSplat : un modèle inspiré de la physique et de la théorie des vis pour apprendre la dynamique d'objets linéaires déformables à partir de vidéos RGB multivues
2arXiv cs.RO 

ChainSplat : un modèle inspiré de la physique et de la théorie des vis pour apprendre la dynamique d'objets linéaires déformables à partir de vidéos RGB multivues

Des chercheurs présentent ChainSplat, un cadre d'apprentissage qui reconstruit simultanément la géométrie 3D, l'apparence, la cinématique et la dynamique d'objets linéaires déformables (câbles, cordes, tuyaux) à partir de simples vidéos RGB multi-vues, sans capteur de profondeur. Publié sur arXiv (arXiv:2608.28570v1) le 28 août 2026, le système modélise l'objet déformable comme une chaîne ouverte de liaisons rigides reliées par des articulations rotoïdes, s'appuyant sur la théorie des vis (screw theory) pour obtenir une représentation d'état compacte paramétrée par les configurations articulaires. Cette formulation analytique est couplée au Gaussian splatting, ce qui permet un rendu RGB haute fidélité à partir de n'importe quel état reconstruit. Selon les auteurs, des expériences en conditions réelles montrent des performances état de l'art en prédiction de dynamique, reconstruction 3D et rendu visuel lors d'interactions dynamiques ; le code source et des vidéos de démonstration sont publiés sur chainsplat.github.io. Pour l'industrie robotique, l'enjeu dépasse la simple reconstruction visuelle : la manipulation de câbles, tuyaux et cordes reste un point faible connu des lignes d'assemblage automatisées, car les méthodes existantes reposent sur des pipelines multi-étapes fragiles et des entrées de profondeur auxiliaires peu fiables lors de mouvements rapides, tout en générant des espaces d'état de trop haute dimension pour un contrôle en temps réel. En réduisant la dynamique d'un objet déformable à un modèle articulaire compact exploitable pour l'optimisation de trajectoire, ChainSplat s'attaque directement au goulot d'étranglement du contrôle basé modèle. Les auteurs revendiquent une estimation d'état et de force en temps réel, un argument clé pour des intégrateurs cherchant à automatiser le câblage, le sertissage de tuyaux ou la manipulation de harnais électriques, tâches jusqu'ici largement dévolues à des opérateurs humains faute de modèles physiques suffisamment légers et précis. Ce travail s'inscrit dans une lignée de recherche académique visant à combiner modèles physiques explicites et représentations neuronales de scène, dans la continuité des avancées en Gaussian splatting pour la robotique. Contrairement aux approches purement data-driven à la Pi-0 ou GR00T N2 pour la manipulation générale, ChainSplat cible spécifiquement le sous-problème des objets linéaires déformables avec un a priori physique fort, une piste que plusieurs laboratoires explorent en parallèle pour contourner le coût d'apprentissage des dynamiques haute dimension. L'article ne précise pas de partenariat industriel ni de calendrier de transfert vers un produit commercial ; il s'agit à ce stade d'une contribution de recherche avec code ouvert, dont la prochaine étape naturelle serait une validation sur des tâches de manipulation robotique complètes plutôt que sur les seules métriques de reconstruction et de prédiction présentées ici.

RecherchePaper
1 source
De la cinématique à la dynamique : apprendre à affiner des plans hybrides pour une exécution physiquement faisable
3arXiv cs.RO 

De la cinématique à la dynamique : apprendre à affiner des plans hybrides pour une exécution physiquement faisable

Une équipe de chercheurs présente dans un préprint arXiv (2604.12474, avril 2026) une méthode d'apprentissage par renforcement (RL) conçue pour corriger les trajectoires générées par des planificateurs hybrides temporels avant exécution réelle sur un robot. Le problème central est classique : lorsqu'un robot doit traverser une séquence de régions spatiales en respectant des contraintes de délais, de fenêtres temporelles et de limites en vitesse ou accélération, les planificateurs hybrides actuels modélisent le mouvement via des dynamiques linéaires du premier ordre (cinématique pure), sans tenir compte des contraintes physiques réelles du système. Il en résulte des plans qui sont logiquement valides mais dynamiquement infaisables. Les auteurs formalisent ce problème de raffinement comme un processus de décision markovien (MDP) intégrant explicitement des contraintes analytiques du second ordre (accélération, couple) et entraînent un agent RL en espace continu pour transformer le plan initial en une trajectoire exécutable. L'intérêt pratique est direct pour les intégrateurs et les équipes robotique : le sim-to-real gap le plus coûteux n'est souvent pas dans la perception ou la préhension, mais dans le suivi de trajectoire. Un plan validé par un planificateur symbolique peut générer des couples impossibles ou des profils de vitesse non bornés, forçant les équipes terrain à retoucher les trajectoires à la main ou à surcontraindre le planificateur. La méthode proposée agit comme une couche de post-traitement apprenante qui récupère la faisabilité physique de manière fiable, sans rejeter la séquence d'actions de haut niveau, et sans nécessiter une re-planification complète. Cela positionne l'approche comme un outil de robustification entre le niveau symbolique et le contrôleur bas niveau, un segment peu adressé dans la littérature. Les planificateurs hybrides temporels comme PDDL+ ou ENHSP tentent depuis une décennie d'intégrer la dynamique continue dans la planification symbolique, avec des résultats limités dès que les modèles s'éloignent de la linéarité. Les approches concurrentes incluent le MPC (Model Predictive Control) et les méthodes de trajectory optimization (iLQR, MPPI), mais elles supposent généralement un plan discret déjà fixé ou ignorent les contraintes temporelles symboliques. La contribution ici est leur combinaison explicite via RL. Le papier reste au stade de la preuve de concept sur des scénarios de navigation structurés ; les prochaines étapes naturelles seraient la validation sur hardware avec des dynamiques plus riches (bras manipulateurs, humanoïdes) et des benchmarks comparatifs contre MPC sur des horizons longs.

RecherchePaper
1 source
Apprentissage de dynamiques d'objets équivariantes augmentées par réseau de neurones à partir de peu d'interactions
4arXiv cs.RO 

Apprentissage de dynamiques d'objets équivariantes augmentées par réseau de neurones à partir de peu d'interactions

PIEGraph est un modèle hybride de dynamique d'objets pour la manipulation robotique, présenté dans un preprint arXiv publié en mai 2025 (arXiv:2605.02699). Conçu pour opérer avec peu de données d'interaction réelles, il repose sur deux composants couplés : un modèle analytique basé sur des particules physiquement informé, implémenté comme un système masse-ressort, et un réseau de neurones graphique équivariant (GNN équivariant) qui exploite les symétries des interactions entre particules pour corriger et guider ce modèle analytique. Les objets sont représentés comme des ensembles de particules 3D, une convention répandue dans la recherche en manipulation d'objets déformables. PIEGraph a été évalué sur des tâches de réorientation et de repositionnement impliquant des cordes, du tissu, des peluches et des objets rigides, à la fois en simulation et sur hardware robotique physique, où il surpasse les approches de référence actuelles selon les auteurs. Le problème que PIEGraph cherche à résoudre est bien identifié dans le domaine : les modèles purement neuronaux de dynamique de particules perdent la cohérence physique sur des horizons temporels longs et exigent de larges volumes de données d'entraînement, deux contraintes rédhibitoires pour un déploiement industriel. L'approche hybride, avec des contraintes physiques analytiques comme biais inductif et une correction par GNN équivariant, démontre que l'intégration explicite de symétries et de lois physiques dans l'architecture améliore la généralisation à partir de peu d'expériences réelles. Pour les intégrateurs robotiques qui manipulent des pièces souples (textiles, câbles, joints), c'est un signal pertinent : le sim-to-real gap pour les objets déformables n'est pas uniquement un problème de qualité de simulation, mais aussi de structure du modèle d'apprentissage lui-même. La représentation d'objets par nuages de particules 3D est au cœur de travaux antérieurs comme DPI-Net, RoboCraft ou les approches issues de PlasticineLab. Les GNN purs ont montré leurs limites pour la prédiction à long terme et hors distribution d'entraînement. La direction "physique hybride et apprentissage" est partagée par plusieurs groupes, notamment autour de DiffTaichi et des formulations position-based dynamics (PBD). PIEGraph s'inscrit dans cette lignée en ajoutant l'équivariance comme levier supplémentaire de data-efficiency. Une limite notable : le résumé disponible ne quantifie pas précisément le nombre d'interactions réelles nécessaires, un chiffre décisif pour juger de l'applicabilité industrielle. Les prochaines étapes naturelles seraient de tester sur des tâches impliquant des contacts déformable-rigide et de publier ces métriques de sample efficiency.

RecherchePaper
1 source