Aller au contenu principal
PhyPush : une seule poussée suffit pour estimer les propriétés physiques sans capteurs grâce aux transformeurs guidés par la physique
RecherchearXiv cs.RO 

PhyPush : une seule poussée suffit pour estimer les propriétés physiques sans capteurs grâce aux transformeurs guidés par la physique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PhyPush, présenté dans un article arXiv (2605.18284) publié en mai 2026, est un framework basé sur un Transformer guidé par la physique, capable d'estimer la masse et le coefficient de friction d'un objet à partir d'une seule poussée. La particularité centrale : le système n'utilise que la vélocité cinématique de l'effecteur final, une donnée disponible nativement sur tout bras robotique standard, sans capteur de force/couple, sans réseau de capteurs tactiles, et sans système de capture de mouvement multi-caméras. Le modèle intègre directement les contraintes issues de la deuxième loi de Newton et du modèle de friction de Coulomb dans sa fonction de perte, ce qui renforce la cohérence physique des estimations. En simulation, PhyPush réduit l'erreur d'estimation de plus de 10 % par rapport à une baseline disposant pourtant d'un accès privilégié aux données de force complètes ; en conditions réelles, il surpasse une approche purement data-driven sur des objets et surfaces hors domaine d'entraînement.

L'impact pour l'intégration industrielle est direct. L'estimation précise de la masse et de la friction est un prérequis pour la manipulation adaptative fiable, notamment dans les lignes de tri, d'assemblage ou de logistique où les objets varient constamment. Les approches existantes exigeaient soit un instrumentation coûteuse (capteurs F/T à 2 000-10 000 €/unité), soit des environnements contrôlés incompatibles avec un déploiement à l'échelle. PhyPush déplace ce prérequis vers une inférence logicielle sur hardware standard, ce qui ouvre la voie à une perception physique embarquée sur des flottes de robots sans sur-coût matériel. La preuve que l'apprentissage guidé par la physique peut surpasser une baseline disposant de plus d'information sensorielle est également un signal fort : la structure inductive correcte compense le manque de capteurs, ce qui contredit l'hypothèse selon laquelle plus de données brutes implique nécessairement de meilleures estimations.

L'estimation interactive des propriétés physiques par poussée (push-based estimation) est un problème étudié depuis une décennie, mais les solutions robustes restaient dépendantes de setups lourds issus des labos de manipulation tactile (MIT, Stanford, CMU). L'émergence des Transformers appliqués à la dynamique robotique et l'intégration de prior physique dans les fonctions de perte sont des tendances récentes qui convergent ici. Côté concurrence, les travaux de perception tactile comme celles de GelSight ou des approches sim-to-real de Meta (DIGIT) adressent un problème similaire mais via du hardware dédié ; des équipes comme Physical Intelligence (Pi-0) ou Figure AI intègrent eux aussi des modules d'estimation d'état dans leurs pipelines VLA, mais sans publier les détails. PhyPush se positionne comme une brique bas coût et open science pour tout intégrateur souhaitant ajouter de l'adaptation physique à un bras existant. Les prochaines étapes logiques incluent la généralisation à des poussées multi-axes, l'intégration dans des boucles de contrôle en temps réel, et le test sur des plateformes humanoïdes où la variabilité des objets manipulés est maximale.

À lire aussi

BarrierFormer : application de barrières prédictives guidée par transformeur pour un contrôle robotique sûr
1arXiv cs.RO 

BarrierFormer : application de barrières prédictives guidée par transformeur pour un contrôle robotique sûr

Une équipe de recherche propose BarrierFormer, un framework combinant transformers et fonctions de barrière de contrôle (control barrier functions, CBF) pour la sécurité en robotique, décrit dans un preprint publié sur arXiv (identifiant 2609.23896v1). Les CBF standards sont myopes : elles ne garantissent la sécurité qu'à l'instant présent, ce qui peut pousser le système vers la limite de son domaine sûr sans solution de contrôle sûre à l'étape suivante. Les approches de contrôle prédictif (MPC) corrigent ce défaut en imposant les contraintes sur un horizon glissant, mais exigent un modèle dynamique connu et la résolution d'un problème d'optimisation contraint à chaque pas, coûteux en temps réel. BarrierFormer contourne ce compromis avec un transformer causal qui encode l'historique observations-actions, génère de façon autorégressive une trajectoire prédictive via une tête de dynamique (remplaçant le modèle explicite), et produit une correction résiduelle à un contrôleur nominal via une tête d'action (remplaçant l'optimisation en ligne). Un critique de barrière évalue les violations de contraintes CBF le long de cette trajectoire prédite, tandis qu'un "professeur de sécurité" calcule des actions conformes aux contraintes servant de cibles de supervision à l'entraînement. À l'inférence, la politique n'effectue aucune optimisation en ligne. Sur des systèmes dynamiques linéaires et non linéaires, en 2D et 3D, pour des tâches de navigation sûre vers un objectif, les auteurs rapportent de meilleurs taux de sécurité et une latence d'inférence inférieure face à des méthodes par renforcement, par diffusion, par MPC et par transformers existantes. L'enjeu dépasse l'exercice académique : c'est la question de savoir si des politiques apprises peuvent offrir des garanties de sécurité de type prédictif sans le coût de calcul du MPC classique, condition nécessaire pour déployer du contrôle sûr en temps réel sur des robots mobiles ou des bras manipulateurs à ressources de calcul limitées. Un résultat positif à l'échelle validerait une piste alternative aux pipelines MPC-CBF traditionnels, aujourd'hui jugés trop lourds pour l'embarqué. Ce travail reste à ce stade une contribution de recherche évaluée en simulation, sans déploiement sur robot physique ni association à un produit commercial. Il s'inscrit dans la lignée des travaux sur les CBF et le MPC, et se positionne explicitement contre des architectures rivales par apprentissage par renforcement, modèles de diffusion et transformers antérieurs, sans toutefois préciser de calendrier de validation sur matériel réel.

RecherchePaper
1 source
TactSpace : apprendre un espace latent partagé enrichi par la physique pour le transfert sim-vers-réel tactile
2arXiv cs.RO 

TactSpace : apprendre un espace latent partagé enrichi par la physique pour le transfert sim-vers-réel tactile

Une équipe de recherche a publié sur arXiv (identifiant 2606.18959) TactSpace, un cadre d'apprentissage de représentations multi-modales conçu pour résoudre l'un des verrous majeurs de la manipulation robotique : le transfert sim-to-real des capteurs tactiles. Le problème est structurel : les simulateurs actuels sont incapables de reproduire fidèlement la mécanique de déformation et de transduction des capteurs tactiles physiques, rendant inutilisables en conditions réelles les politiques entraînées en simulation. TactSpace contourne ce problème en alignant des modalités tactiles hétérogènes dans un espace latent partagé, sans jamais avoir besoin de simuler le signal brut du capteur. Des encodeurs spécifiques à chaque modalité projettent des observations aussi différentes que la profondeur de pénétration simulée et la capacitance mesurée sur un capteur réel dans un embedding commun. L'entraînement combine des objectifs de reconstruction croisée et d'alignement contrastif. Évalué sur trois tâches, identification de formes d'indenteur, prédiction de force et reconstruction géométrique, le système entraîné exclusivement en simulation transfère directement sur des mesures réelles sans fine-tuning : zéro-shot. Les gains mesurés atteignent 16,7 % de réduction d'erreur en prédiction de force et 45,8 % en reconstruction de forme par rapport aux baselines. Ces résultats adressent un goulot d'étranglement critique pour l'ensemble de la robotique de manipulation dextre. Le tactile est indispensable pour les tâches d'assemblage fin, de tri délicat ou de manipulation d'objets déformables, segments où les bras industriels classiques butent faute de retour de contact fiable. Jusqu'ici, la difficulté à simuler correctement les capteurs tactiles forçait soit à collecter massivement des données réelles, coûteuses et lentes, soit à se passer du tactile. TactSpace propose une troisième voie : accepter que simulation et réalité restent physiquement dissemblables, et apprendre malgré tout des représentations invariantes aux modalités mais riches en information de contact. La publication accompagne le code d'une implémentation Warp-based du simulateur tactile pénalité intégrée à Isaac Lab, la plateforme de simulation physique de NVIDIA, ce qui ouvre la génération de données tactiles scalable à la communauté. Le contexte de cette recherche s'inscrit dans une effervescence autour des capteurs tactiles à haute résolution, portée notamment par GelSight (MIT, aujourd'hui GelSight Inc.), DIGIT (Meta AI) et les capteurs capacitifs embarqués dans plusieurs plateformes humanoïdes. Isaac Lab, qui sert de base à ce travail, est devenu un standard de facto pour l'entraînement de politiques robotiques en simulation, utilisé par Figure, 1X et Agility entre autres. TactSpace reste à ce stade un preprint non évalué par les pairs, sans déploiement annoncé sur plateforme physique commerciale. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation réelles bout-en-bout et une intégration dans des pipelines Vision-Language-Action (VLA) où le retour tactile pourrait renforcer la robustesse en conditions industrielles.

RecherchePaper
1 source
Avant le point de bascule : perception active guidée par la force pour estimer le centre de masse 3D sans connaître la forme
3arXiv cs.RO 

Avant le point de bascule : perception active guidée par la force pour estimer le centre de masse 3D sans connaître la forme

Un bras robotique doté d'un capteur de force et de couple à six axes peut désormais estimer le centre de masse en 3D d'un objet inconnu sans jamais le saisir, grâce à une méthode publiée le 14 septembre 2026 sur arXiv (arXiv:2609.12894v1). Le procédé repose sur un test de basculement sous-critique : le manipulateur exerce une poussée quasi-statique en hauteur puis relâche l'objet selon un cycle de poussée-retrait, en enregistrant les couples et les angles pendant l'inclinaison. Cette alternance mitige les biais de friction qui faussaient les méthodes précédentes et permet d'ajuster les paramètres physiques à partir de la seule trajectoire observée. Un mécanisme de marge de sécurité empêche l'objet de basculer complètement pendant l'expérience. Testée sur des objets de formes variées, sans modèle CAO ni connaissance géométrique préalable, la méthode restitue la masse, la hauteur du centre de masse et l'angle critique de basculement avec une erreur relative inférieure à 5 % dans tous les cas étudiés. Pour l'industrie robotique, ce résultat s'attaque à un verrou concret de la manipulation non préhensile et de la préhension d'objets difficiles : les robots ignorent aujourd'hui la répartition interne de masse des objets qu'ils manipulent, ce qui limite les manipulations sûres d'objets irréguliers, mal équilibrés ou impossibles à saisir directement (bacs de tri, colis logistiques, pièces industrielles asymétriques). Une estimation fiable du centre de masse en amont d'une prise permet d'ajuster la trajectoire, la force appliquée et l'angle d'approche, réduisant les risques de chute ou de basculement incontrôlé lors du déplacement. C'est un apport pertinent pour les intégrateurs en logistique et manutention, où l'AMR ou le bras collaboratif doit gérer des charges hétérogènes sans base de données préalable sur chaque objet. Cette approche s'inscrit dans la lignée des travaux sur la perception active et l'estimation des paramètres inertiels par interaction physique, un axe de recherche distinct de la perception purement visuelle (VLA, reconnaissance de forme par caméra), qui échoue souvent face à des objets opaques en termes de répartition de masse. L'étude, menée avec un bras manipulateur standard équipé d'un capteur six axes, ne précise pas de partenaire industriel ni de calendrier de transfert commercial ; il s'agit à ce stade d'une validation expérimentale en laboratoire, pas d'un déploiement produit. Les auteurs positionnent ce travail comme un prérequis technique pour des applications futures de tri robotisé et de préhension adaptative, sans annoncer de pilote industriel concret pour l'instant.

RecherchePaper
1 source
Affinement épars guidé par l'incertitude pour les politiques Action Chunking Transformer
4arXiv cs.RO 

Affinement épars guidé par l'incertitude pour les politiques Action Chunking Transformer

Une équipe de chercheurs propose Uncertainty-Guided Refinement (UGR), un raffinement ciblé pour les politiques de manipulation robotique à décodage d'actions par segments, présenté dans un article arXiv (2609.15840, soumission du 15 septembre 2026). Le modèle prédit d'abord un segment d'actions complet, estime une incertitude par instant à partir des états cachés de cette prédiction initiale, puis corrige uniquement les pas de temps les plus incertains via un masque binaire, grâce à une branche d'incertitude découplée du prédicteur principal. Sur cinq tâches de manipulation bi-bras du benchmark simulé RoboTwin, UGR obtient le meilleur taux de réussite sur quatre tâches sur cinq et améliore la référence ACT (Action Chunking Transformer) de jusqu'à 13 points de pourcentage en absolu, devançant en comparaison un raffinement complet du segment ou un raffinement par blocs non ciblé. L'intérêt tient au constat que les erreurs de ces politiques se concentrent sur une poignée d'instants critiques plutôt que sur l'ensemble du segment, ce qui rend un raffinement uniforme coûteux en calcul et mal ciblé. En ne corrigeant que les instants jugés incertains, UGR pourrait réduire la charge de calcul à l'inférence sans sacrifier la précision, un arbitrage qui intéresse directement les intégrateurs déployant des politiques vision-langage-action sur des bras bi-manuels ou humanoïdes à ressources limitées. Le résultat montre aussi qu'un signal d'incertitude par instant peut guider activement une correction plutôt que rester un simple indicateur passif, une piste utile pour des architectures à grande échelle comme Pi-0, GR00T N2 ou Helix. La démonstration reste néanmoins limitée à un benchmark simulé et à la référence ACT, sans test sur robot physique ni comparaison à un modèle VLA commercial. Le travail s'inscrit dans la lignée de l'Action Chunking Transformer, introduit en 2023 par le projet ALOHA de Stanford et devenu une référence pour l'apprentissage par imitation en manipulation bi-bras, depuis repris dans des politiques de diffusion et des modèles VLA plus récents. RoboTwin, utilisé pour l'évaluation, sert de banc d'essai standard pour ce type de politiques sur des tâches bi-manuelles simulées. Publié sans affiliation industrielle ni annonce de déploiement, l'article relève de la recherche amont : aucun pilote ni calendrier commercial n'est mentionné, la suite logique étant une validation sur matériel réel et une intégration éventuelle dans des piles de contrôle VLA plus larges, terrain où Physical Intelligence, NVIDIA ou Figure concentrent aujourd'hui leurs efforts.

RecherchePaper
1 source