Aller au contenu principal
RecherchearXiv cs.RO 

CALM : manipulation de liaison alignée sur le courant pour soulever des objets surdimensionnés à bras unique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente CALM (Current-Aligned Link Manipulation), un framework publié sur arXiv en septembre 2026 sous la référence 2609.29017v1, qui permet à un bras robotique unique de soulever des objets surdimensionnés en mobilisant tout le bras, avant-bras et coude compris, et pas seulement son effecteur terminal. La méthode combine trois politiques entraînées en simulation avec des informations privilégiées, couvrant le repositionnement, la préhension et le levage, qu'un routeur de stade enchaîne pour produire des démonstrations complètes de la tâche. Le transfert vers le matériel réel repose sur un "causal current mapper", un module qui prédit le courant moteur physique à partir des historiques articulaires simulés, afin d'aligner l'observation du courant entre simulation et robot réel. Une politique étudiante unique apprend ensuite à partir de ces démonstrations en n'utilisant que des capteurs réellement déployables, puis est affinée par DAgger. Résultat annoncé: 76,2% de réussite en simulation (762 essais sur 1000) et 73,3% sur robot physique (22 essais sur 30) pour la tâche complète de levage séquentiel d'objets surdimensionnés.

Ce travail cible un angle mort de la manipulation robotique actuelle: la plupart des bras industriels et humanoïdes ne saisissent qu'avec leur pince ou effecteur, ce qui limite la taille et le poids des objets manipulables, contrairement à l'humain qui cale un objet encombrant contre l'avant-bras ou l'épaule. En utilisant le courant moteur comme substitut à un retour tactile coûteux pour estimer la charge de contact le long du bras, CALM propose une piste pour réduire l'écart sim-to-real sur la dynamique de contact et des actionneurs, un obstacle classique qui fait échouer en conditions réelles des politiques pourtant efficaces en simulation. Le taux de 73,3% sur seulement 30 essais physiques reste un résultat de laboratoire préliminaire, à confirmer sur un échantillon plus large avant toute extrapolation vers un usage industriel en logistique ou en entrepôt.

L'abstract ne précise ni les auteurs, ni leur affiliation, ni le type de bras utilisé pour les essais physiques, et ne mentionne aucun acteur français ou européen du secteur. Le papier s'inscrit dans la lignée des méthodes de distillation de politique enseignant-élève, déjà répandues en locomotion pour robots quadrupèdes et humanoïdes, appliquées ici à la manipulation de contact riche sur horizon long. Aucun calendrier de déploiement, partenariat industriel ou suite commerciale n'est annoncé à ce stade: il s'agit d'une contribution de recherche académique, non d'un produit ni d'un pilote en conditions réelles.

À lire aussi

Compréhension vidéo découplée centrée sur les objets pour la génération de commandes de manipulation robotique
1arXiv cs.RO 

Compréhension vidéo découplée centrée sur les objets pour la génération de commandes de manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.16470) un framework de compréhension vidéo orienté objets, conçu pour traduire automatiquement des démonstrations gestuelles en commandes exécutables par un bras robotique, sans passer par une syntaxe de programmation classique. La méthode combine des modules TSM (Temporal Shift Module) pour la classification spatio-temporelle d'actions avec un algorithme original de sélection d'objets qui identifie, dans chaque séquence, les objets fonctionnellement pertinents via trois critères : classification de rôle par trajectoire, détection de flou, et minimisation de chevauchements. Les objets retenus sont ensuite analysés par des VLMs (Vision-Language Models) pour la reconnaissance de catégorie et la généralisation zero-shot. Évalué sur une version modifiée du benchmark Something-Something V2, le système atteint 86,79 % de précision en classification d'actions, un score BLEU-4 de 0,337 sur des objets connus et 0,261 sur des objets inédits, soit des gains respectifs de +80,2 % et +143,9 % face au meilleur baseline spécialisé. Sur METEOR et CIDEr, les gains montent à +157,9 % et +171,7 % pour les objets inconnus. Ce résultat est notable pour deux raisons distinctes. D'abord, la généralisation sur des objets non vus durant l'entraînement, qui est précisément le point de rupture habituel des systèmes task-specific : un robot industriel déployé dans un environnement variable ne peut pas être ré-entraîné pour chaque référence produit. Ensuite, l'architecture modulaire découplée (reconnaissance d'action d'un côté, identification d'objet de l'autre) facilite la maintenance et le débogage en production, à l'inverse des architectures bout-en-bout opaques. Sur le papier, ce type de système pourrait réduire la dépendance à la téléopération manuelle pour constituer des datasets de manipulation, un coût majeur pour les déploiements à grande échelle. Il s'agit ici d'un preprint académique, pas d'un produit validé en environnement réel : les métriques sont mesurées sur un benchmark vidéo, pas sur un robot physique, ce qui laisse entier le sim-to-real gap. Le benchmark Something-Something V2 reste un cadre contrôlé, éloigné du désordre d'un atelier de production. Ce travail s'inscrit dans un mouvement plus large de recherche sur les VLA (Vision-Language-Action models), où des acteurs comme Physical Intelligence (pi), Google DeepMind ou le MIT tentent de résoudre exactement ce problème : faire apprendre un robot par observation vidéo plutôt que par démonstration manuelle coûteuse. La prochaine étape naturelle serait une validation sur hardware réel avec un bras collaboratif standard (UR, Franka), ce que le papier ne documente pas encore.

RechercheOpinion
1 source
Glissement d'objets par manipulation des pieds sur un robot bipède à roues avec contrôle hiérarchique
2arXiv cs.RO 

Glissement d'objets par manipulation des pieds sur un robot bipède à roues avec contrôle hiérarchique

Des chercheurs ont publié sur arXiv (arXiv:2606.19233, juin 2026) un framework de contrôle hiérarchique permettant à des robots bipèdes à roues d'effectuer des tâches de manipulation d'objets au sol à l'aide de leurs membres inférieurs motorisés, une capacité baptisée "pédimanipulation mobile". Le système repose sur un contrôleur prédictif non linéaire (NMPC) construit sur un modèle dynamique simplifié à trois corps rigides (TRB), intégrant explicitement le degré de liberté en roulis de hanche et plusieurs modes de contact roue-sol. En expérimentation réelle, le robot a récupéré un objet de 1 kg coincé sous un bureau et déplacé latéralement un objet de 4 kg sur une distance de 0,228 m via une motion de type "scooting". Deux primitives de mouvement ont été validées sur hardware : scooting (poussée frontale par rotation des roues) et lateral sliding (déplacement latéral par pas de côté). L'intérêt industriel de cette approche réside dans sa réutilisation du train roulant comme effecteur de manipulation, sans bras supplémentaire ni outil dédié. Le NMPC régule simultanément la locomotion et les forces d'interaction, ce qui signifie que le robot maintient son équilibre tout en exerçant un effort contrôlé sur l'objet, un problème de couplage non trivial. Le planificateur de trajectoire intègre les transitions adhérence-glissement (stick-slip) dans le contact sol-objet, un phénomène souvent ignoré dans les démos en simulation mais critique en conditions réelles. C'est un résultat concret qui réduit le demo-to-reality gap sur la manipulation au sol, habituellement dominée par les manipulateurs à bras. Les robots bipèdes à roues constituent une architecture émergente entre AMR classiques et humanoïdes complets : Agility Robotics (Digit), Boston Dynamics (Spot avec extension roues dans certaines configs), et des plateformes académiques comme le Cassie de l'Oregon State University ont popularisé cette morphologie. Ce travail s'inscrit dans un courant de recherche sur la pédimanipulation, utiliser les jambes comme manipulateurs, que l'on retrouve aussi sur quadrupèdes (ANYmal, Go2). La prochaine étape probable est l'extension à des objets non rigides ou à des surfaces non planes, ainsi que l'intégration de perception pour fermer la boucle en environnement non structuré.

RecherchePaper
1 source
Au-delà de la sémantique liée aux points : champs sémantiques centrés sur l'objet pour une manipulation généralisable
3arXiv cs.RO 

Au-delà de la sémantique liée aux points : champs sémantiques centrés sur l'objet pour une manipulation généralisable

Un nouvel article publié sur arXiv (référence 2607.03163v1) propose une méthode pour améliorer la manipulation robotique generalisable en dotant les nuages de points 3D d'une compréhension sémantique stable des parties fonctionnelles d'un objet, poignées, têtes d'outils, ouvertures, zones de préhension. Les nuages de points bruts capturent la géométrie mais pas la sémantique, et l'échantillonnage varie selon le point de vue, le capteur ou l'instance d'objet observée. Les auteurs introduisent un champ sémantique continu et centré sur l'objet, entraîné à partir de modèles d'objets annotés par parties, qui associe à toute position 3D interrogée un embedding sémantique conscient de la fonction de la partie concernée. Une fois entraîné, ce champ est figé et sert à générer des nuages de points sémantiques utilisés comme conditionnement au niveau de l'objet pour des politiques de manipulation. Les tests, menés sur les tâches de simulation RoboTwin ainsi que sur de la manipulation bimanuelle réelle, montrent une amélioration des performances par rapport aux approches de référence: nuage de points brut, lifting de features 2D vers la 3D, et features ponctuelles 3D discrètes. L'enjeu dépasse le simple gain de précision. Pour l'industrie de la manipulation robotique et les concepteurs de politiques de type VLA (vision-language-action), le vrai problème n'est pas de reconnaître un objet mais de savoir où et comment le saisir de façon fiable, quel que soit l'angle de vue ou l'exemplaire précis rencontré. En rendant la sémantique indépendante de l'échantillonnage observé, cette approche s'attaque directement à un point faible connu des pipelines actuels: la fragilité des indices sémantiques ponctuels quand la scène ou le capteur changent. C'est un argument de plus dans le débat sur la généralisation réelle des politiques de manipulation, un enjeu central alors que le secteur cherche à dépasser les démonstrations en environnement contrôlé. Ce travail s'inscrit dans la lignée des efforts pour enrichir la perception 3D en robotique, après les méthodes de projection de features 2D issues de modèles de vision-langage et les représentations ponctuelles 3D discrètes, deux approches dont l'article démontre les limites en comparaison directe. RoboTwin, la plateforme de simulation utilisée, sert de banc d'essai standard pour ce type d'évaluation comparative dans la communauté. Les auteurs mettent à disposition une page projet dédiée, laissant présager la publication du code et des modèles pour permettre une réplication et une adoption plus large par la communauté de recherche en manipulation robotique.

RecherchePaper
1 source
IA physique : modèle du monde 3D fondé sur les principes physiques pour la manipulation d'objets dynamiques (PhysMani)
4arXiv cs.RO 

IA physique : modèle du monde 3D fondé sur les principes physiques pour la manipulation d'objets dynamiques (PhysMani)

Des chercheurs présentent PhysMani, un framework qui couple un modèle du monde en Gaussiennes 3D fondé sur la physique avec un modèle de politique d'action anticipatif, pour la manipulation d'objets rapides et dynamiques en environnement 3D non structuré. Le modèle du monde apprend un champ de vitesse gaussien à divergence nulle par optimisation en ligne, ce qui permet une prédiction rapide et physiquement cohérente de la dynamique future de la scène. Le modèle de politique intègre ensuite ces prédictions via un module d'attention croisée à base de tokens appris. Les auteurs introduisent également PhysMani-Bench, un nouveau benchmark de manipulation dynamique composé de 16 tâches, et rapportent un taux de réussite supérieur à des baselines solides, aussi bien en simulation que lors d'expériences avec un robot réel. Le papier, publié sur arXiv (2607.01938), ne précise ni la plateforme robotique utilisée ni de métriques chiffrées exactes (taux de réussite, temps de cycle, charge utile), ce qui en fait à ce stade une contribution de recherche plutôt qu'un produit ou un déploiement commercial. Pour l'industrie robotique, ce travail s'attaque à un point faible connu des modèles vision-langage-action (VLA) et des world models existants: leur difficulté à représenter une géométrie 3D précise et à anticiper une dynamique physiquement plausible pour des objets en mouvement rapide. La manipulation de cibles dynamiques, objets qui tombent, glissent ou sont lancés, reste l'un des angles morts des démonstrations actuelles de bras robotiques et d'humanoïdes, la plupart des systèmes généralistes étant surtout validés sur de la manipulation quasi statique. Si les résultats de PhysMani se confirment au-delà du cadre académique, cela ouvrirait une piste pour réduire l'écart entre démonstration en laboratoire et usage réel en logistique ou en industrie, où la prise d'objets en mouvement est fréquente sur convoyeur ou en tri à cadence élevée. Mais tant que l'étude reste limitée à un benchmark maison et sans comparaison indépendante, il s'agit d'une preuve de concept à confirmer, pas d'une solution prête à intégrer. Ce travail s'inscrit dans la lignée des world models 3D construits sur des représentations en Gaussiennes, une technique héritée du rendu de scènes et de plus en plus utilisée en robotique pour modéliser des environnements denses. Ces approches se positionnent face aux modèles VLA de bout en bout entraînés sur de larges corpus de démonstrations, popularisés par des acteurs comme Physical Intelligence avec Pi-0 ou NVIDIA avec GR00T N2, ainsi qu'aux world models déjà exploités par d'autres équipes de recherche en manipulation. Aucun partenaire industriel ni acteur français ou européen n'est mentionné dans l'abstract. La suite logique pour les auteurs serait d'étendre le benchmark, de tester la méthode sur des plateformes robotiques variées, et de la comparer directement aux VLA généralistes pour situer PhysMani face aux solutions déjà commercialisées.

RechercheOpinion
1 source