Aller au contenu principal
RecherchearXiv cs.RO 

De la langue au mouvement : intégration de trajectoires par pile focale conditionnée par la tâche pour robots microscopiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs décrivent, dans un preprint arXiv (2610.12241v1), un cadre qui relie une instruction en langage naturel à des trajectoires physiques pour des robots microscopiques. Le système traduit la consigne en opérateurs géométriques contraints. Il réutilise une perception « open-vocabulary » figée, sans réentraînement. Il n'agrège pas les images : il intègre des trajectoires 2D extraites plan par plan dans une pile focale, là où chaque plan est localement net. Cette intégration repose sur une pondération par confiance et sur la programmation dynamique. Une géométrie multi-vues calibrée convertit ensuite les chemins 2D en exécution physique. Les tests de reconfiguration (changement de prompt, pièces jamais vues, géométrie modifiée) donnent une erreur quadratique moyenne (RMSE) de 6,30 à 6,59 pixels. La configuration « zéro nouvelle annotation » demande 15 minutes de mise en place. Un U-Net spécifique à chaque pièce, entraîné avec 20 à 100 annotations, en demande entre 72 et 165.

Sur neuf combinaisons pièce/éclairage, l'intégration dans l'espace des trajectoires fait passer le RMSE de 14,41 à 6,28 pixels (-56,4 %) par rapport à la fusion multi-focus classique, qui construit d'abord une image nette. L'erreur au 95e percentile baisse de 20,07 à 8,13 pixels (-59,5 %). Une ablation isole l'apport de la confiance et celui de la sélection chemin par chemin. Dans des expériences robotiques jugées représentatives par les auteurs, la couverture de la région cible passe de 83,5 % à 92,9 %. La tâche de démonstration est la dépose de fluide (dispensing), qui laisse une trace physique mesurable. Les auteurs précisent que ce choix ne limite pas la méthode à cette tâche.

L'intérêt tient à l'ordre des opérations. En microscopie robotisée, la profondeur de champ très faible oblige à fusionner plusieurs plans focaux, et les artefacts de cette fusion se propagent jusqu'à la commande. Extraire le chemin avant de fusionner évite ce biais. Le gain de temps de mise en service, de plusieurs heures à un quart d'heure, concerne directement les intégrateurs d'assemblage de précision, par exemple l'optique, les microsystèmes ou l'électronique, où chaque référence de pièce impose aujourd'hui de réannoter des données. Il faut toutefois lire ces chiffres avec prudence. Les erreurs sont exprimées en pixels, sans conversion en microns dans le résumé. Aucune mesure de débit, de temps de cycle ou de fiabilité en production n'est annoncée. Neuf conditions de test et des expériences « représentatives » ne constituent pas une validation industrielle. La comparaison avec le U-Net porte sur le temps de préparation, pas sur la précision finale.

Ce travail s'inscrit dans la tendance qui consiste à réutiliser des modèles de perception pré-entraînés plutôt qu'à réentraîner par tâche, déjà dominante en manipulation macroscopique avec les modèles vision-langage-action (VLA). Il l'applique à l'échelle micro, où la géométrie et la mise au point sont des contraintes dures. Il s'agit d'un preprint de recherche, sans produit, sans partenaire industriel ni calendrier de déploiement annoncés. Les prochaines étapes à surveiller sont la validation sur d'autres tâches que la dépose de fluide, l'expression des erreurs en unités physiques et la reproduction par des tiers.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

FRAM : sélection de traits visuels guidée par la trajectoire pour manipulation robotique légère conditionnée au langage
1arXiv cs.RO 

FRAM : sélection de traits visuels guidée par la trajectoire pour manipulation robotique légère conditionnée au langage

Une équipe de recherche présente FRAM (Future Representation Action Model), un modèle vision-langage-action compact pour la manipulation robotique, dans une prépublication arXiv (2609.30965, fin septembre 2026). FRAM relie la trajectoire future de l'effecteur terminal à l'image courante : les coordonnées prédites servent de pointeurs spatiaux pour extraire les caractéristiques visuelles locales liées au mouvement. Les étiquettes de trajectoire sont générées automatiquement à partir des démonstrations et de la géométrie caméra, sans annotation manuelle. Avec 138,7 millions de paramètres, encodeur de langage figé compris, FRAM atteint 92,2 % de réussite moyenne sur les quatre suites LIBERO, contre 94,2 % pour Pi-0 de Physical Intelligence (3,3 milliards de paramètres, soit 24 fois plus), et 67,3 % sur LIBERO-Plus sans entraînement additionnel. Sur un robot réel à deux bras UR5e, il empile des gobelets avec les seules caméras de poignet, en choisissant et en changeant de bras selon les besoins. Ce résultat contredit l'idée reçue que la performance des modèles vision-langage-action dépend d'abord de leur taille : FRAM approche les scores de Pi-0 avec une fraction de ses paramètres, ce qui allège le calcul embarqué et facilite un déploiement sur du matériel moins coûteux, un point clé pour les intégrateurs cherchant à s'affranchir du cloud. L'étiquetage automatique des trajectoires supprime aussi une annotation manuelle coûteuse, frein habituel au passage à l'échelle des données de démonstration. Les scores sur LIBERO-Plus et la démonstration sur robot réel apportent un élément de réponse, mesuré toutefois sur un nombre restreint de tâches, à la question récurrente de l'écart entre démonstrations en laboratoire et robustesse réelle. FRAM s'inscrit dans un champ dominé par la course à l'échelle, incarnée par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, et par des humanoïdes comme Optimus de Tesla ou Figure 03, qui misent sur des milliards de paramètres pour généraliser. Cette prépublication, dont le statut de relecture par les pairs n'est pas précisé, défend la direction inverse de politiques compactes et spécialisées. Aucun partenaire industriel ni plan de déploiement commercial n'est mentionné : les résultats restent limités à des benchmarks simulés et à un seul bras collaboratif en laboratoire. L'étape suivante logique consisterait à étendre l'approche à davantage de tâches, de robots et de configurations de caméras avant d'envisager une intégration en production.

RechercheActu
1 source
Guidage des modes au niveau de la trajectoire pour la planification de mouvement contrôlable de robots multiples par diffusion
2arXiv cs.RO 

Guidage des modes au niveau de la trajectoire pour la planification de mouvement contrôlable de robots multiples par diffusion

Une équipe de chercheurs publie sur arXiv (2609.36530) une méthode de planification de mouvement par modèles de diffusion, pensée pour conserver plusieurs solutions faisables tout en tenant compte d'indications grossières fournies en amont. Le principe est de guider la génération dans l'espace des trajectoires « propres », c'est-à-dire reconstruites à chaque pas de la diffusion inverse, plutôt que dans l'espace bruité. Cette trajectoire reconstruite sert d'espace commun pour deux types d'informations. Les coûts de planification, comme l'évitement d'obstacles, sont intégrés par raffinement à base de gradient. Un a priori partiel, par exemple un tronçon de trajectoire ou une région souhaitée, est injecté progressivement aux niveaux de bruit correspondants, avec une force de guidage décroissante au fil des pas. Pour plusieurs robots, il suffit d'ajouter un coût de collision entre agents. Le résumé annonce des essais sur des tâches mono et multi-robots, avec synthèse de trajectoires contrôlable, solutions faisables variées et coordination sûre. Il ne donne aucun chiffre : ni taux de succès, ni nombre de robots, ni temps de calcul, ni matériel utilisé. L'enjeu est technique mais concret pour la coordination de flottes. Un planificateur classique renvoie souvent une seule trajectoire, alors qu'un opérateur ou un système de supervision veut pouvoir dire « passe plutôt par ici » sans figer le résultat. Un guidage trop strict par l'a priori détruit la diversité qui fait l'intérêt des diffusions, et un guidage trop faible ignore l'intention de l'opérateur. Ici, le relâchement progressif de la contrainte cherche le compromis : l'a priori fixe le mode global de la solution dans les premières étapes, puis le modèle affine les détails librement. Pour un intégrateur d'AMR (robots mobiles autonomes) ou de cellules multi-bras, cela pourrait faciliter l'injection de règles de circulation ou de préférences humaines dans un planificateur génératif. Le résumé ne prouve pas que cela tienne hors laboratoire. Il ne dit rien des garanties de sécurité, de la latence en temps réel ni du passage à l'échelle avec le nombre d'agents, trois points décisifs pour un déploiement industriel. Ce travail s'inscrit dans la série de méthodes qui appliquent les modèles de diffusion à la planification de trajectoires, popularisée par des approches comme Diffuser et Diffusion Policy. Ces méthodes ajoutent du guidage par coût, mais restent en difficulté pour combiner des a priori partiels et de la multimodalité. Les alternatives classiques, comme la planification par échantillonnage, l'optimisation de trajectoire ou les approches par conflits pour le multi-agent, offrent davantage de garanties formelles mais peu de génération multimodale pilotable. Il s'agit d'une prépublication (v1) et rien n'indique à ce stade de code publié, de comparaison chiffrée ou de test sur robots réels. La suite logique serait une validation sur matériel, une comparaison avec les planificateurs multi-agents établis et une évaluation du coût de calcul.

RecherchePaper
1 source
Transformer Transformer : un modèle unifié pour la co-conception de robots conditionnée par le mouvement
3arXiv cs.RO 

Transformer Transformer : un modèle unifié pour la co-conception de robots conditionnée par le mouvement

Une équipe de recherche publie sur arXiv (2607.25798v1) un nouveau modèle baptisé Transformer Transformer, conçu pour la co-conception de robots conditionnée par le mouvement. L'idée : générer automatiquement des architectures robotiques complètes capables de suivre des trajectoires d'effecteur cibles issues de démonstrations humaines, tout en optimisant des fonctions de récompense définies par l'utilisateur. Le système repose sur les RoboTokens, une tokenisation unifiée des morphologies, états et actions des robots, qui permet à une seule architecture de diffusion transformer de fonctionner sur des espaces d'embodiment très différents : robots bimanuels à roues, quadrupèdes, humanoïdes. Plutôt que d'optimiser pour une récompense unique, le modèle agit comme un modèle de dynamique générique, dont les prédictions d'état et d'action servent ensuite à calculer des valeurs spécifiques à chaque objectif, via une procédure nommée Dynamics Self-Guidance qui guide la diffusion vers des designs à haute valeur. Preuve concrète : les chercheurs ont fabriqué une version optimisée de la plateforme ALOHA, réduisant l'erreur de suivi de trajectoire de plus de 70 % par rapport au design d'origine. L'intérêt pour le secteur tient à ce que la conception mécanique des robots reste largement découplée du contrôle et de l'apprentissage, alors que la performance en manipulation dépend fortement de l'embodiment. Un modèle capable d'optimiser en zero-shot pour des récompenses et trajectoires jamais vues, plus rapidement qu'une baseline évolutionniste, ouvre la voie à des cycles de co-conception matériel-logiciel beaucoup plus rapides pour les intégrateurs et les fabricants de bras ou de plateformes bimanuelles. C'est un signal supplémentaire que les architectures de type transformer/diffusion, déjà dominantes pour les politiques VLA, s'étendent maintenant à la conception physique elle-même, et pas seulement au contrôle. Le travail s'inscrit dans la lignée de la recherche sur la co-conception robotique, historiquement dominée par des algorithmes évolutionnistes coûteux en calcul et spécifiques à une seule récompense. ALOHA, plateforme bimanuelle open source popularisée par les travaux de Stanford et Google, sert ici de banc d'essai matériel concret plutôt que de simple simulation. Le papier ne précise pas de calendrier de déploiement industriel ni de partenaire, il s'agit à ce stade d'un résultat de recherche fraîchement publié, dont la portée reste à confirmer sur des espaces de conception plus larges.

RecherchePaper
1 source
SPECTRA : primitives de mouvement spectrales conditionnées par le contexte pour la généralisation des compétences robotiques
4arXiv cs.RO 

SPECTRA : primitives de mouvement spectrales conditionnées par le contexte pour la généralisation des compétences robotiques

Des chercheurs proposent SPECTRA (Spectral Movement Primitive, SMP), un framework d'apprentissage par imitation dans le domaine fréquentiel pour la manipulation robotique, décrit dans un article publié sur arXiv (2607.06978v1). Le principe consiste à représenter les démonstrations de trajectoire par des coefficients de Fourier tronqués sur horizon fini, plutôt que par des points temporels bruts. Une bande de fréquences basses, sélectionnée empiriquement, capture la géométrie dominante du mouvement, tandis que les harmoniques plus élevées, responsables d'une croissance disproportionnée des dérivées (vitesse, accélération, jerk), sont écartées. Un modèle GMM/GMR (mélange de gaussiennes avec régression) conditionné par le contexte et sensible au référentiel prédit les coefficients de la bande de tâche dans un repère canonique ; la trajectoire cartésienne obtenue est ensuite convertie en espace articulaire via cinématique inverse séquentielle. Un régulateur couplé en phase limite la progression temporelle demandée sans toucher aux coefficients spectraux, imposant ainsi les limites de vitesse et d'accélération articulaires tout en conservant le chemin de l'effecteur. Les auteurs valident l'approche sur plusieurs critères (reconstruction de la bande de tâche, robustesse à des démonstrations corrompues, généralisation hors distribution entre repères non vus, admissibilité dynamique en espace articulaire, préservation du chemin) et un déploiement réel sur un bras Franka Panda. Le problème que cible SPECTRA est concret pour tout intégrateur en apprentissage par imitation : les pipelines classiques apprennent une trajectoire en espace de tâche puis lui imposent après coup des limites d'exécution (filtrage, lissage, écrêtage, mise à l'échelle temporelle), ce qui déforme souvent le chemin de l'effecteur jugé critique pour la tâche, par exemple lors d'un versement, d'une insertion de pièce ou du suivi d'un contour précis. En couplant génération de trajectoire et régulation dynamique dès la conception, dans le domaine fréquentiel, SPECTRA évite cette distorsion a posteriori : les résultats rapportés montrent une réduction substantielle des violations dynamiques et du jerk, tout en préservant le chemin voulu pendant la régulation de phase. Pour la robotique industrielle, où les cycles de préhension et d'insertion tolèrent mal les à-coups mécaniques, cela offre une alternative aux primitives de mouvement dynamiques (DMP) classiques et aux méthodes de lissage a posteriori. Les primitives de mouvement existent depuis les Dynamic Movement Primitives (DMP), introduites il y a une vingtaine d'années et largement utilisées en apprentissage par imitation pour encoder des trajectoires robustes et reproductibles. SPECTRA s'en démarque en travaillant dans le domaine fréquentiel plutôt que temporel, et en couplant explicitement génération de tâche et contraintes d'exécution articulaire plutôt que de les traiter séparément. Le choix du Franka Panda comme plateforme de validation, un bras collaboratif conçu par l'allemand Franka Robotics (ex Franka Emika) très utilisé en recherche académique, ancre les travaux dans l'écosystème européen de manipulation robotique. L'article ne mentionne ni calendrier de transfert industriel ni partenariat commercial : il s'agit à ce stade d'une contribution de recherche évaluée en laboratoire, dont la suite logique serait une validation sur des tâches de manipulation plus complexes et une comparaison directe avec les approches DMP existantes.

UEImpact indirect: la validation s'appuie sur un bras Franka Panda, plateforme concue par l'allemand Franka Robotics, mais aucun partenariat, financement ou deploiement commercial en France/UE n'est mentionne.

RecherchePaper
1 source