Aller au contenu principal

Recherche — page 5

2264 articles · page 5 sur 46

Publications scientifiques en robotique : arXiv cs.RO, ICRA, IROS, Humanoids, CoRL — nouveaux algorithmes, benchmarks et datasets.

201arXiv cs.RO RecherchePaper

SplatCtrl : couplage perception-action via représentations de scène gaussiennes et contrôle robotique réactif

Des chercheurs présentent SplatCtrl, un système qui combine reconstruction 3D en temps réel et contrôle réactif de bras robotique pour éviter les collisions dans des environnements inconnus et changeants. Le framework s'appuie sur le 3D Gaussian Splatting, une technique de représentation de scène par nuages de gaussiennes 3D, et introduit une méthode hybride de filtrage voxel combinée à une relocalisation dynamique des gaussiennes, permettant de reconstruire la scène à partir de flux RGB-D tout en s'adaptant aux changements de l'environnement en continu. Pour le contrôle, les auteurs dérivent des fonctions de distance signée continues directement depuis les gaussiennes isotropes, ce qui fournit des estimations de probabilité de collision stables et différentiables, faisant le pont entre les champs de distance classiques et les représentations implicites modernes. Ces métriques sont ensuite injectées dans des fonctions de barrière de contrôle (control barrier functions), aboutissant à un couplage perception-action unifié capable de générer des mouvements fluides en réaction aux changements de scène. Le système a été validé en simulation, sur un robot physique réel, et dans un espace de travail partagé humain-robot. L'intérêt pour l'industrie tient à la promesse centrale du papier: rendre les bras manipulateurs, aujourd'hui performants surtout en environnement structuré et statique, capables d'opérer en sécurité dans des contextes dynamiques et partagés avec des humains, sans reprogrammation manuelle des trajectoires. Si les résultats se confirment à plus grande échelle, cela toucherait directement les intégrateurs industriels et logistiques confrontés à des cellules de travail non figées, ainsi que les applications de cobotique où la coexistence humain-robot impose une réactivité aux obstacles imprévus. C'est aussi un signal supplémentaire que le 3D Gaussian Splatting, initialement pensé pour le rendu photoréaliste, s'impose progressivement comme brique de perception robotique. Le travail s'inscrit dans une lignée de recherches récentes cherchant à exploiter le 3D-GS pour la robotique, au-delà de son usage d'origine en vision par ordinateur et rendu de scènes. L'article ne précise pas d'affiliation industrielle ni de partenaire de déploiement identifié: il s'agit d'une contribution de recherche académique publiée sur arXiv, sans indication de commercialisation ni de calendrier de transfert vers un produit. Les prochaines étapes attendues concernent le passage à l'échelle sur des scènes plus complexes et des tests prolongés en conditions réelles d'usine ou d'entrepôt.

1 source
202arXiv cs.RO 

CoDiMAD : distillation privilégiée par diffusion pour la coordination multi-robots sans communication

Des chercheurs proposent CoDiMAD (Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination), une méthode pour coordonner des robots en essaim sans qu'ils communiquent entre eux. Le principe repose sur trois étapes : d'abord entraîner un "oracle" privilégié qui voit l'état global du système via MAPPO, un algorithme d'apprentissage par renforcement multi-agents ; ensuite construire un jeu de données hors ligne associant observations locales de chaque robot et actions décidées par cet oracle ; enfin distiller ces connaissances dans des politiques décentralisées, chaque robot n'ayant accès qu'à ses propres capteurs, en les paramétrant comme des modèles de diffusion (DDPM, denoising diffusion probabilistic models) conditionnels plutôt que des réseaux déterministes classiques. Testée sur trois tâches coopératives, l'approche surpasse à la fois l'apprentissage multi-agents purement local et la distillation déterministe classique, avec une analyse théorique à l'appui. Le code doit être publié après acceptation de l'article, qui reste pour l'instant un preprint arXiv non encore évalué par les pairs. L'enjeu technique central est le problème du "mode-averaging" : une même observation locale (par exemple, voir un obstacle et un autre robot à proximité) peut correspondre à plusieurs configurations globales exigeant des actions coopératives très différentes. Une distillation déterministe classique moyenne ces possibilités et produit des actions invalides ou hésitantes, un défaut connu de l'apprentissage par imitation en environnement multimodal. En échantillonnant directement dans le processus inverse de diffusion, CoDiMAD choisit une action cohérente au lieu de la moyenner, ce qui est directement pertinent pour les flottes de robots mobiles autonomes (AMR) en entrepôt, les essaims de drones ou tout système devant rester fonctionnel en cas de perte de communication réseau. Cette approche s'inscrit dans deux lignées de recherche déjà établies : la distillation privilégiée enseignant-élève, popularisée en locomotion robotique pour transférer un savoir "avec triche" (accès à l'état complet) vers une politique embarquée limitée aux capteurs réels, et les politiques de diffusion en robotique, initialement développées pour la manipulation mono-robot (Diffusion Policy) et ici étendues au cas multi-agents décentralisé. Le travail reste à ce stade purement expérimental, sans déploiement sur robots physiques mentionné dans le résumé.

RecherchePaper
1 source
203arXiv cs.RO 

Sécurité piétonne empirique d'un robot mobile via un modèle prédictif de force sociale

Le fil d'actualité de l'IA. Voici le résumé demandé : Une équipe de recherche a développé deux nouvelles variantes de modèle de force sociale pour la navigation robotique en présence de piétons : le PSFM (Predictive Social Force Model) et le PTSFM (Predictive TSFM), qui intègrent des vecteurs de force sociale prédits sur un horizon temporel fini. Ces modèles ont été implémentés sur un robot mobile non holonome et testés lors d'essais expérimentaux avec des volontaires placés dans un scénario de croisement face à face. Quatre variantes ont été comparées : le SFM classique, le TSFM (qui intègre le temps de collision projeté, ou PTTC), et les deux nouvelles versions prédictives PSFM et PTSFM. La sécurité objective a été mesurée via le PTTC minimum, la vitesse moyenne, la distance minimale, la distance latérale et la courbure maximale de trajectoire, tandis que la sécurité subjective a été évaluée par des questionnaires post-interaction sur échelle de Likert portant sur le confort, la fluidité, la pertinence de la distance et l'adéquation de la vitesse. Les résultats confirment que l'intégration du PTTC améliore effectivement les métriques de sécurité objective par rapport au SFM classique. En revanche, l'apport spécifique de la prédiction reste limité : il n'est visible que sur certains sous-indicateurs, et les tests statistiques de Mann-Whitney ne révèlent aucune différence significative dans les évaluations subjectives des participants, même si certains perçoivent des mouvements plus fluides et une vitesse jugée plus sûre avec les variantes prédictives. Pour les concepteurs de robots destinés à partager les trottoirs avec des piétons, livraison, robots de service ou plateformes de recherche, ce résultat suggère qu'ajouter de la complexité prédictive au modèle de force sociale n'est pas forcément le levier le plus rentable : le gain principal en sécurité vient déjà de l'intégration du temps de collision projeté, pas de l'horizon de prédiction. Ce travail s'inscrit dans la lignée des modèles de force sociale (SFM), une approche calculatoirement légère et interprétable largement utilisée pour la navigation en temps réel dans des environnements dynamiques, et prolonge des travaux récents ayant montré l'intérêt du PTTC via le TSFM. L'étude reste toutefois limitée à un scénario à piéton unique en face à face ; ses auteurs notent que l'effet de la prédiction pourrait se révéler différemment dans des scénarios de foule plus denses, une piste laissée pour des travaux futurs.

RecherchePaper
1 source
204arXiv cs.RO 

Coordination de comportements implicites à partir de démonstrations de sous-tâches non étiquetées pour des tâches de réarrangement

Une nouvelle publication arXiv (2607.09234v1, soumise en juillet 2026) propose une approche alternative pour les tâches de réarrangement robotique à long horizon, ces missions où un robot doit déplacer plusieurs objets pour réorganiser un environnement. Plutôt que de découper la tâche en compétences prédéfinies avec des étiquettes, des frontières et une logique de commutation propre à chaque scénario, les auteurs formulent le problème comme une coordination implicite de comportements appris directement depuis des démonstrations de sous-tâches non étiquetées. Le système apprend des comportements de type "compétences" à partir de données comportementales mixtes, puis les coordonne via une sélection d'actions guidée par une fonction de valeur (un critique). La méthode est testée sur les tâches de réarrangement de Habitat, la plateforme de simulation d'IA incarnée. Sans plan de tâche oracle ni démonstrations complètes étiquetées par compétence, elle dépasse des méthodes d'imitation spécifiques à la tâche sur les scénarios les plus complexes et s'approche des performances d'un système oracle combiné à des compétences apprises par clonage comportemental. L'enjeu dépasse le cadre académique. Les pipelines robotiques actuels reposent largement sur des architectures de planification explicite, coûteuses à concevoir et difficiles à faire évoluer dès que le nombre de comportements ou l'horizon temporel augmente, un frein connu pour les intégrateurs qui veulent déployer des robots polyvalents en entrepôt ou en usine. En montrant qu'une coordination apprise, sans étiquetage de compétences ni planificateur oracle, peut tenir la comparaison, ces travaux appuient l'hypothèse qu'une abstraction explicite des compétences n'est pas indispensable, un argument qui rejoint la tendance actuelle vers des modèles vision-langage-action génériques plutôt que des pipelines modulaires rigides. Ce travail s'inscrit dans la lignée des recherches en apprentissage par imitation à partir de données comportementales hétérogènes, un axe où Habitat (développé par Meta AI) sert de banc d'essai standard pour l'IA incarnée. Les auteurs montrent aussi, via des études d'ablation, que la sélection de candidats guidée par le critique est déterminante pour gérer des comportements multimodaux, et que la méthode continue de bien se comporter quand le répertoire de comportements et l'horizon de la tâche s'agrandissent, contrairement aux approches d'imitation spécifiques à la tâche. Aucun déploiement matériel réel n'est mentionné à ce stade, l'évaluation restant purement en simulation.

RecherchePaper
1 source
205arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
206arXiv cs.RO 

Re³Sim : générer des données de simulation photoréalistes en 3D par transfert réel-vers-simulation pour la manipulation robotique

Cette annonce arrive du côté recherche académique plutôt que de l'industrie commerciale : une équipe présente RE³SIM, un système de simulation photoréaliste en 3D destiné à combler l'écart entre entraînement simulé et déploiement réel en robotique manipulatrice. Publié sur arXiv (version 4, remplaçant une précédente), le papier décrit un pipeline qui reconstruit fidèlement des scènes réelles grâce à des techniques avancées de reconstruction 3D et de rendu neuronal, permettant un rendu en temps réel de caméras virtuelles multi-angles au sein d'un simulateur physique. En s'appuyant sur des informations privilégiées pour générer efficacement des démonstrations expertes en simulation, puis en entraînant des politiques robotiques par apprentissage par imitation, les chercheurs rapportent un taux de réussite moyen supérieur à 58% en transfert "zero-shot" vers le réel, c'est-à-dire sans aucune donnée réelle utilisée pour l'entraînement, uniquement des données simulées. Ils ont aussi constitué un jeu de données de simulation à grande échelle pour tester la généralisation des politiques apprises sur des objets variés. Le résultat compte parce qu'il s'attaque directement à l'un des goulots d'étranglement les plus coûteux du secteur : la collecte de données réelles pour entraîner des robots manipulateurs, qui exige des opérateurs qualifiés et du matériel onéreux. Si le fossé sim-to-real (géométrique et visuel) peut être réduit de manière fiable grâce à des reconstructions photoréalistes plutôt qu'à des environnements simulés génériques, cela change la donne pour les intégrateurs et les équipes de R&D qui cherchent à multiplier les scénarios d'entraînement sans multiplier les essais physiques. Un taux de 58% en zero-shot reste toutefois modeste comparé aux standards de fiabilité industrielle, et mérite d'être lu comme une preuve de concept académique plutôt qu'une solution prête à l'emploi pour la production. RE³SIM s'inscrit dans la lignée des travaux récents sur les politiques vision-langage-action (VLA) et les pipelines d'apprentissage par imitation, un axe de recherche également poursuivi par des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T). La démarche real-to-sim-to-real, où l'on capture d'abord le monde réel avant de simuler dessus, distingue cette approche des simulateurs purement synthétiques et pourrait influencer les futurs outils de génération de données pour l'entraînement de robots. Le code et des démonstrations sont disponibles sur le site du projet (re3sim.github.io), signe que l'équipe cherche une adoption élargie par la communauté robotique plutôt qu'une simple publication isolée.

RecherchePaper
1 source
207arXiv cs.RO 

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée

Des chercheurs publient sur arXiv (arXiv:2607.09185v1) un nouveau framework baptisé CD-LAM, destiné à améliorer les modèles du monde conditionnés par l'action (ACWM), ces systèmes qui simulent les observations futures d'un robot en fonction des actions qu'il pourrait exécuter. Ces modèles reposent sur des données massives étiquetées avec les actions correspondantes, coûteuses à collecter en conditions réelles. Pour contourner ce goulot d'étranglement, les modèles d'action latente (LAM) infèrent des actions directement depuis des vidéos non étiquetées, mais souffrent d'un biais connu : entraînés uniquement sur des objectifs de reconstruction, ils mélangent la dynamique liée à l'action avec des éléments visuels non pertinents comme l'arrière-plan ou des objets non manipulés. CD-LAM introduit trois objectifs de fine-tuning complémentaires, une reconstruction centrée sur le corps du robot, un apprentissage contrastif centré sur l'action, et une calibration de l'espace latent, pour produire des représentations plus fidèles et non dégénérées. Testé sur des backbones ACWM de 2 et 14 milliards de paramètres, CD-LAM améliore la contrôlabilité des actions latentes, le suivi des commandes en aval, la fidélité visuelle, et ne nécessite que 6 000 étapes de fine-tuning, soit plus de 12 fois moins de mises à jour d'adaptation que la méthode de référence. L'enjeu dépasse la seule performance technique : réduire d'un facteur 12 le coût d'adaptation d'un modèle du monde à un nouveau robot ou une nouvelle tâche s'attaque directement au principal frein à l'échelle des politiques robotiques actuelles, la rareté des données actions-étiquetées réelles. Ce type de travail nourrit la course aux modèles VLA (vision-language-action) comme Pi-0, GR00T N2 ou Helix, où la capacité à généraliser à partir de peu de démonstrations conditionne la viabilité commerciale des humanoïdes. Il faut toutefois distinguer clairement ce résultat, une contribution de recherche à l'échelle du benchmark, d'un déploiement en production. CD-LAM s'inscrit dans la lignée des travaux récents sur les modèles d'action latente, une direction de recherche née du constat que l'étiquetage manuel des actions robotiques ne passera jamais à l'échelle des humanoïdes commerciaux. L'abstract ne cite ni laboratoire ni entreprise précise, signe d'une publication académique classique plutôt que d'une annonce produit. Les auteurs évoquent des pistes de suite via l'adaptation à davantage de plateformes robotiques et de backbones plus larges, sans calendrier de déploiement communiqué.

RecherchePaper
1 source
208arXiv cs.RO 

AgenticFocus : synthèse de réalité mixte préservant les objets à partir de vidéo FPV humaine pour l'apprentissage humanoïde dextérique

AgenticFocus, un pipeline de synthèse en réalité mixte, transforme des vidéos ordinaires filmées à la première personne (FPV) par des humains en démonstrations exploitables pour l'apprentissage de robots humanoïdes. Présenté dans un article arXiv publié cette semaine (2607.08857), le système s'attaque à trois obstacles récurrents des pipelines existants: l'occlusion des objets par la main pendant la manipulation, les mouvements simplifiés à l'excès dans les jeux de données synthétiques, et la dépendance à du matériel de capture spécialisé coûteux. Concrètement, AgenticFocus reconstruit la géométrie des objets masqués par la main, restitue le mouvement complet des doigts, puis retargete l'ensemble vers un corps humanoïde via un alignement relatif à la caméra et un compositing en couches. Le résultat est un jeu de données synchronisant observations visuelles recentrées et actions ou états du robot. Sur le plan quantitatif, la trajectoire produite affiche une erreur plus faible et un mouvement du poignet plus lisse que des méthodes de référence cross-embodiment, avec des scores SPARC de -5,18 contre -5,56 et -6,05 pour les baselines (plus proche de zéro signifiant un geste plus fluide). L'enjeu dépasse la seule métrique technique. L'apprentissage de politiques pour humanoïdes bute depuis des années sur le manque de données de manipulation dexterity à grande échelle: la téléopération et la capture en réalité virtuelle sont précises mais lentes à produire, tandis que la vidéo humaine ordinaire est abondante mais bruitée et difficile à retargeter fidèlement. En améliorant la qualité de reconstruction de la main et de l'objet à partir de simples vidéos FPV, ce type de pipeline vise à débloquer un gisement de données quasi illimité, sans capteurs dédiés, pour entraîner des modèles vision-langage-action (VLA). C'est une brique d'infrastructure plutôt qu'un produit fini, mais elle touche directement au goulot d'étranglement identifié par la plupart des laboratoires travaillant sur la manipulation dexterity chez l'humanoïde. Cette approche s'inscrit dans une tendance plus large de l'industrie, où plusieurs équipes cherchent à exploiter la vidéo humaine égocentrique comme source de supervision scalable, en complément des données de téléopération utilisées pour entraîner les modèles VLA de nouvelle génération. L'article ne précise ni affiliation institutionnelle ni plan de mise à disposition du code ou du jeu de données, ce qui limite pour l'instant la reproductibilité et l'adoption par des équipes tierces.

RecherchePaper
1 source
209arXiv cs.RO 

PhysV2A : complétion de faisabilité guidée par l'atteignabilité et contrainte par masque sémantique, pour la manipulation vidéo-vers-robot

PhysV2A est un nouveau framework de recherche présenté dans un article publié sur arXiv (2607.09365) qui s'attaque à un problème central de la manipulation robotique pilotée par vidéo : convertir un mouvement d'objet en 6 degrés de liberté, extrait de démonstrations humaines, de vidéos générées ou d'observations RGB-D, en une trajectoire réellement exécutable par un robot donné. Le principe clé est de traiter la faisabilité de la prise non pas localement, mais comme conditionnée par la trajectoire entière : chaque candidat de préhension à 6-DoF issu d'une image RGB-D est rigidement couplé au mouvement d'objet reconstruit pour former une hypothèse de trajectoire du point central de l'outil (TCP). Le système applique ensuite une sélection hiérarchique "reachability-gated" qui rejette les paires prise-trajectoire irréalisables via des vérifications cinématiques propres au robot, puis classe les candidats survivants selon leur aptitude à l'exécution. Pour la trajectoire retenue, un masque sémantique S-Mask, assisté par un modèle vision-langage et validé par des règles, distingue les composantes cartésiennes critiques pour la tâche de celles qui peuvent être assouplies, permettant un raffinement de la manipulabilité par optimisation priorisant la redondance et relaxation cartésienne bornée. Sur quatre tâches de manipulation de table testées avec un robot réel, PhysV2A améliore le taux de réussite par rapport aux méthodes de référence fondées sur des a priori vidéo ou sur la seule cinématique inverse, tout en réduisant les échecs liés à la faisabilité cinématique. L'enjeu dépasse la simple démonstration technique : les priors extraits de vidéos sont par nature agnostiques à l'incarnation du robot, ce qui constitue un des principaux verrous empêchant l'usage à grande échelle de vidéos humaines ou générées comme source de données d'apprentissage pour la manipulation, un défi central pour les approches de type VLA (vision-language-action) qui cherchent à exploiter des corpus vidéo massifs plutôt que des démonstrations téléopérées coûteuses. En montrant qu'un traitement de la faisabilité au niveau trajectoire plutôt qu'au niveau de chaque prise réduit les échecs cinématiques, PhysV2A apporte un élément concret au débat sur l'écart entre priors vidéo prometteurs en simulation et exécution fiable sur robot réel. Ce travail s'inscrit dans une tendance de recherche plus large où vidéos humaines et vidéos générées sont envisagées comme source de données scalable pour l'apprentissage de politiques robotiques, en écho aux efforts de modèles comme Pi-0 ou GR00T N2 qui cherchent à exploiter des données hétérogènes au-delà de la téléopération classique. L'article, classé comme nouvelle soumission arXiv, reste à ce stade une contribution académique validée sur banc d'essai restreint (quatre tâches, un seul robot), sans indication d'industrialisation ni de partenaire déployant la méthode ; les prochaines étapes attendues concernent l'extension à davantage d'embodiments et de tâches de manipulation plus complexes.

RecherchePaper
1 source
210arXiv cs.RO 

TactiDex : un référentiel tactile réel pour la manipulation dextre proche de l'humain

La recherche en manipulation robotique dextre franchit une nouvelle étape avec TactiDex, un benchmark et un jeu de données publiés sur arXiv (référence 2607.09190v1) et dédiés à la manipulation guidée par le toucher. Le projet part d'un constat technique précis: la plupart des méthodes actuelles de transfert humain-robot pour les mains dextres reposent uniquement sur des trajectoires cinématiques, ce qui produit une imitation du mouvement sans véritable ancrage physique dans le contact. TactiDex propose à la place un jeu de données réel qui aligne des signaux tactiles couvrant l'ensemble de la main avec des états cinématiques et des états d'objets à plusieurs niveaux de granularité, accompagné de métriques d'évaluation standardisées. Sur cette base, les auteurs introduisent TactiSkill, un framework de transfert reposant sur une récompense tactile à trois composantes, conçue pour unifier dans un seul objectif le guidage du geste, la ressemblance avec le comportement humain et le respect des contraintes de contact. Les expériences couvrent à la fois des tâches à une main et des tâches bimanuelles, avec une page projet dédiée (tactidex.github.io) pour consulter les données et résultats. Pour l'industrie robotique, ce travail s'attaque directement à un angle mort connu des pipelines d'apprentissage par démonstration: la plupart des systèmes actuels, y compris les architectures VLA les plus médiatisées, valident surtout la trajectoire du geste et non la qualité physique du contact, ce qui laisse un écart entre démonstration réussie en vidéo et manipulation réellement stable en conditions réelles. En intégrant le retour tactile comme signal de supervision structuré plutôt que comme donnée accessoire, TactiDex offre aux équipes de recherche et aux intégrateurs travaillant sur des mains robotiques un cadre d'évaluation plus rigoureux pour juger si un geste appris est simplement copié ou physiquement plausible, ce qui pèse directement sur la fiabilité des déploiements en préhension fine. Le travail s'inscrit dans la lignée des efforts récents visant à dépasser la simple imitation cinématique dans le transfert humain-robot, un problème identifié de longue date dans la littérature sur la téléopération et l'apprentissage par démonstration. Aucune date de publication de code ni de partenariat industriel n'est mentionnée à ce stade; le projet reste au niveau d'un benchmark de recherche, dont l'adoption dépendra de sa reprise par d'autres laboratoires travaillant sur des mains dextres et l'apprentissage tactile.

RecherchePaper
1 source
211arXiv cs.RO 

GenVid2Robot : de la génération vidéo à la manipulation robotique par cohérence rigide-géométrique

Des chercheurs ont publié le 13 juillet 2026 sur arXiv (2607.09191v1) GenVid2Robot, un système qui transforme des vidéos générées par IA en trajectoires exécutables sur un robot manipulateur réel. Le problème de départ: une vidéo générée peut sembler visuellement plausible sans être physiquement exécutable, faute de géométrie métrique, d'ancrage de préhension, de faisabilité cinématique ou de retour d'exécution. GenVid2Robot part d'une observation RGB-D initiale et d'une instruction de tâche, échantillonne des ancres sémantiques pertinentes sur la première image réelle, puis suit ces ancres à travers les candidats vidéo générés. Un modèle SE(3) relatif et épars vérifie si le mouvement 2D observé est cohérent avec la géométrie 3D des ancres; seul le mouvement validé géométriquement est transféré au robot. Ce mouvement est ensuite appliqué à la pose réelle de l'organe terminal (TCP) au moment de la saisie, déterminée par une préhension contrainte par masque, et un module de compensation de profondeur borné corrige les erreurs locales dues au bruit RGB-D ou aux déplacements de contact. L'enjeu dépasse la démonstration technique isolée: les modèles de génération vidéo (type Sora, Veo ou Genie) sont de plus en plus présentés comme des sources de "priors" de mouvement pour la robotique, mais l'écart entre vidéo plausible et action exécutable reste l'un des obstacles majeurs à leur usage réel, aux côtés du problème classique du sim-to-real. En filtrant les hypothèses de mouvement par cohérence géométrique plutôt qu'en rejouant directement une trajectoire, GenVid2Robot répond directement au risque d'échec en conditions réelles que redoutent intégrateurs et équipes R&D travaillant sur les architectures vision-langage-action (VLA). Le travail s'inscrit dans la lignée des approches combinant modèles génératifs et politiques robotiques, aux côtés d'efforts comme Pi-0, GR00T N2 ou Helix qui cherchent à exploiter des priors visuels ou vidéo à grande échelle. À ce stade, il s'agit d'une publication de recherche avec expériences sur robot réel, non d'un produit commercialisé; les auteurs ne précisent pas de calendrier de déploiement industriel.

RecherchePaper
1 source
212arXiv cs.RO 

RoboStream : associer raisonnement spatio-temporel et mémoire dans les modèles vision-langage pour la robotique

Des chercheurs présentent RoboStream, un framework sans entraînement (training-free) destiné à améliorer la planification robotique par modèles vision-langage (VLM) sur des tâches de manipulation à long horizon. Le système repose sur deux mécanismes : les STF-Tokens (Spatio-Temporal Fusion Tokens), qui lient les preuves visuelles à des attributs géométriques 3D pour ancrer durablement les objets dans la scène, et un graphe causal spatio-temporel (CSTG) qui enregistre les transitions d'état déclenchées par chaque action successive. Sur le benchmark RLBench en configuration longue durée, RoboStream atteint 90,5% de réussite. Sur des tâches réelles de construction de blocs, jugées plus exigeantes, il obtient 44,4%, contre seulement 11,1% pour les deux systèmes de référence SoFar et VoxPoser. Ce résultat cible un problème connu des planificateurs VLM actuels: ils traitent chaque étape comme une observation isolée, sans mémoire des actions précédentes ni de leur effet sur l'environnement. Concrètement, un objet temporairement caché par le bras du robot ou par un autre élément de la scène est purement et simplement "oublié", ce qui provoque des violations de précondition en cascade sur les étapes suivantes. Pour les intégrateurs et équipes de R&D en robotique manipulatrice, l'écart de performance rapporté sur les tâches réelles (44,4% contre 11,1%) illustre un problème plus large que la démonstration de laboratoire ne masque pas toujours: la difficulté à maintenir une cohérence géométrique et causale sur des séquences longues, bien au-delà de la simple perception image par image. Le fait que la méthode soit annoncée comme fonctionnant sans fine-tuning supplémentaire est notable pour un déploiement pratique, si les résultats se confirment au-delà du cadre contrôlé de l'étude. Ce travail s'inscrit dans la lignée des approches de raisonnement spatial pour la robotique, en s'opposant frontalement aux architectures VoxPoser et SoFar, utilisées ici comme lignes de base. Il s'agit pour l'instant d'une publication de recherche (version 2 mise à jour sur arXiv), sans indication de mise en production ou de partenariat industriel; les auteurs ne précisent pas de calendrier de suite ni d'intégration matérielle spécifique.

RechercheActu
1 source
213arXiv cs.RO 

OIPP : prédicteur adaptatif du point d'impact pour intercepter des objets en vol variés

Des chercheurs publient sur arXiv (soumission remplacée, v3) un système baptisé OIPP (Object-Adaptive Impact Point Predictor), conçu pour permettre à un robot quadrupède équipé d'un panier de rattraper des objets en vol. L'objectif est de prédire précisément le point d'impact, c'est-à-dire l'endroit où l'objet va atterrir, avant même la fin de sa trajectoire. Pour entraîner ce système, faute de jeu de données public couvrant des objets divers soumis à une aérodynamique instable, l'équipe a constitué son propre corpus: 8 000 trajectoires réelles issues de 20 objets différents. OIPP repose sur deux modules, un encodeur adaptatif aux objets (OAE) qui extrait des représentations dépendantes de l'objet à partir de l'historique de mouvement, et un prédicteur de point d'impact (IPP) qui en déduit la position finale. Deux variantes de l'IPP ont été testées, l'une (NAE) qui prédit l'accélération puis reconstruit la trajectoire complète, l'autre (DPE) qui produit directement le point d'impact sans étape intermédiaire. Les résultats montrent une performance supérieure aux méthodes de référence sur 15 objets connus et 5 objets jamais vus à l'entraînement, avec des gains de succès de capture confirmés en simulation et lors d'essais sur robot réel. Pour l'industrie robotique, ce travail s'attaque à un problème resté largement non résolu: la manipulation dynamique d'objets en vol, un domaine différent de la préhension statique déjà largement maîtrisée par les bras robotiques. La difficulté centrale que les auteurs mettent en avant, à savoir que les trajectoires de différents objets se ressemblent en début de vol, est précisément ce qui limite les systèmes existants à des scénarios avec un seul type d'objet connu à l'avance. Démontrer qu'un modèle unique généralise à des objets inédits, sans réentraînement, est un signal utile pour les intégrateurs qui envisagent des applications de tri, de logistique ou de sécurité où la nature de l'objet capté n'est pas toujours prévisible à l'avance. Cela reste toutefois un résultat de recherche académique, validé sur un jeu d'objets limité et un robot quadrupède spécifique, loin d'un produit commercial déployé. Le travail s'inscrit dans la lignée des efforts récents sur la manipulation dynamique par apprentissage, où l'accès à des données réelles diversifiées est le principal goulot d'étranglement plutôt que l'algorithme lui-même, un constat similaire à celui qui a poussé des laboratoires travaillant sur des politiques de type VLA (vision-langage-action) à investir massivement dans la collecte de données avant l'entraînement des modèles. Les auteurs positionnent explicitement leur contribution en deux temps, d'abord la construction d'un dataset plus riche et complexe que l'existant, ensuite l'architecture OIPP elle-même. Une démonstration vidéo est disponible en ligne, et les essais sur robot réel suggèrent une prochaine étape naturelle vers des tests en conditions moins contrôlées, avec potentiellement davantage d'objets et de configurations de lancer, avant d'envisager une application industrielle concrète.

RecherchePaper
1 source
214arXiv cs.RO 

Robot Trajectron V3 : un cadre de contrôle partagé probabiliste pour la manipulation SE(3)

Un nouveau cadre de contrôle partagé pour la téléopération de bras robotiques à haut degré de liberté, baptisé Robot Trajectron V3 (RT-V3), a été publié sur arXiv (référence 2607.09315). Il cible les tâches de préhension en SE(3), c'est-à-dire combinant translation et rotation dans l'espace. RT-V3 formule l'assistance comme une inférence bayésienne : un modèle transformer génératif apprend un a priori sur l'intention de l'utilisateur à partir de nuages de points, de poses de préhension candidates et de la dynamique passée du robot, puis le combine en temps réel aux commandes de l'opérateur pour estimer la trajectoire future la plus probable. Une représentation factorisée translation-rotation améliore l'apprentissage dans ces espaces d'action de haute dimension. Des études utilisateurs réelles montrent un taux de réussite et une efficacité supérieurs aux méthodes de référence, avec une charge de travail physique et mentale réduite pour l'opérateur. L'enjeu est concret pour l'industrie robotique : la téléopération de bras à haute dimensionnalité reste lourde cognitivement et source d'erreurs, surtout avec des interfaces à faible bande passante comme les joysticks ou les interfaces cerveau-machine. Pour les intégrateurs travaillant en logistique, en désamorçage ou en intervention en environnement dangereux, un contrôle partagé qui anticipe l'intention humaine peut réduire la fatigue de l'opérateur sans exiger une autonomie complète, encore risquée en scène non structurée. Le travail illustre aussi une tendance de fond du secteur : l'usage de modèles génératifs conditionnés par la vision, proches des architectures VLA popularisées par des systèmes comme Pi-0 ou GR00T N2, pour de l'assistance plutôt que de l'autonomie totale. Les résultats restent toutefois issus d'études en laboratoire, dont le passage à l'échelle industrielle reste à démontrer. Le nom "V3" signale une itération sur des versions antérieures de Robot Trajectron, dans un champ de recherche sur le contrôle partagé homme-robot déjà disputé entre approches par diffusion, par apprentissage par renforcement et par inférence bayésienne. Aucun partenaire industriel ni déploiement commercial n'est mentionné : il s'agit à ce stade d'une contribution académique, sans licence ni intégration produit annoncée. La suite logique pour ce type de travaux est généralement une extension à des tâches multi-étapes ou à des flottes de robots, ainsi qu'une comparaison plus poussée face aux politiques VLA end-to-end qui gagnent du terrain dans l'industrie humanoïde.

RecherchePaper
1 source
215arXiv cs.RO 

Une approche par échantillonnage incrémental et segmentation pour l'infaisabilité en planification de mouvement

Des chercheurs ont publié une troisième révision sur arXiv (2501.11434v3) d'un algorithme destiné à détecter l'infaisabilité d'un plan de mouvement en robotique, c'est-à-dire à prouver rapidement qu'aucun chemin ne relie une configuration de départ à une configuration d'arrivée. La méthode discrétise l'espace des configurations du robot, chaque degré de liberté (DOF) ne prenant qu'un nombre fini de valeurs. L'espace obstacle divise cet espace en régions connexes distinctes : pour qu'un chemin existe, départ et arrivée doivent appartenir à la même région. L'algorithme construit progressivement une carte de cet espace, initialement supposé entièrement libre, en échantillonnant des points dans la zone obstacle et en mettant à jour une bitmap correspondante. Il segmente ensuite cet espace partiellement rempli pour identifier ses composantes connexes et vérifier la connectivité entre départ et arrivée. Les auteurs valident l'approche sur cinq scénarios allant jusqu'à 5 DOF, puis démontrent expérimentalement son passage à l'échelle sur des robots à 6 et 7 DOF, avec des optimisations visant à accélérer significativement les calculs. L'enjeu dépasse la simple curiosité académique : prouver qu'un mouvement est impossible est structurellement plus difficile que d'en trouver un possible, car les planificateurs par échantillonnage les plus répandus (RRT, PRM et leurs variantes) sont conçus pour converger vers une solution quand elle existe, mais tournent indéfiniment ou échouent silencieusement en son absence. Pour un intégrateur industriel programmant une cellule robotisée, savoir en amont qu'une trajectoire est irréalisable évite un temps de calcul infini et permet de reconfigurer l'environnement ou la pose du robot plus tôt dans le cycle de conception. La démonstration sur des configurations à 6 et 7 DOF est le point notable : elle indique que la méthode ne reste pas cantonnée à des cas jouets de basse dimension, un écueil fréquent pour les approches de segmentation d'espace de configuration. La détection de complétude et d'infaisabilité en planification de mouvement est un sujet de recherche ancien, où les méthodes par grille ou par décomposition cellulaire coexistent avec les approches probabilistes plus rapides mais incomplètes. Cette publication, revue une troisième fois avant réévaluation, s'inscrit dans cette lignée en proposant une alternative simple à implémenter plutôt qu'une preuve théorique lourde, ouvrant la voie à une intégration dans des pipelines de planification existants pour des bras robotiques à haute dimensionnalité.

RecherchePaper
1 source
216arXiv cs.RO 

Acte, ressent, agit : l'apprentissage de la perception active à partir de données égocentriques humaines à grande échelle

Un article de robotique/IA en français, prêt à publier : CoMe-VLA (Cognitive and Memory-aware Vision-Language-Action) est un nouveau framework de recherche présenté dans un article arXiv (version révisée, réf. 2602.04600v2) qui s'attaque à la perception active en robotique manipulatrice, c'est-à-dire la capacité d'un robot à chercher activement de l'information plutôt que d'agir sur des données figées. Le système combine une tête cognitive auxiliaire chargée de gérer les transitions entre sous-tâches de façon autonome, et une mémoire à double piste qui fusionne les signaux proprioceptifs (position, effort) et visuels dans le temps pour maintenir une conscience cohérente de soi et de l'environnement. L'entraînement se déroule en trois étapes progressives et s'appuie sur de larges volumes de données égocentriques humaines (vidéos captées à la première personne), alignées avec l'espace d'action du robot pour transférer la coordination main-œil humaine vers la machine. Les tests ont été menés sur un humanoïde à roues, sur des tâches longues et variées impliquant plusieurs scénarios de perception active. L'enjeu dépasse la démonstration technique isolée. La plupart des modèles VLA actuellement médiatisés, qu'il s'agisse de Pi-0, GR00T N2 ou Helix, fonctionnent principalement en supposant une observabilité quasi complète de la scène, ce qui limite leur robustesse dès que l'environnement devient incertain ou partiellement caché, un cas fréquent en usine ou en entrepôt réel. En formalisant la perception active comme une boucle perception-action dépendante de l'historique, cet article propose une catégorisation structurée utile à toute l'industrie pour comparer les approches, et illustre une piste concrète pour réduire l'écart entre démonstrations en laboratoire et déploiement en environnement non contrôlé, un point sensible que les intégrateurs surveillent de près. Ce travail s'inscrit dans une tendance de fond de la recherche en robotique généraliste : exploiter les vidéos humaines à grande échelle, bien plus abondantes que les données de téléopération robotique, pour apprendre des priors d'exploration et de manipulation. Il ne s'agit ici que d'un article de recherche à un stade préliminaire, sans partenaire industriel ni déploiement annoncé, à distinguer clairement des annonces produits de type Figure ou Tesla Optimus. Les prochaines étapes attendues concernent l'extension à des plateformes bipèdes et la validation sur des tâches manipulatrices plus complexes en conditions réelles.

RechercheOpinion
1 source
217arXiv cs.RO 

CLAP : adaptation directe de VLM à VLA par ancrage langage-action

Des chercheurs publient sur arXiv (2607.08974v1) un nouveau modèle nommé CLAP, pour Causal Language-Action Prediction, une méthode qui convertit directement un modèle vision-langage (VLM) pré-entraîné en modèle vision-langage-action (VLA) sans modifier son architecture. Le problème identifié est celui du décalage de distribution en sortie : quand un VLA prédit des actions robotiques sous forme de simples séquences de tokens numériques, la génération s'éloigne de la distribution de langage naturel sur laquelle le VLM a été entraîné, ce qui dégrade les capacités sémantiques qu'on cherchait justement à préserver. CLAP résout ce problème en faisant précéder chaque séquence d'action numérique d'une description en langage naturel du geste à accomplir, conditionnant ainsi la prédiction précise des tokens d'action sur un plan verbalisé. Avec un simple fine-tuning d'une seule époque, la version 2 milliards de paramètres atteint 90,8% sur le benchmark LIBERO, soit 14,9 points de plus que VLA-0, et améliore la robustesse sur LIBERO-PRO face aux perturbations de langage, d'objets et de position spatiale. Les auteurs annoncent la publication en poids ouverts d'une famille de modèles à 0,8, 2 et 4 milliards de paramètres, issus de la même lignée de VLM. L'intérêt de ce travail est avant tout méthodologique plutôt qu'industriel : il permet d'isoler ce que le VLM pré-entraîné apporte réellement au contrôle robotique, alors que les post-entraînements massifs sur données robot et les modifications architecturales tendent habituellement à brouiller cette contribution. Pour les laboratoires travaillant sur des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, cette approche offre une voie plus transparente pour comprendre comment les capacités sémantiques d'un VLM se transfèrent à l'échelle vers le contrôle d'action, sans repartir d'une architecture bricolée sur mesure. CLAP s'inscrit dans un courant de recherche visant à limiter les changements architecturaux entre VLM et VLA, contrairement aux approches type OpenVLA qui modifient plus lourdement le squelette du modèle. Il s'agit ici d'une publication de recherche en preprint, non d'un produit commercial ni d'un déploiement robotique réel : aucun essai sur robot physique n'est mentionné dans l'abstract, seule une évaluation en simulation via LIBERO. La suite annoncée est la mise à disposition en open source des trois tailles de modèles, permettant à la communauté de reproduire et d'approfondir cette analyse du transfert de capacités du VLM vers le VLA.

RechercheActu
1 source
218arXiv cs.RO 

Modèles vision-langage-action de manipulateurs aériens modulaires, adaptés à la tâche sous contraintes de flux d'air

Le paragraphe qui suit décode un preprint arXiv (2607.09548v1, catégorie "new") plutôt qu'une annonce produit : posture éditoriale adaptée en conséquence, sans effets d'annonce à dégonfler puisqu'il n'y en a pas. Une équipe de recherche propose un cadre de conception par optimisation pour des manipulateurs aériens modulaires, c'est à dire des drones multirotors équipés d'un bras robotique capable d'interagir physiquement avec leur environnement. Le problème central : le flux d'air généré par les rotors perturbe les tâches impliquant des cibles ou des environnements sensibles au souffle. Les auteurs introduisent une catégorisation inédite de la tolérance des cibles à l'exposition au flux d'air, traduite en contraintes géométriques exploitables dans l'optimisation. Pour modéliser ce flux sans exploser le coût de calcul, ils développent une enveloppe compacte en forme de cône-sphère qui approxime la structure de propagation du souffle d'un quadrirotor. Sur cette base, le système de reconfiguration optimise à la fois la configuration de la plateforme et le placement de l'effecteur terminal, en respectant simultanément les exigences de force et couple (wrench) de la tâche, l'exposition de la cible au flux d'air et les interférences aérodynamiques entre les propres rotors de la plateforme. Contrairement aux approches précédentes qui fixaient d'emblée la position de l'effecteur, ce placement devient ici une variable d'optimisation à part entière. Des expériences de passage à l'échelle et des études d'ablation viennent valider l'approche. L'intérêt pour le secteur tient à un angle mort réel de la manipulation aérienne : la plupart des cadres de conception optimisent la faisabilité mécanique des tâches sans jamais modéliser la perturbation aérodynamique que le drone lui-même inflige à sa cible, un problème critique pour l'inspection de capteurs fragiles, l'agriculture de précision près de cultures sensibles, ou toute intervention à proximité d'équipements ou de personnes. Un cadre qui reconfigure automatiquement bras et plateforme selon la tâche, sans réglage manuel au cas par cas, pourrait accélérer le déploiement de drones manipulateurs modulaires dans ces contextes. Le texte reste toutefois un apport computationnel : la validation s'appuie sur des expériences de simulation et des ablations, sans mention de vols réels ni de plateforme physique testée, ce qui invite à la prudence sur la transférabilité pratique. Le champ de la manipulation aérienne modulaire, porté historiquement par des laboratoires universitaires en robotique aérienne, continue ainsi d'explorer la reconfigurabilité matérielle comme réponse à la diversité des tâches, avec l'intégration du flux d'air comme contrainte de conception encore peu traitée dans la littérature.

RecherchePaper
1 source
219NVIDIA Developer Blog 

Comment évaluer les politiques de robots généralistes pour un déploiement en conditions réelles

Une équipe de recherche en robotique publie un article de blog consacré à l'évaluation rigoureuse des politiques robotiques généralistes destinées au déploiement réel. Le texte part d'un constat : les meilleurs systèmes actuels, capables de suivre des instructions en langage naturel pour saisir, déplacer, trier et manipuler une grande variété d'objets, ont progressé rapidement ces derniers mois. Mais à mesure que ces modèles gagnent en capacité, les évaluer de façon fiable est devenu, selon les auteurs, l'un des problèmes non résolus les plus difficiles du secteur. Le billet ne détaille pas encore la méthode complète, mais annonce vouloir poser les problèmes clés de l'évaluation et présenter une approche pour les traiter, sans livrer dans cet extrait de chiffres de benchmark, de taux de réussite ou de comparaison entre modèles nommés. Pour l'industrie robotique, la question de l'évaluation n'est pas secondaire : elle conditionne la confiance que les intégrateurs et décideurs B2B peuvent accorder à des politiques génériques de type VLA avant de les déployer sur une ligne de production ou un site logistique. De nombreuses démonstrations de robots manipulateurs ou humanoïdes sont aujourd'hui présentées avec des vidéos sélectionnées et des conditions de test non standardisées, ce qui rend difficile toute comparaison objective entre acteurs. En pointant ce manque de rigueur méthodologique, la démarche s'inscrit dans une remise en question plus large de l'écart entre démonstration et réalité opérationnelle, un sujet central alors que plusieurs laboratoires affirment avoir résolu le passage de la simulation au réel à grande échelle. Cette initiative s'inscrit dans un mouvement plus large où plusieurs laboratoires de robotique généraliste développent des politiques capables d'exécuter des instructions en langage naturel sur des tâches variées, sans qu'il existe pour l'instant de standard d'évaluation partagé par le secteur. L'absence de protocole commun complique la comparaison entre approches concurrentes et freine l'adoption industrielle, les entreprises utilisatrices devant se fier aux métriques propres à chaque fournisseur. Le billet annonce vouloir combler ce vide méthodologique, sans préciser à ce stade de calendrier de publication détaillée ni de partenaires industriels associés à la démarche.

RecherchePaper
1 source
220Interesting Engineering 

MIT présente un essaim de bateaux robots qui transforme les voies navigables en infrastructure flottante adaptative

Des chercheurs du MIT ont développé FloatForm, un essaim de robots-bateaux autonomes capables de s'assembler en structures flottantes reconfigurables sans intervention humaine constante. Chaque robot mesure 21 centimètres de côté et embarque quatre propulseurs omnidirectionnels disposés en configuration X, lui permettant de se déplacer dans toutes les directions et de pivoter sur place. Un mécanisme de verrouillage magnétique inspiré de l'origami, actionné par un unique servomoteur, pousse ou rétracte des aimants permanents sur les quatre faces du robot, autorisant une connexion fiable entre unités séparées de 10 à 15 centimètres. Une boîte de vitesses imprimée en 3D verrouille le loquet en position engagée ou désengagée sans consommer d'énergie, celle-ci n'étant sollicitée que lors des phases de connexion et de séparation. En laboratoire, des flottilles de quatre et huit robots ont assemblé, désassemblé et réassemblé des structures cibles de façon autonome, puis se sont déplacées comme un seul vaisseau rigide, chaque démonstration durant entre quatre et huit minutes. Sur dix essais, le taux de réussite autonome atteint 90% avec quatre robots et chute à 70% avec huit, l'essaim parvenant néanmoins à se remettre seul d'erreurs de navigation et de blocages de formation. Des simulations informatiques suggèrent que le cadre de coordination décentralisé peut s'étendre à des essaims d'au moins 64 robots. L'intérêt du système tient à son architecture décentralisée: contrairement à la plupart des robots auto-assemblants qui dépendent d'un contrôleur central coordonnant chaque mouvement, FloatForm ne confie à un planificateur central que l'attribution des positions finales, chaque robot gérant ensuite localement sa navigation, l'évitement de collisions et la coordination en échangeant des données de position avec ses voisins immédiats. Cette approche permet à tous les robots de bouger simultanément, et surtout découple la charge de calcul du nombre total d'unités puisqu'elle ne dépend que des interactions locales. C'est une distinction importante pour l'industrie de la robotique en essaim: la plupart des démonstrations de ce type restent limitées en échelle par la centralisation du contrôle. Si la scalabilité simulée jusqu'à 64 unités se confirme sur du matériel réel, elle ouvrirait la voie à des infrastructures flottantes à la demande, pont temporaires, plateformes de travail, marchés flottants ou dispositifs d'intervention d'urgence, déployables sur canaux, rivières, ports et zones côtières. Le projet s'inspire directement du comportement des fourmis de feu, capables de former des radeaux flottants collectifs lors d'inondations en ne s'appuyant que sur des décisions individuelles locales. Les équipes du MIT ont dû résoudre plusieurs problèmes d'ingénierie annexes: la puissance des propulseurs provoquait initialement une rotation excessive des robots en raison de leur faible masse, ce qui a nécessité l'ajout d'ailerons stabilisateurs et un raffinement des algorithmes de contrôle pour compenser les différences entre unités individuelles. L'attraction magnétique trop forte entre robots a également dû être corrigée pour garantir un détachement fiable sur commande. Les chercheurs envisagent désormais des versions plus grandes destinées aux canaux, rivières, ports et eaux côtières, sans toutefois avoir communiqué de calendrier de déploiement pilote à ce stade.

RecherchePaper
1 source
Un nouvel indice de similitude humaine et de confort pour les mouvements de robots suivant des trajectoires prédéfinies
221arXiv cs.RO 

Un nouvel indice de similitude humaine et de confort pour les mouvements de robots suivant des trajectoires prédéfinies

Des chercheurs publient sur arXiv (arXiv:2607.08620v1, article de type "new") un indice inédit de similarité humaine et de confort pour évaluer les mouvements de robots suivant une trajectoire imposée. L'étude part du constat que la ressemblance visuelle avec le corps humain, propre aux humanoïdes, ne suffit pas à garantir l'acceptation lors d'une interaction physique : celle-ci dépend directement du confort et de l'ergonomie perçus, liés à la qualité du mouvement exécuté. Les auteurs s'appuient sur la caractérisation cinématique du mouvement humain, en particulier les lois temporelles qui régissent le déplacement de l'organe terminal (end-effector) le long d'un chemin donné, et mobilisent le principe de lognormalité, un modèle reconnu pour décrire la vitesse des gestes humains. Cet indice permet d'évaluer a priori, avant toute exécution, si une trajectoire générée par un algorithme paraîtra naturelle. Pour valider l'approche, 68 sujets ont participé à trois campagnes expérimentales impliquant une interaction physique directe avec un robot, en jugeant leur confort face à différents mouvements. Les résultats montrent une tendance globalement cohérente entre le confort perçu et la distribution de l'indice proposé. Pour l'industrie robotique, cet outil offre un moyen concret de comparer et d'optimiser des algorithmes de génération de trajectoires avant leur déploiement, sans attendre des tests utilisateurs coûteux à chaque itération. Il s'inscrit dans une problématique clé pour les intégrateurs de cobots et de robots humanoïdes destinés à travailler aux côtés d'humains : la fluidité perçue d'un geste pèse autant que sa précision technique dans l'acceptation du robot par les opérateurs, un facteur souvent négligé au profit des seules performances cinématiques (vitesse, précision, répétabilité). Le papier s'inscrit dans un courant de recherche en ergonomie robotique qui cherche à quantifier objectivement ce qui, jusqu'ici, relevait surtout d'évaluations subjectives via questionnaires post-interaction. En proposant une métrique calculable en amont de l'exécution, les auteurs ouvrent la voie à son intégration directe dans les boucles de planification de mouvement, avec des validations complémentaires à prévoir sur d'autres morphologies de robots et contextes d'usage industriel.

RecherchePaper
1 source
DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation
222arXiv cs.RO 

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation

Un consortium de chercheurs présente DexVerse, un benchmark modulaire à grande échelle pour la manipulation dextre multi-tâches et multi-embodiments. L'ensemble couvre 100 tâches réparties sur des compétences variées : saisie et déplacement d'objets, interaction avec des objets articulés, usage fonctionnel d'outils, coordination bimanuelle, contrôle non préhensile, comportements riches en contact, exécution multi-objectifs et tâches longues à plusieurs étapes. Le système prend en charge 3 bras robotiques et 6 mains dextres différentes, et reste extensible à de nouvelles tâches, de nouveaux actifs et de nouveaux embodiments. Pour tester la généralisation visuomotrice, DexVerse propose des variations visuelles paramétrables (textures, arrière-plans, éclairage, points de vue caméra). Les auteurs fournissent aussi une interface de téléopération en réalité virtuelle ainsi que 3 180 démonstrations avec observations synchronisées : données proprioceptives, images RGB, profondeur, nuages de points et états. Quatre méthodes représentatives ont été évaluées sur 19 tâches : Diffusion Policy, DP3, OpenVLA et π0.5. Les résultats révèlent des difficultés importantes de généralisation entre tâches et de robustesse visuomotrice, même pour ces politiques d'apprentissage jugées à la pointe. Pour l'industrie robotique, ce constat vient nuancer l'enthousiasme actuel autour des modèles VLA (vision-langage-action) présentés comme des solutions généralistes prêtes à l'échelle : DexVerse montre que la performance chute nettement dès que les conditions visuelles ou la nature de la tâche s'écartent du contexte d'entraînement. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent des politiques de manipulation dextre avant déploiement industriel : la démonstration en laboratoire ne garantit pas la robustesse en conditions réelles variables. DexVerse s'inscrit dans une lignée de benchmarks robotiques cherchant à dépasser les évaluations sur tâche isolée, un manque identifié dans les jeux d'essai existants, limités en diversité de tâches, de couverture d'embodiments ou de variation visuelle contrôlable. En couvrant simultanément plusieurs bras, plusieurs mains et un large éventail de conditions, il se positionne comme un terrain d'essai de référence pour comparer des approches comme Diffusion Policy ou les modèles de la famille π face à des architectures VLA telles qu'OpenVLA. La page du projet est disponible à l'adresse ycyao216.github.io/DexVerse.site, laissant présager de futures évaluations élargies et l'ajout d'autres méthodes et tâches.

RecherchePaper
1 source
Comprendre et réduire l'écart de généralisation vidéo-action grâce au ratio temporel
223arXiv cs.RO 

Comprendre et réduire l'écart de généralisation vidéo-action grâce au ratio temporel

Des chercheurs mettent en évidence un défaut structurel des modèles vidéo-action (VAM) et monde-action (WAM) utilisés en robotique : lorsqu'ils sont finetunés sur des données d'actions robotiques, ces modèles perdent la capacité de généralisation compositionnelle héritée des modèles vidéo génératifs de base, un phénomène baptisé "video-action generalization gap". L'étude, publiée sur arXiv (2607.08127), teste un large espace de configurations de VAM sans trouver de schéma explicatif évident dans les choix de conception standards. Les auteurs introduisent alors le Temporal Ratio (TR), une mesure basée sur l'attention qui quantifie à quel point la tête d'action d'un modèle s'appuie sur les projections latentes futures plutôt que sur l'image ancrée au présent. Le TR se révèle être à la fois un prédicteur de la capacité de généralisation compositionnelle d'un modèle et un indicateur qui varie naturellement selon la phase de la tâche : l'attention se porte vers le futur pendant la planification, puis revient au présent pour les phases de manipulation fine nécessitant de la précision. Les tests ont été menés sur le benchmark LIBERO ainsi que sur des tâches réelles. Cette découverte a une portée directe pour les concepteurs de politiques robotiques de type VLA (vision-language-action), un domaine où l'écart entre performances en démonstration et robustesse réelle reste un point de friction majeur pour les intégrateurs. En identifiant un mécanisme mesurable et exploitable au moment de l'inférence, l'équipe propose une méthode de guidage adaptatif qui amplifie dynamiquement le signal de conditionnement vidéo compositionnel précisément quand la politique dépend des projections futures. Cela permettrait de réduire l'écart de généralisation OOD-ID (hors distribution vs distribution d'entraînement) sans réentraîner le modèle, une piste concrète pour fiabiliser le déploiement de politiques apprises par vidéo sur des tâches non vues. Ce travail s'inscrit dans la lignée des efforts récents pour comprendre pourquoi les modèles fondation vidéo, malgré leurs forts a priori compositionnels, ne transfèrent pas systématiquement ces capacités une fois adaptés à la robotique, un sujet également abordé par des familles de modèles comme GR00T N2 ou Pi-0. La suite logique serait une validation à plus grande échelle sur des plateformes robotiques variées et une comparaison directe du TR face à d'autres métriques de diagnostic des politiques VLA.

RecherchePaper
1 source
ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts
224arXiv cs.RO 

ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts

Wiping a board, sitting on a chair ou pousser un meuble : ces tâches semblent réussies dès que le robot atteint la bonne posture, mais sans contact physique réel avec l'objet, elles échouent en pratique. C'est le constat de départ de CONTACTMIMIC, un framework d'apprentissage présenté dans un article publié le 10 juillet sur arXiv (2607.08742). L'équipe y ajoute aux trajectoires de points-clés classiques (keypoint tracking) des commandes de contact binaires, définies au niveau de chaque partie du corps. La politique résultante s'appuie sur deux ingrédients : des récompenses qui suivent explicitement le contact et un schéma d'augmentation de trajectoires conçu pour casser la corrélation entre géométrie des points-clés et étiquettes de contact. Résultat, le robot peut produire ou supprimer un contact à la demande, indépendamment de sa pose. Sur 10 mouvements d'interaction homme-objet testés en simulation, CONTACTMIMIC dépasse les trackers uniquement basés sur les points-clés, sans recourir à des récompenses spécifiques à chaque tâche. Le transfert sim-to-real a été validé sur 5 mouvements réels. L'enjeu dépasse la démonstration technique : la plupart des pipelines d'imitation de mouvement pour humanoïdes optimisent la fidélité cinématique, pas l'interaction physique effective, un angle mort qui limite l'utilité pratique des politiques de manipulation whole-body déployées sur des plateformes comme Figure 03, Optimus ou des architectures VLA type GR00T N2, Pi-0 ou Helix. Découpler contact et géométrie ouvre la voie à des contrôleurs capables d'exécuter des tâches ménagères ou industrielles réelles (essuyer, pousser, s'asseoir) sans réentraînement par tâche, un prérequis pour que les humanoïdes sortent de la démonstration scriptée. Le travail s'inscrit dans la lignée des méthodes de suivi de points-clés pour le contrôle corps entier des humanoïdes, dont il expose les limites via des ablations confirmant la nécessité de l'augmentation de trajectoires. Aucun partenaire industriel n'est mentionné : il s'agit pour l'instant d'une contribution de recherche en simulation et validation restreinte en réel, dont les vidéos sont disponibles en ligne, sans calendrier de déploiement annoncé.

RecherchePaper
1 source
EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles
225arXiv cs.RO 

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles

Des chercheurs du laboratoire RL2 de Georgia Tech publient EgoWAM, un cadre de "World Action Models" qui exploite des vidéos égocentriques humaines filmées en conditions réelles pour entraîner des politiques de manipulation robotique. Le problème identifié: le clonage de comportement classique mélange des éléments transférables comme les objets, les scènes et la sémantique des tâches, avec des facteurs propres à l'humain (morphologie, mouvements de tête, style gestuel) qui n'ont rien à voir avec un bras robotique. Les auteurs testent trois cibles de prédiction du monde différentes, à backbone de politique, tête d'action et mélange de données identiques: la prédiction de pixels bruts, des caractéristiques visuelles DINO, et le flux de mouvement 3D. Sur trois tâches bimanuelles réelles, la prédiction pixel se révèle peu efficace pour le transfert humain-robot, tandis que DINO améliore la généralisation hors distribution (nouveaux objets, nouvelles scènes) jusqu'à 4 fois, et le flux 3D augmente la performance en distribution de 20 à 30%. Le résultat tranche un débat central pour l'industrie robotique: peut-on utiliser la masse de vidéos humaines disponibles sur le web comme signal d'entraînement bon marché, à la manière dont les modèles VLA (vision-langage-action) type Pi-0 de Physical Intelligence ou GR00T de NVIDIA cherchent à le faire? EgoWAM montre que oui, mais pas en imitant les pixels tels quels: il faut une représentation qui abstrait l'apparence et isole les effets physiques indépendants de l'agent, en séparant le mouvement de caméra du changement réel de l'environnement. Pour les intégrateurs et laboratoires qui misent sur la vidéo à l'échelle pour réduire le coût de collecte de données robotiques, cela oriente concrètement le choix des représentations à privilégier plutôt que la simple accumulation de séquences pixel. Le travail s'inscrit dans la lignée des modèles du monde appliqués à la robotique et des jeux de données égocentriques type Ego4D, en réponse aux limites connues du clonage de comportement pur. Le code, les tâches et les détails expérimentaux sont publiés sur gatech-rl2.github.io/egowam.github.io, sans annonce de déploiement industriel à ce stade: il s'agit d'un résultat de recherche contrôlé, pas d'un produit prêt à intégrer.

RechercheActu
1 source
EVIS : un plugin de caméra événementielle ancré dans la physique pour NVIDIA Isaac Sim
226arXiv cs.RO 

EVIS : un plugin de caméra événementielle ancré dans la physique pour NVIDIA Isaac Sim

Des chercheurs du SpikeLab de l'université Johns Hopkins ont publié EVIS, un plugin de caméra événementielle physiquement fondé pour le simulateur NVIDIA Isaac Sim, décrit dans un article déposé sur arXiv (référence 2607.08098) et accompagné d'un dépôt de code ouvert sur GitHub (spikelab-jhu/isaac-sim-event-camera-plugin). L'outil génère des flux d'événements haute fréquence et entièrement annotés directement à l'intérieur du moteur physique d'Isaac Sim, en s'appuyant sur un modèle de contraste log-intensité fidèle au fonctionnement réel des capteurs événementiels, avec mise à jour asynchrone de référence pixel par pixel. Le plugin migre depuis une caméra RGB standard avec peu de modifications et s'intègre à n'importe quelle scène Isaac Sim ou Isaac Lab, héritant ainsi de la physique du simulateur et d'une vérité terrain parfaite image par image. Une option d'interpolation permet de ne rendre que des images clés éparses puis de synthétiser les images intermédiaires par déformation bidirectionnelle par vecteurs de mouvement, rendant possible une génération en temps réel sur un seul GPU. Du bruit capteur et du flou de mouvement optionnels réduisent encore l'écart avec des caméras réelles. L'enjeu est concret pour la robotique événementielle: les caméras à événements offrent une résolution temporelle de l'ordre de la microseconde, une latence très faible et une large plage dynamique, des atouts pour la perception rapide et le contrôle en boucle fermée. Mais les données labellisées pour un robot et une scène donnés restent rares et coûteuses à collecter, ce qui freine le développement d'algorithmes de perception et de contrôle basés sur ces capteurs. En générant des flux directement exploitables par des réseaux événementiels pré-entraînés, EVIS réduit ce goulot d'étranglement et s'attaque frontalement au problème classique du fossé simulation-réel. Le projet s'inscrit dans l'écosystème Isaac Sim, largement utilisé par les laboratoires de robotique et les équipes d'apprentissage par renforcement pour l'entraînement en simulation avant déploiement physique. En rendant la simulation événementielle native et configurable au sein d'un outil déjà répandu, les auteurs visent à accélérer les cycles de recherche sur des tâches de perception et de contrôle à haute vitesse, sans attendre la constitution coûteuse de jeux de données réels capteur par capteur.

RechercheActu
1 source
Cadre de contrôle par vision monoculaire pour la préhension
227arXiv cs.RO 

Cadre de contrôle par vision monoculaire pour la préhension

Des chercheurs présentent un système de préhension robotique piloté uniquement par une caméra RGB monoculaire, capable de manipuler aussi bien des objets rigides que déformables avec un seul pipeline de contrôle, sans capteur tactile ni pince spécialisée. Le framework combine détection d'objets en vocabulaire ouvert, segmentation d'image, assignation de points sensible aux contours, suivi de points en temps réel et estimation de profondeur monoculaire pour reconstruire la géométrie et le mouvement des objets à partir de la seule vision. Son élément central est un modèle qui estime la raideur attendue d'un objet à partir de sa description sémantique, fournissant un a priori pour choisir la stratégie de préhension avant tout contact. Pour les objets déformables, l'adaptation de la prise s'appuie sur une mesure de dissimilarité de type Procrustes calculée sur des points-clés suivis, utilisée comme indicateur visuel de déformation. Pour les objets rigides, l'écartement de la pince est réglé par la mise à l'échelle des distances entre points suivis. Le système a été testé sur un bras Franka Emika Research 3, en conditions réelles de prise et dépose, sur de la salade, de la mozzarella fraîche, des croissants, du papier essuie-tout et des bouteilles en plastique rigide. L'intérêt pratique tient à l'unification: la plupart des approches existantes traitent séparément le rigide et le souple, en s'appuyant souvent sur des capteurs tactiles, des modèles spécifiques par objet ou des pinces dédiées. Démontrer une préhension stable sur les deux catégories avec une seule pipeline vision, sans tactile, ouvre une piste économique et généralisable pour la manutention alimentaire et la manipulation domestique, deux domaines où la variabilité des objets rend coûteuse toute solution sur mesure. Le travail s'inscrit dans la lignée des recherches en préhension robotique cherchant à réduire la dépendance au capteur tactile au profit de la vision seule, à l'heure où les modèles vision-langage-action gagnent en popularité pour la manipulation généraliste. Les auteurs positionnent leur approche comme une alternative sensor-efficient à ces pipelines multimodaux plus lourds, la validation restant pour l'instant limitée à un jeu restreint d'objets en laboratoire.

RecherchePaper
1 source
Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines
228arXiv cs.RO 

Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines

Des chercheurs viennent de publier sur arXiv (arXiv:2607.08341, 10 juillet 2026) une nouvelle méthode baptisée AnyDexRT, conçue pour le retargeting cinématique des mains robotiques dextres en téléopération. Le retargeting consiste à traduire les mouvements de la main d'un opérateur humain en mouvements réalisables par une main robotique, une étape cruciale pour la téléopération et pour la collecte de démonstrations utilisées en apprentissage par imitation. Contrairement aux approches existantes, qui reposent souvent sur des objectifs conçus manuellement, un calibrage précis ou un appariement global des formes entre la main humaine et la main robotique, AnyDexRT ne nécessite aucune calibration préalable. La méthode combine un apprentissage auto-supervisé des correspondances entre le bout des doigts humains et robotiques avec un guidage humain en few-shot, c'est-à-dire à partir de très peu d'exemples, pour ancrer la correspondance dans les zones pertinentes pour la tâche. Un classificateur de contact affine ensuite spécifiquement les poses de préhension en pince. Cette approche répond à un problème concret et sous-estimé du secteur : la fragilité des pipelines de téléopération dès qu'on change de main robotique ou d'opérateur, ce qui limite la scalabilité de la collecte de données pour l'apprentissage par imitation, un goulot d'étranglement identifié dans le développement des modèles VLA (vision-langage-action) comme Pi-0 ou GR00T N2. En supprimant la calibration manuelle, AnyDexRT pourrait accélérer la production de démonstrations de qualité pour l'entraînement de politiques robotiques, un enjeu central pour les intégrateurs et laboratoires qui cherchent à faire passer leurs mains dextres de la démonstration en laboratoire à des déploiements plus robustes. Les auteurs rapportent des gains en qualité de retargeting et une réduction du réglage manuel sur des mains dextres variées et des tâches de téléopération réelles, sans toutefois préciser de métriques chiffrées vérifiables dans le résumé. Le travail s'inscrit dans la lignée des recherches sur le retargeting cross-embodiment, un axe actif face à la multiplication des mains robotiques commerciales aux morphologies différentes. Un site de projet accompagne la publication, mais aucun code, benchmark comparatif détaillé ni partenariat industriel n'est mentionné à ce stade : il s'agit d'une contribution académique, pas d'un produit prêt à déployer.

RecherchePaper
1 source
D-CLIPSE : localisation par consensus distribué avec écoute passive sur échange d'état partagé
229arXiv cs.RO 

D-CLIPSE : localisation par consensus distribué avec écoute passive sur échange d'état partagé

Le nom complet du papier est D-CLIPSE, pour "Distributed Consensus-based Localization with Passive Listening on Shared State Exchange" (arXiv:2607.07995v1). Il s'agit d'un nouveau cadre de filtrage distribué pour la localisation multi-robots, conçu pour rester cohérent (au sens statistique du terme) tout en limitant la charge de communication entre robots. Le principe: chaque robot embarque son propre filtre et estime à la fois son état et celui de ses voisins, en échangeant de l'odométrie préintégrée ainsi que des états partagés pertinents via communication inter-robot. Contrairement à une architecture centralisée qui fusionnerait de façon optimale toutes les mesures de capteurs de l'équipe mais qui reste rarement viable en pratique (contraintes matérielles, de bande passante et de puissance de calcul), D-CLIPSE cherche à s'en approcher sans passer par un nœud central. Les auteurs valident leur méthode à la fois en simulation et lors d'expériences réelles, avec des résultats de précision et surtout de cohérence proches d'une solution centralisée. L'enjeu dépasse la simple prouesse académique: la localisation multi-robots est un prérequis direct pour la planification de trajectoire et le contrôle dans toute flotte coordonnée, qu'il s'agisse d'AMR en entrepôt, d'essaims de drones ou de robots d'inspection travaillant en équipe. Le problème classique des filtres décentralisés est la sous-estimation de l'incertitude quand les mêmes informations sont comptées plusieurs fois dans le réseau, ce qui rend les estimations de position trop confiantes et potentiellement dangereuses pour la prise de décision en aval. En visant explicitement la cohérence statistique en plus de la précision, et en réduisant le volume de données échangées entre robots, D-CLIPSE s'attaque directement à ce qui limite aujourd'hui le déploiement de flottes robotiques réellement décentralisées à grande échelle, sans dépendre d'une infrastructure de calcul centrale fragile ou coûteuse en latence. Le papier se positionne explicitement contre l'état de l'art actuel des approches décentralisées, dont il revendique dépasser les performances en cohérence tout en restant efficace en communication, un compromis que la littérature peine généralement à tenir simultanément. Les approches distribuées existantes s'appuient typiquement sur des variantes de filtres de Kalman étendus ou des méthodes d'intersection de covariance pour éviter le double comptage d'information, souvent au prix d'une dégradation de précision ou d'un surcoût de calcul. En publiant à la fois des résultats simulés et expérimentaux, les auteurs cherchent à démontrer une applicabilité concrète plutôt qu'un simple gain théorique, ouvrant la voie à des tests sur des flottes physiques plus larges et à une intégration potentielle dans des piles de navigation multi-robots existantes.

RecherchePaper
1 source
Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense
230arXiv cs.RO 

Navigation par objectif à vocabulaire ouvert : généraliser la cartographie sémantique avec CLIP dense

Des chercheurs ont publié une nouvelle version (v2) de l'article arXiv 2407.09016, qui présente OVExp, un framework d'exploration en vocabulaire ouvert pour la navigation robotique vers des objets-cibles non catégorisés au préalable. Le système s'appuie sur des modèles Dense CLIP pour généraliser la cartographie sémantique, sans recourir à l'inférence coûteuse de grands modèles de langage (LLM) ni à un entraînement intensif par apprentissage par renforcement (RL) de bout en bout. L'innovation centrale est une stratégie de transfert cross-modal sur cartographie sémantique : le réseau apprend d'abord uniquement à partir de texte, puis transfère ces représentations, au moment du test, vers une cartographie multimodale combinant localisation spatiale précise des objets et représentations visuelles généralisables. Les auteurs annoncent une généralisation robuste vers des objets-cibles inédits, validée sur les benchmarks établis d'ObjectNav, malgré un entraînement reposant sur des mises en page textuelles limitées en nombre d'objets. Pour l'industrie robotique et les intégrateurs, ce travail cible un problème concret de coût et de latence : les approches actuelles de navigation en vocabulaire ouvert, qui appellent un LLM à chaque décision ou nécessitent des heures d'entraînement RL par environnement, restent difficiles à déployer à grande échelle sur des robots mobiles autonomes (AMR) ou des plateformes d'inspection. En montrant qu'un réseau de prédiction d'objectifs basé sur une carte sémantique peut généraliser sans réentraînement lourd ni appel LLM en boucle, OVExp propose une alternative aux architectures VLA gourmandes en ressources, ce qui intéresse directement tout acteur cherchant à doter des robots de capacités de recherche d'objets flexibles sans exploser les coûts d'inférence en production. Ce travail s'inscrit dans la lignée des recherches sur ObjectNav, la tâche de navigation vers un objet-cible désigné par catégorie ou par image dans un environnement inconnu, un benchmark phare de la navigation embarquée depuis plusieurs années. Il se positionne face à deux familles de méthodes concurrentes : celles qui exploitent des LLM sans entraînement supplémentaire pour raisonner sur la scène, coûteuses en inférence, et celles qui affinent des politiques par RL de bout en bout, limitées en généralisation hors distribution. En s'appuyant sur CLIP, déjà largement utilisé pour l'ancrage vision-langage, et sur un entraînement texte-seul transférable au moment du test, les auteurs proposent une voie plus économe en ressources. Publié en v2 sur arXiv, l'article reste à ce stade une contribution académique évaluée en simulation, sans annonce de déploiement matériel ni de partenariat industriel.

RecherchePaper
1 source
Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus
231arXiv cs.RO 

Adaptation biomécanique guidée par la physique de la démarche pour la locomotion humanoïde sur terrains extrêmement pentus

Des chercheurs présentent HumoSlope, un framework d'apprentissage par renforcement en deux étapes conçu pour la locomotion humanoïde sur pentes raides, détaillé dans un article publié sur arXiv (référence 2607.07830v1). Le constat de départ : avec des formulations de récompense génériques, les politiques de RL convergent souvent vers des démarches lentes et prudentes, en position accroupie et centre de masse abaissé, pour compenser le biais gravitationnel constant imposé par un terrain incliné. La première étape du framework introduit un régularisateur ZMP (Zero Moment Point) adapté à la pente, évalué directement sur le plan de support incliné local plutôt que sur une référence horizontale globale, ce qui établit un a priori d'équilibre cohérent avec le terrain. La seconde étape, baptisée Biomechanical Slope Gait Adapter (BSGA), exploite des descripteurs macroscopiques du terrain comme signaux privilégiés, disponibles uniquement à l'entraînement, pour moduler dynamiquement la hauteur du centre de masse et la coordination des membres inférieurs selon la géométrie de pente estimée, favorisant une propulsion dominée par la hanche en montée et un freinage piloté par le genou en descente. Point notable : l'acteur finalement déployé reste entièrement proprioceptif, sans capteur extéroceptif embarqué. Les essais sim-to-real ont permis une traversée aveugle et continue de pentes herbeuses extérieures atteignant 62,7 % d'inclinaison, soit 32,1 degrés. L'intérêt principal tient à la démonstration qu'un contrôle purement proprioceptif, sans vision ni LiDAR embarqués, peut gérer des pentes extrêmes en conditions réelles extérieures, réduisant la dépendance à une perception embarquée coûteuse et fragile hors environnement contrôlé. Le résultat contredit aussi l'idée qu'un RL générique suffit : sans priors physiques et biomécaniques explicites, les politiques dégénèrent vers des démarches accroupies sous-optimales. Pour les acteurs de l'humanoïde, dont la plupart des déploiements actuels restent cantonnés aux sols plats d'usine ou d'entrepôt, ce travail pointe une voie concrète pour élargir la robustesse en terrain extérieur non structuré, une faiblesse encore largement non résolue du secteur. La locomotion humanoïde par apprentissage par renforcement a fortement progressé ces dernières années sur terrains plats ou discrets, marches et escaliers notamment, mais les pentes raides restent un axe peu exploré comparé à d'autres défis comme les obstacles ou les terrains accidentés. Aucune plateforme robotique commerciale n'est nommée dans l'article, qui reste à ce stade une contribution de recherche validée en simulation puis en conditions réelles. Les suites naturelles évoquées incluent l'intégration à des piles de contrôle plus larges et des tests sur d'autres surfaces comme la neige, le gravier ou la boue.

RecherchePaper
1 source
StreamVLN : navigation vision-langage en flux continu via modélisation contextuelle SlowFast
232arXiv cs.RO 

StreamVLN : navigation vision-langage en flux continu via modélisation contextuelle SlowFast

Chercheurs présentent StreamVLN, un framework de navigation vision-langage (VLN) conçu pour fonctionner en flux continu plutôt que sur des séquences vidéo pré-découpées. Publié sur arXiv (version 2, remplaçant une première mouture du 05/07/2025 sous la référence 2507.05240), le système repose sur une architecture dite "slow-fast" : un contexte de dialogue rapide gère une fenêtre glissante d'échanges multi-tours pour générer des actions avec une latence minimale, tandis qu'une mémoire à mise à jour lente compresse l'historique visuel via une stratégie d'élagage de tokens tenant compte de la géométrie 3D de la scène. Grâce à la réutilisation du cache KV, StreamVLN maintient des dialogues en temps réel sur des flux vidéo longs, avec une taille de contexte et un coût d'inférence bornés, quelle que soit la durée du flux. Sur les benchmarks VLN-CE, référence du domaine pour évaluer la navigation guidée par instructions en environnement continu, les auteurs revendiquent des performances état de l'art combinées à une faible latence. L'enjeu dépasse la simple performance sur benchmark : les modèles vidéo-LLM appliqués à la navigation robotique butent généralement sur un compromis entre compréhension visuelle fine, mémorisation du contexte long terme et coût de calcul, un compromis qui freine leur déploiement embarqué sur robots mobiles ou humanoïdes à ressources limitées. En bornant le coût d'inférence indépendamment de la longueur du flux vidéo, StreamVLN répond directement à un obstacle pratique du secteur : faire tourner un agent VLA (vision-language-action) en continu, sans dérive de latence ni explosion mémoire, condition nécessaire pour une navigation autonome réactive en environnement réel plutôt qu'en simulation contrôlée ou sur clips vidéo courts. Le travail s'inscrit dans la lignée des approches VLN basées sur des Video-LLM apparues ces deux dernières années, qui cherchaient à exploiter les capacités de raisonnement multimodal de ces modèles pour l'instruction-following robotique, au prix jusqu'ici d'architectures gourmandes en contexte. La publication d'une version 2 sur arXiv indique une itération après retours ou revue, sans changement de statut : il s'agit toujours d'un travail de recherche, avec code et démonstrations disponibles sur la page projet (streamvln.github.io), et non d'un produit ou d'un déploiement industriel annoncé. La suite logique pour ce type d'approche reste son intégration et sa validation sur plateformes robotiques physiques, au-delà des benchmarks simulés VLN-CE.

RechercheActu
1 source
Adaptation de la planification avec pensées vision-langage entrelacées
233arXiv cs.RO 

Adaptation de la planification avec pensées vision-langage entrelacées

Une équipe de recherche présente APIVOT (Adaptive Planning with Interleaved Vision-Language Thoughts), un planificateur pour robots basé sur un modèle vision-langage (VLM), détaillé dans un article publié sur arXiv le 8 juillet 2026 (référence 2607.08024v1). Le système cible la planification à long horizon, c'est-à-dire des tâches robotiques composées de plusieurs étapes successives, comme des scénarios de cuisine impliquant la manipulation d'objets dans un espace contraint. Sa particularité est d'alterner de façon adaptative entre deux types de raisonnement: du texte pour décomposer les objectifs, sélectionner les objets pertinents et séquencer les actions, et des représentations visuelles générées pour imaginer les états futurs de la scène et vérifier en interne si un plan est géométriquement réalisable, notamment en cas d'espace libre limité ou de risque de collision entre objets. Sur des tâches de cuisine à long horizon, APIVOT surpasse à la fois des VLM généralistes et les frameworks de planification existants, avec l'écart de performance le plus marqué dans les environnements les plus contraints spatialement. Ce résultat s'inscrit dans un débat central pour l'industrie robotique: les modèles vision-langage-action (VLA) et les grands VLM généralistes savent-ils vraiment raisonner sur la géométrie d'une scène, ou se contentent-ils d'un raisonnement sémantique de surface qui échoue dès que l'espace se complique. En montrant qu'un module de vérification visuelle interne améliore concrètement le taux de succès et l'efficacité du raisonnement, APIVOT apporte un argument en faveur d'architectures hybrides plutôt que de VLM purement textuels pour la planification robotique, un enjeu direct pour les intégrateurs qui déploient des bras ou robots mobiles autonomes dans des environnements encombrés. L'article se positionne explicitement par rapport aux VLM généralistes et aux frameworks de planification antérieurs, utilisés comme lignes de base de comparaison, sans toutefois nommer de plateforme robotique commerciale précise ni d'acteur industriel. Il s'agit à ce stade d'une contribution de recherche évaluée en simulation ou en environnement contrôlé de cuisine, sans indication de déploiement produit ni de partenariat industriel annoncé; les auteurs présentent le "modality selection" adaptatif comme la piste principale à explorer pour les futurs systèmes de planification robotique.

RecherchePaper
1 source
Robot binoculaire non préhensile : apprentissage de primitives de manipulation par catégorie
234arXiv cs.RO 

Robot binoculaire non préhensile : apprentissage de primitives de manipulation par catégorie

BiNoMaP présente un nouveau cadre pour l'apprentissage de primitives de manipulation bimanuelle non préhensile, c'est-à-dire des gestes robotiques qui ne saisissent pas l'objet mais le manipulent par contact, comme pousser, faire pivoter, envelopper ou pousser du bout des doigts. Contrairement à la plupart des travaux antérieurs limités à un seul bras ou dépendants de supports environnementaux favorables (murs, rebords), les chercheurs proposent une configuration bimanuelle générique. Leur méthode se distingue aussi par son approche sans apprentissage par renforcement (RL-free), articulée en trois étapes: extraction de trajectoires de mouvement des mains à partir de vidéos de démonstration en vue égocentrique, puis raffinement de ces trajectoires brutes via un algorithme d'optimisation géométrique pour corriger le bruit de perception et les écarts morphologiques entre humain et robot, et enfin paramétrage des primitives selon des attributs géométriques de l'objet, principalement sa taille, pour permettre une généralisation à des instances inédites. Les primitives ont été testées sur deux plateformes robotiques bimanuelles réelles aux configurations cinématiques distinctes, démontrant un transfert cross-embodiment sans redesign de la structure des compétences. L'intérêt pour l'industrie robotique tient à l'angle mort que ce travail comble: la manipulation non préhensile reste largement sous-exploitée car son caractère riche en contacts la rend difficile à modéliser analytiquement, alors que de nombreuses tâches industrielles ou domestiques (repositionner un objet encombrant, l'orienter, le pousser dans un bac) ne se prêtent pas à une simple préhension. En s'appuyant sur des démonstrations vidéo plutôt que sur du RL coûteux en simulation, l'approche répond aussi à un problème récurrent du secteur, le fossé entre simulation et réalité (sim-to-real gap), en apprenant directement des trajectoires exécutables. Pour les intégrateurs et décideurs B2B travaillant sur des bras bimanuels ou des plateformes humanoïdes à deux bras, cela suggère une voie pour doter les robots de compétences de manipulation plus polyvalentes sans multiplier les cycles d'entraînement par RL ni redessiner les primitives à chaque changement de robot. Ce travail s'inscrit dans la lignée des recherches en apprentissage par imitation à partir de vidéos humaines, un axe de plus en plus exploré face aux limites du RL pur pour les tâches de contact complexes, aux côtés d'approches VLA comme GR00T N2 ou Pi-0 qui visent la généralisation à l'échelle. La publication, une version révisée d'un article initialement déposé sur arXiv (2509.21256), a été validée par des expériences robot réel sur "divers objets et configurations spatiales", sans toutefois préciser de partenaire industriel ou de calendrier de déploiement commercial. Aucun acteur français ou européen n'est mentionné dans cette publication, qui reste à ce stade un travail de recherche académique plutôt qu'un produit prêt à déployer.

RecherchePaper
1 source
SeFA-Policy : apprentissage rapide et précis de politiques visuomotrices par alignement de flux sélectif
235arXiv cs.RO 

SeFA-Policy : apprentissage rapide et précis de politiques visuomotrices par alignement de flux sélectif

Une équipe de recherche a publié SeFA-Policy (Selective Flow Alignment), une nouvelle méthode d'apprentissage de politiques visuomotrices par imitation pour la robotique, décrite dans une version révisée sur arXiv (2511.08583v2) et accompagnée d'un code source disponible sur GitHub (RongXueZoe/SeFA). Le problème ciblé concerne les approches récentes de "rectified flow", qui accélèrent la génération d'actions robotiques mais souffrent d'un défaut connu : après distillation itérative, les actions générées finissent par dévier des actions réelles associées à l'observation visuelle en cours, ce qui accumule l'erreur au fil des cycles de reflow et déstabilise l'exécution des tâches. SeFA introduit un mécanisme de correction de cohérence qui réaligne sélectivement les actions générées sur les démonstrations expertes, tout en conservant la capacité du modèle à représenter plusieurs solutions possibles (multimodalité). Sur des tâches de manipulation simulées et réelles, les auteurs annoncent une précision et une robustesse supérieures aux politiques de référence basées sur la diffusion ou sur le flow, avec une latence d'inférence réduite de plus de 98%. Pour l'industrie robotique, l'enjeu dépasse la performance académique brute : le goulot d'étranglement des politiques par diffusion a toujours été le nombre d'étapes de débruitage nécessaires à chaque décision, incompatible avec du contrôle temps réel sur bras manipulateurs ou robots mobiles. Les méthodes à un seul pas d'inférence promettent de lever ce verrou, mais au prix, jusqu'ici, d'une fidélité dégradée aux observations réelles. En traitant explicitement ce compromis précision/vitesse plutôt qu'en l'ignorant, SeFA apporte un signal utile aux intégrateurs qui évaluent si les politiques de type flow sont mûres pour un déploiement embarqué, au-delà des démonstrations en laboratoire. Ce travail s'inscrit dans la lignée des Diffusion Policy puis des politiques par rectified flow, apparues ces deux dernières années comme alternative aux architectures de type transformer pour l'apprentissage par imitation en robotique. Il se positionne explicitement contre les méthodes de diffusion et de flow "state of the art" existantes, sans toutefois nommer d'acteur industriel ni annoncer de déploiement commercial : il s'agit d'une contribution de recherche, publiée en v2 après une première soumission, avec code ouvert pour reproduction par la communauté.

RechercheActu
1 source
TriphiBot : un robot triphibie combinant propulsion FOC et conception excentrique
236arXiv cs.RO 

TriphiBot : un robot triphibie combinant propulsion FOC et conception excentrique

TriphiBot est un robot capable de trois modes de déplacement, aérien, terrestre et aquatique, présenté dans un article arXiv (2602.01385v2, version révisée). Le design combine une structure de quadricoptère classique avec deux roues passives, sans actionneur supplémentaire dédié à la locomotion terrestre. Les chercheurs ont introduit un centre de gravité excentré qui aligne naturellement la poussée des rotors avec la direction de déplacement au sol, évitant ainsi les mécanismes de transformation mécanique complexes habituellement nécessaires. Pour piloter la propulsion dans l'air comme dans l'eau, deux milieux aux propriétés très différentes, l'équipe a développé un système unifié basé sur le contrôle orienté champ (FOC), qui résout les problèmes d'adéquation du couple moteur et permet une poussée bidirectionnelle rapide et précise. La stabilité du robot et ses transitions entre domaines reposent sur un système de contrôle hybride combinant commande prédictive non linéaire (HNMPC) et PID. Les essais expérimentaux confirment la capacité du robot à se mouvoir dans les trois milieux et à transiter entre eux. L'intérêt de ce travail tient à son adressage d'un angle mort de la robotique multi-domaine: la plupart des robots dits amphibies ou hybrides existants ne gèrent que deux modes de déplacement, et les rares designs triphibiques souffrent soit d'une complexité mécanique élevée, soit d'une propulsion peu efficace au sol. En proposant une architecture minimaliste, sans actionneur additionnel, et un système de propulsion unique capable de s'adapter électroniquement (via FOC) plutôt que mécaniquement aux deux fluides, TriphiBot ouvre une voie pour des robots plus légers et plus simples à fabriquer, potentiellement utiles pour l'inspection, la surveillance environnementale ou les interventions en zones sinistrées mêlant terre, air et eau. Ce travail s'inscrit dans la lignée des recherches sur les robots multi-modaux, où la plupart des designs antérieurs privilégiaient des architectures dédiées à deux milieux avec des mécanismes de transformation spécifiques pour chaque transition. En misant sur l'excentricité du centre de gravité plutôt que sur des pièces mobiles supplémentaires, et sur un contrôle électronique unifié plutôt que sur des propulseurs séparés par milieu, les auteurs positionnent leur approche comme une alternative plus sobre face aux plateformes triphibiques à haute complexité mécanique. L'article, publié en version révisée sur arXiv, reste à ce stade une validation expérimentale en laboratoire, sans indication de déploiement ou de partenariat industriel.

RecherchePaper
1 source
X-ACTA : algorithme de distribution de tension du centre analytique étendu pour robots parallèles à câbles fixes et mobiles
237arXiv cs.RO 

X-ACTA : algorithme de distribution de tension du centre analytique étendu pour robots parallèles à câbles fixes et mobiles

Les robots parallèles à câbles (Cable-Driven Parallel Robots, CDPR) utilisent plusieurs câbles tendus pour déplacer une plateforme mobile, une architecture prisée pour les grandes portées et les charges lourdes, du levage industriel à l'assistance médicale. Leur fonctionnement reste toutefois contraint à un espace de travail dit "faisable en efforts" (Wrench-Feasible Workspace, WFW), une zone où les tensions de câbles peuvent équilibrer les forces externes sans jamais devenir négatives. Un article publié sur arXiv (identifiant 2607.08265) propose une méthode baptisée X-ACTA (eXtended Analytic Center Tension distribution Algorithm), conçue pour piloter ces robots au-delà de ce WFW, notamment lors de manœuvres agressives ou après la rupture d'un câble. La méthode étend l'approche dite du "centre analytique" en conservant des profils de tension continus et différentiables, une convergence rapide vers une solution unique compatible avec un usage temps réel, et des contraintes non linéaires prises en compte nativement. Contrairement aux formulations existantes basées sur le relâchement de câbles ("slack-based"), elle limite les erreurs de torseur (wrench) à une zone marginale du WFW. Les auteurs valident la supériorité de leur méthode en douceur des trajectoires et en précision d'effort via une dominance de Pareto face à l'état de l'art, complétée par des expériences numériques. Cette avancée touche un point aveugle connu des CDPR : la plupart des algorithmes de calcul de tensions fonctionnent bien à l'intérieur du WFW, mais deviennent instables ou imprécis dès qu'un robot en sort, que ce soit volontairement pour étendre sa portée opérationnelle ou accidentellement après une défaillance matérielle. Pour les intégrateurs industriels qui déploient des CDPR fixes ou mobiles dans des environnements exigeants, comme les grands entrepôts, les chantiers ou les applications de levage, disposer d'un contrôleur capable de gérer une perte de câble sans à-coups ni divergence numérique est un enjeu direct de sécurité et de continuité opérationnelle. La différentiabilité garantie par X-ACTA facilite aussi son intégration dans des boucles de commande plus larges, un critère souvent négligé par les méthodes purement géométriques. Le calcul de la distribution des tensions dans les CDPR est un sujet mature en robotique, mais la littérature s'est historiquement concentrée sur l'optimisation à l'intérieur du WFW plutôt que sur la robustesse aux sorties de cet espace. X-ACTA s'inscrit dans une lignée de travaux cherchant à combler ce manque, en se positionnant explicitement contre les méthodes "slack-based" dominantes. L'article, encore au stade de preprint, ouvre la voie à des implémentations sur robots à câbles mobiles et fixes, sans toutefois préciser à ce stade de partenaire industriel ou de calendrier de transfert vers un produit commercial.

RecherchePaper
1 source
Harness VLA : orienter les VLA figés vers des primitives de manipulation fiables via des agents guidés par la mémoire
238arXiv cs.RO 

Harness VLA : orienter les VLA figés vers des primitives de manipulation fiables via des agents guidés par la mémoire

Des chercheurs présentent Harness VLA, un framework agentique décrit dans un article publié le 10 juillet 2026 sur arXiv (2607.08448v1), qui vise à rendre les modèles Vision-Language-Action (VLA) plus fiables sans réentraînement. Le système transforme un VLA figé en une primitive de manipulation "contact-rich" réessayable, orchestrée par un agent doté de mémoire et couplée à une bibliothèque fixe de primitives analytiques couvrant le grounding, le staging, le transport, la navigation et le relâchement d'objet. Plutôt que d'élargir le répertoire de compétences du robot, le harness apprend la plage de fonctionnement de ces primitives à partir de traces d'exécution spécifiques à la tâche, de règles de succès globales et de modèles d'échec. Testé sur trois bancs d'essai simulés perturbés (manipulation de table, cuisine domestique, et manipulation bimanuelle avec transfert propre-vers-aléatoire), le système améliore les performances de 38,6 points de pourcentage sur LIBERO-Pro et de 25,4 points sur RoboCasa365 par rapport aux meilleures baselines existantes, et atteint 58,4% de réussite sur RoboTwin C2R. Ce travail s'attaque à un problème central dans le déploiement des VLA end-to-end : entraînés sur des trajectoires en distribution, ces modèles s'effondrent souvent dès que le contexte de déploiement s'écarte du jeu d'entraînement, que ce soit par un changement sémantique de la tâche, un repositionnement spatial des objets ou une instabilité de contact locale. Les agents LLM apportent un raisonnement compositionnel complémentaire, mais échouent typiquement sur les phases de préhension irrégulière, de placement contraint ou d'interaction avec des objets articulés, précisément là où les VLA excellent. En confiant au planificateur le re-ancrage sémantique et l'exécution non contactuelle, et en réservant le VLA figé aux phases de contact fin, Harness VLA prolonge la distribution effective des compétences d'un modèle pré-entraîné sans le retoucher. Pour les intégrateurs et les équipes de recherche en robotique, l'intérêt est double : cela réduit le coût de réentraînement à chaque nouvel environnement et adresse directement l'écart entre démonstrations contrôlées et robustesse en conditions perturbées, un point sensible depuis que la plupart des annonces commerciales de robots humanoïdes s'appuient sur des vidéos filtrées. Le papier s'inscrit dans la lignée des travaux récents combinant modèles VLA (Pi-0, GR00T N2, Helix, ou les architectures propriétaires de Figure et Tesla Optimus) avec des couches de planification symbolique, une tendance qui s'accélère à mesure que les limites du end-to-end pur en dehors du laboratoire deviennent visibles. Contrairement à des approches qui étendent le répertoire de compétences via de nouvelles données ou du finetuning, Harness VLA mise sur l'orchestration et la mémoire d'exécution pour exploiter au mieux un modèle existant, une direction qui pourrait intéresser les acteurs cherchant à déployer des VLA génériques sur du matériel varié sans long cycle de réentraînement. Les résultats restent pour l'instant limités à des bancs d'essai simulés (LIBERO-Pro, RoboCasa365, RoboTwin C2R) ; aucun déploiement sur robot physique n'est mentionné dans l'abstract, ce qui invite à la prudence avant d'extrapoler ces gains à des conditions réelles d'usine ou de foyer.

RechercheActu
1 source
Système d'exploitation de tubes spatiotemporels sous contraintes d'entrée pour la navigation sûre de systèmes Euler-Lagrange inconnus en environnements dynamiques
239arXiv cs.RO 

Système d'exploitation de tubes spatiotemporels sous contraintes d'entrée pour la navigation sûre de systèmes Euler-Lagrange inconnus en environnements dynamiques

Une équipe de chercheurs propose un nouveau cadre de contrôle en temps réel permettant à des robots dont la dynamique est inconnue de naviguer en sécurité dans des environnements changeants, tout en respectant les limites physiques de leurs actionneurs. Publiés sur arXiv (2607.08189v1), ces travaux étendent le cadre des « spatiotemporal tubes » (STT), une technique qui définit des corridors de trajectoires garantissant qu'un système atteint une zone cible, évite les obstacles et s'y maintient dans un temps fini, propriété désignée par les auteurs sous l'acronyme FT-RAS (finite-time reach-avoid-stay). La nouveauté consiste à intégrer explicitement les contraintes d'entrée, c'est-à-dire la puissance ou le couple maximal disponible sur les actionneurs, directement dans la conception du contrôleur, avec des conditions de faisabilité vérifiables hors ligne. L'approche a été validée par simulation sur trois types de systèmes Euler-Lagrange, un robot mobile, un quadrotor et un engin spatial, ainsi que par des expériences matérielles sur un robot mobile réel. L'enjeu dépasse la démonstration académique. La plupart des méthodes de navigation sûre reposent soit sur un modèle dynamique précis du robot, rarement disponible en conditions réelles, soit sur une optimisation résolue en continu pendant le mouvement, coûteuse en calcul et difficile à certifier en temps réel. En s'affranchissant de ces deux contraintes, ce cadre dit « approximation-free » vise les cas concrets où les robots opèrent dans des environnements dynamiques avec une puissance d'actionnement limitée, un enjeu direct pour les intégrateurs déployant des AMR ou des drones en entrepôt, où sous-estimer les limites moteur peut compromettre les garanties de sécurité formulées en amont. Le papier se positionne comme une extension du cadre STT existant, en réponse à une limite connue des méthodes de contrôle sûr comparables, comme les fonctions barrières de contrôle ou la commande prédictive, qui exigent généralement soit un modèle fiable soit une résolution d'optimisation embarquée. Il s'agit ici d'un résultat de recherche théorique et expérimentale à petite échelle, sans annonce de déploiement industriel ni de partenaire commercial identifié à ce stade.

RecherchePaper
1 source
SkillPlug : extraction non supervisée de compétences pour l'adaptation en few-shot dans la manipulation robotique
240arXiv cs.RO 

SkillPlug : extraction non supervisée de compétences pour l'adaptation en few-shot dans la manipulation robotique

Une équipe de recherche publie sur arXiv (arXiv:2607.08354v1, soumission nouvelle) SkillPlug, un framework destiné à l'apprentissage par imitation visuomotrice en robotique de manipulation. Le système se présente comme un module "plug-in" qui vient s'ajouter à une politique visuomotrice existante : il ajoute un module de conditionnement par compétences ("skill-conditioning") et extrait, à partir de démonstrations multi-tâches brutes et sans supervision, une bibliothèque de compétences partagée et réutilisable. L'extraction repose sur des objectifs auto-supervisés conçus pour produire des primitives comportementales compactes, non redondantes et transférables d'une tâche à l'autre. Une fois cette bibliothèque figée, l'adaptation à une nouvelle tâche ne nécessite plus qu'un réentraînement léger : seuls un routeur et une tête d'action sont ajustés, sans réentraînement complet de bout en bout. Les auteurs rapportent des tests sur deux bancs d'essai en simulation et sur un robot réel, avec une amélioration observée à la fois en performance multi-tâches et en adaptation à partir de peu de démonstrations (few-shot). L'abstract ne fournit toutefois aucun chiffre précis de gain de taux de réussite ni détail sur les bancs de test utilisés, ce qui limite la portée vérifiable des résultats à ce stade. L'enjeu pratique visé est réel pour les intégrateurs robotiques : la plupart des politiques actuelles sont entraînées de bout en bout et n'offrent aucune structure explicite pour réutiliser des comportements déjà appris, ce qui rend le transfert vers de nouvelles tâches coûteux en données. En figeant une bibliothèque de compétences et en ne réentraînant qu'un routeur léger, SkillPlug promet une adaptation à moindre coût de calcul et de données, un point sensible pour tout déploiement industriel où recollecter des centaines de démonstrations par nouvelle tâche n'est pas viable économiquement. Ce travail s'inscrit dans un courant de recherche plus large qui cherche à réintroduire une structure compositionnelle (bibliothèques de compétences, primitives réutilisables) dans des politiques d'apprentissage par imitation de plus en plus dominées par des modèles monolithiques de type VLA (vision-language-action). Il s'agit ici d'une publication de recherche académique, sans acteur industriel ni produit commercial associé, et sans mention de comparaison directe avec des systèmes VLA à grande échelle déployés dans l'industrie. Les prochaines étapes attendues seraient une évaluation à plus grande échelle et une comparaison chiffrée face aux approches de politique de bout en bout dominantes.

RecherchePaper
1 source
Time-to-collision : évitement dynamique d'obstacles pour robots en environnements non structurés via modèles de vision préentraînés
241arXiv cs.RO 

Time-to-collision : évitement dynamique d'obstacles pour robots en environnements non structurés via modèles de vision préentraînés

Voici l'article traduit et résumé : Une équipe de recherche présente une méthode d'évitement d'obstacles dynamiques pour robots mobiles autonomes évoluant en extérieur, dans des environnements non structurés, publiée sur arXiv (arXiv:2607.07885v1). Contrairement aux approches classiques qui nécessitent un entraînement massif spécifique au robot ou des politiques apprises en simulation, cette méthode fonctionne entièrement sur données réelles et évite le problème de transfert simulation-vers-réel. Le pipeline s'appuie sur UniDepth, un modèle pré-entraîné d'estimation de profondeur monoculaire, pour générer des cartes de profondeur denses à partir d'une simple caméra RGB, sans besoin de stéréovision ni de LiDAR au moment de l'inférence. Le système étend le pipeline de correspondance de points-clés SuperPoint et SuperGlue pour suivre des points caractéristiques sur de longues séquences d'images, les projeter en 3D via les intrinsèques caméra et la profondeur estimée, puis calculer un ajustement de faisceaux et un temps avant collision (TTC) par point-clé. Une primitive de mouvement 2D dans le plan au sol permet ensuite d'éloigner le robot du point de rapprochement minimal. Testée sur le jeu de données réel M3ED, la méthode atteint une précision de 0,49 et un rappel de 0,38 pour détecter les images avec un TTC réel inférieur à une seconde, et génère la bonne direction d'évitement dans 84% des détections correctes. Elle détecte au moins une image à risque pour 20 des 22 obstacles physiques uniques testés. L'intérêt principal tient à l'efficacité en données: seulement 74 secondes de données ont suffi pour le réglage des hyperparamètres, contre des milliers d'heures habituellement nécessaires aux méthodes end-to-end apprises. Pour les intégrateurs et décideurs en robotique mobile, cela ouvre une voie de déploiement rapide sans les coûts d'entraînement massif ni les risques de décalage sim-to-real, un problème persistant qui limite la fiabilité des politiques apprises en simulation lors du transfert vers le monde réel. Les chiffres de précision et rappel restent toutefois modestes (0,49 et 0,38), signe que la méthode n'est pas encore prête pour un déploiement critique sans garde-fous supplémentaires, mais la comparabilité et l'interprétabilité de l'approche par rapport aux boîtes noires apprises constituent un argument de poids pour la robotique de sécurité. Cette approche s'inscrit dans une tendance plus large de réutilisation de modèles de vision pré-entraînés à grande échelle (comme UniDepth, SuperPoint, SuperGlue) pour construire des briques robotiques sans réentraînement spécifique, une alternative aux politiques VLA ou aux pipelines de bout en bout qui dominent actuellement la recherche en navigation autonome. Elle se positionne face aux méthodes de simulation-vers-réel largement utilisées chez les acteurs de la robotique mobile et de la navigation extérieure, en misant sur l'interprétabilité plutôt que sur la performance brute. Les auteurs évoquent des perspectives d'amélioration de la précision et du rappel, ainsi qu'une validation plus large sur davantage de types d'obstacles et de conditions environnementales.

RecherchePaper
1 source
Politique de non-fabrication : je ne dois pas inventer de traduction pour un titre d'article sans contexte vérifiable au-delà de ce qui est donné, mais ici la tâche est simplement de traduire le titre fourni, donc je peux procéder
242arXiv cs.RO 

Politique de non-fabrication : je ne dois pas inventer de traduction pour un titre d'article sans contexte vérifiable au-delà de ce qui est donné, mais ici la tâche est simplement de traduire le titre fourni, donc je peux procéder

Des chercheurs publient sur arXiv (2607.08283) une nouvelle architecture baptisée TFP (Temporally Conditioned Memory-Fusion Policies), conçue pour améliorer les politiques vision-langage-action (VLA) comme π0.5 ou OpenVLA, aujourd'hui limitées par leur caractère réactif : l'action suivante est prédite uniquement à partir de l'observation courante, sans mémoire de la progression de la tâche. TFP ajoute une croyance locale à l'épisode, mise à jour via une dynamique de type Liquid Time-Constant, injectée directement dans le décodeur d'action par flow-matching. Avec un modèle de 3,3 milliards de paramètres, le taux de succès moyen passe de 96,9% à 98,75% sur le benchmark LIBERO et de 91,4% à 93,77% sur LIBERO-plus. Sur le diagnostic MIKASA ShellGameTouch, spécifiquement conçu pour tester la mémoire, TFP atteint jusqu'à 75% de réussite. Les auteurs montrent aussi que les variations du gain d'écriture de la mémoire sont environ six fois plus fortes près des événements de manipulation (contact, relâchement, sous-objectif) que dans les phases stables. Pour l'industrie robotique, ce travail cible un angle mort connu des VLA actuels : la gestion des tâches à étapes, où deux états visuellement identiques nécessitent des actions différentes selon l'historique des interactions, par exemple lors d'occlusions temporaires ou de sous-tâches séquentielles. Un module de mémoire événementielle, plutôt qu'un simple historique passif, pourrait réduire les échecs sur des manipulations complexes en usine ou en logistique, sans nécessiter de refonte complète des backbones VLA existants. Le papier s'inscrit dans la lignée des travaux sur les politiques génératives par flow-matching, après RT-2, OpenVLA et la famille π0 de Physical Intelligence, ainsi que GR00T N2 de NVIDIA. Il s'agit ici d'une contribution de recherche académique évaluée sur des benchmarks de simulation (LIBERO, MIKASA), sans déploiement réel ni intégration annoncée sur un robot commercial. Les auteurs présentent TFP comme un module greffable sur des backbones VLA existants, une piste à confirmer sur des tâches physiques réelles plutôt qu'en simulation.

RechercheActu
1 source
FSD-VLN : modélisation duale rapide-lente pour la navigation aérienne vision-langage à long horizon
243arXiv cs.RO 

FSD-VLN : modélisation duale rapide-lente pour la navigation aérienne vision-langage à long horizon

Des chercheurs publient sur arXiv (papier 2607.08359, juillet 2026) FSD-VLN, une architecture de navigation aerienne guidee par le langage destinee aux drones (UAV) evoluant en environnement inconnu, sans dependance GPS ni trajectoire preprogrammee. Le systeme repose sur deux flux asynchrones : un flux "lent" qui extrait des priors semantiques stables a partir de modeles vision-langage pre-entraines, et un flux "rapide" fonde sur un Diffusion Transformer (DiT) qui modelise les distributions d'actions dans le temps pour generer des commandes de vol coherentes. Un optimiseur adaptatif sensible au temps a ete integre pour stabiliser l'entrainement sur de longues sequences et limiter les oscillations de gradient. En simulation a grande echelle sur des scenarios de vol a basse altitude, FSD-VLN atteint un taux de reussite de navigation jusqu'a deux fois superieur aux methodes de reference sur des scenes inedites, tout en reduisant de plus de 50% le delai d'inference par action et la duree totale des taches. L'enjeu technique vise juste : les systemes de navigation aerienne par langage souffrent generalement d'un desalignement entre comprehension multimodale globale et generation d'actions sequentielles, ce qui produit des trajectoires saccadees et une latence de decision penalisante sur les missions longues. En decouplant explicitement raisonnement semantique et generation de commandes bas niveau, FSD-VLN reprend une logique "systeme rapide / systeme lent" deja explorée cote robotique humanoide (Pi-0, GR00T N2, Helix) et l'applique au vol de drone, un domaine ou la contrainte de latence est encore plus stricte qu'au sol. Pour les integrateurs de drones industriels (inspection, logistique, surveillance), c'est une piste credible pour rendre la navigation instructable en langage naturel viable sur des taches longues, meme si les gains annonces restent, a ce stade, mesures uniquement en simulation. La navigation vision-langage (VLN) s'est imposee ces dernieres annees comme alternative aux systemes GPS-dependants, en promettant une interaction homme-machine plus intuitive et une meilleure adaptabilite environnementale, au prix d'une charge de calcul et de coordination bien plus lourde qu'un pilotage classique. FSD-VLN s'inscrit dans une lignee de travaux cherchant a resoudre ce compromis vitesse/comprehension, deja au cœur des debats sur les modeles VLA en robotique generale. Les auteurs presentent leurs resultats comme un "paradigme pratique" plutot qu'un systeme deploye : la prochaine etape logique, non couverte par cette publication, sera la validation en conditions de vol reelles, seule capable de confirmer si les gains constates en simulation resistent au bruit sensoriel et aux perturbations physiques du monde reel.

RechercheActu
1 source
Collaboration entre agents pour le diagnostic d'anomalies en robotique sous-marine
244arXiv cs.RO 

Collaboration entre agents pour le diagnostic d'anomalies en robotique sous-marine

Un article de recherche mis à jour sur arXiv (identifiant 2511.03075, version 2) présente AURA, pour Autonomous Resilience Agent, un framework de diagnostic d'anomalies et de pannes destiné à la robotique sous-marine. Le système combine deux agents distincts : un agent de bas niveau, chargé de la caractérisation d'état, qui surveille en continu la télémétrie du robot et traduit les signaux bruts en une description structurée du problème en langage naturel ; et un agent de raisonnement diagnostique de haut niveau, qui mène un dialogue guidé par des connaissances externes avec un opérateur humain pour identifier la cause racine d'une anomalie. L'ensemble s'appuie sur un jumeau numérique haute fidélité et sur de grands modèles de langage (LLM), avec une boucle homme-dans-la-boucle explicite. Une fois qu'un diagnostic est validé par un opérateur, il est reconverti en exemple d'entraînement pour affiner le modèle perceptif de bas niveau. Les auteurs ne publient pas de résultats chiffrés de déploiement dans le résumé ; il s'agit d'une contribution de recherche décrivant l'architecture et une implémentation de référence, pas d'un produit commercialisé. L'intérêt principal de ce travail tient au terrain qu'il cible : les véhicules sous-marins autonomes évoluent dans des environnements où la connectivité est intermittente et où une panne non anticipée peut être coûteuse, voire dangereuse, ce qui rend l'automatisation intégrale du diagnostic risquée sans supervision humaine. En positionnant explicitement l'IA comme partenaire évolutif plutôt qu'outil figé, AURA répond à une critique répandue envers les systèmes autonomes classés comme boîtes noires, en gardant l'humain dans la boucle de validation tout en capitalisant sur chaque cas traité pour améliorer le modèle. Pour les intégrateurs de robotique sous-marine et les opérateurs de flottes d'AUV, ce type d'architecture ouvre la voie à une maintenance prédictive plus fiable, sans sacrifier la traçabilité des décisions critiques. Le papier s'inscrit dans la tendance plus large des architectures agentiques bâties sur des LLM couplés à des jumeaux numériques pour la robotique de terrain, un axe de recherche actif depuis l'essor des modèles de raisonnement conversationnel. Aucun acteur industriel ni concurrent n'est cité dans le résumé, ce qui confirme la nature académique de la publication ; les suites logiques attendues seraient une validation expérimentale sur des plateformes sous-marines réelles et une comparaison avec des approches de diagnostic purement automatisées.

RecherchePaper
1 source
New flapping robot nage et vole comme un oiseau plongeur
245MIT News Robotics 

New flapping robot nage et vole comme un oiseau plongeur

Une équipe du MIT et de l'EPFL à Lausanne a mis au point un robot volant capable de plonger dans l'eau puis de reprendre son envol, imitant les oiseaux plongeurs comme les macareux, les huarts ou les puffins. Baptisé FAAV (flapping-wing aerial-aquatic vehicle), l'engin pèse moins de 300 grammes et se compose d'un fuselage central, de deux ailes battantes flexibles et d'une queue orientable, ces éléments pouvant être remplacés par différentes tailles selon les besoins. Les essais ont été menés dans un bassin puis sur un lac, où les chercheurs ont identifié les combinaisons de taille d'ailes, de fréquence de battement et d'angle de queue permettant une transition fluide entre la nage sous-marine, le franchissement de la surface et le vol aérien. Les résultats, publiés le 9 juillet 2026 dans la revue Science, s'appuient notamment sur l'observation que les petits oiseaux plongeurs battent des ailes environ 10 fois par seconde dans l'air et 4 fois par seconde sous l'eau, une fréquence légèrement inférieure chez les espèces plus grandes en raison de leur envergure. L'étude est menée par Raphael Zufferey, professeur assistant en génie mécanique au MIT et responsable de l'AURA Lab, avec des co-auteurs de l'EPFL et du Northwest Indian College à Bellingham (État de Washington). L'intérêt de ce robot dépasse la simple prouesse mécanique : il démontre qu'une plateforme robotique mobile peut reproduire la transition air-eau que seule une centaine d'espèces d'oiseaux savent exécuter dans la nature, une bascule rendue complexe par le fait que l'eau est mille fois plus dense que l'air. Pour l'océanographie et la biologie marine, cela ouvre la voie à une nouvelle catégorie de drones capables d'aller prélever des échantillons ou effectuer des mesures dans des zones difficiles d'accès pour les navires classiques (icebergs, ports, zones fréquentées par des cétacés), à un coût nettement inférieur aux méthodes actuelles. C'est aussi une validation concrète que l'approche bio-inspirée, en s'appuyant sur des données de vol réelles issues d'oiseaux plongeurs, peut se traduire en un système robotique fonctionnel et pas seulement en simulation. Le projet s'inscrit dans les travaux de l'AURA Lab du MIT, spécialisé dans les véhicules aériens et aquatiques inspirés de la biomécanique animale pour surveiller la santé des océans et des cours d'eau de façon peu intrusive. Zufferey et son équipe avaient d'abord recensé dans la littérature scientifique les données de vol de puffins, pétrels et martins-pêcheurs avant de concevoir un robot calé sur ces fréquences de battement naturelles. Les auteurs présentent ce projet comme une première étape vers des flottes de drones lancés depuis un bateau ou la côte, capables d'alterner vol et plongée pour la collecte de données environnementales, sans toutefois annoncer à ce stade de calendrier de déploiement opérationnel.

UEL'EPFL (Lausanne) est coauteur de cette recherche publiee dans Science, illustrant une contribution europeenne notable a la robotique bio-inspiree, mais aucun deploiement operationnel n'est prevu en France ou en UE a ce stade.

RecherchePaper
1 source
Robots-bateaux miniatures construisent des structures flottantes
246MIT News Robotics 

Robots-bateaux miniatures construisent des structures flottantes

Un petit robot flottant modulaire signé MIT : voici la traduction-résumé demandée. Une équipe du MIT CSAIL, dirigée par Daniela Rus et Carlo Ratti, a développé FloatForm, un essaim de petits robots-bateaux carrés capables de s'assembler seuls pour former des structures flottantes plus grandes, de se désassembler, puis de se reconfigurer selon les besoins. Chaque unité mesure 21 centimètres de côté, à peu près la taille d'une assiette, et embarque ses propres propulseurs, capteurs et loquets magnétiques pour s'accrocher à ses voisins. Les travaux, publiés en accès libre dans Nature Communications, sont menés par Wei Wang, ancien chercheur du MIT qui dirige désormais le Marine Robotics Lab de l'université du Wisconsin à Madison, avec la contribution d'Alejandro Gonzalez-Garcia et de Niklas Hagemann, doctorant en architecture au MIT. Le projet prolonge Roboat, l'initiative conjointe du MIT et de l'Amsterdam Institute for Advanced Metropolitan Solutions (AMS) qui avait mis des bateaux autonomes grandeur nature sur les canaux d'Amsterdam. L'enjeu dépasse la démonstration technique : la plupart des systèmes d'auto-assemblage robotique existants, sur l'eau comme ailleurs, dépendent d'un ordinateur central qui dicte chaque mouvement, une architecture fragile en cas de panne et qui ne passe pas à l'échelle, le calcul de planification explosant avec le nombre de robots et l'assemblage devant se faire séquentiellement pendant que la majorité de la flotte reste inactive. FloatForm inverse la logique en s'inspirant des fourmis de feu, capables de former des radeaux flottants sans chef d'orchestre, chaque insecte suivant des règles locales simples. Le système du MIT ne fait intervenir un planificateur central que de façon minimale, laissant chaque robot agir comme un agent quasi autonome. Pour l'industrie robotique et les urbanistes, l'intérêt est de rendre le front de mer programmable à la demande : un pont temporaire après une catastrophe, un marché flottant, une scène de festival qui apparaît puis disparaît, sans infrastructure fixe coûteuse. Le projet s'inscrit dans la continuité de Roboat, qui avait exploré si les canaux d'Amsterdam, autrefois voie de transport de marchandises et aujourd'hui largement dédiés au tourisme, pouvaient servir à la collecte de déchets ou au transport pour soulager la circulation routière. FloatForm miniaturise cette ambition à l'échelle d'une table pour résoudre un problème plus fondamental : comment coordonner des dizaines, puis potentiellement des milliers, de robots flottants sans supervision centralisée lourde. Les chercheurs présentent la ville comme un espace public capable de s'étendre, se contracter ou se reconfigurer sur l'eau à la demande, une piste que l'équipe du CSAIL et du Senseable City Lab entend maintenant pousser vers des essaims plus nombreux et des structures plus complexes.

RecherchePaper
1 source
GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état
247arXiv cs.RO 

GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état

Voici l'article : Des chercheurs publient GrandTour, un jeu de données massif dédié à la perception multimodale et à l'estimation d'état pour robots quadrupèdes, disponible sur grand-tour.leggedrobotics.com au format HuggingFace (indépendant de ROS) ainsi qu'en formats ROS. La plateforme utilisée est un ANYmal-D d'ANYbotics équipé de la charge utile capteurs Boxi, combinant LiDAR rotatif, plusieurs caméras RGB aux caractéristiques complémentaires, capteurs proprioceptifs et caméras de profondeur stéréo, le tout synchronisé temporellement. Les données ont été collectées sur des sites très variés : environnements alpins, forêts, bâtiments démolis et zones urbaines, couvrant une large gamme d'échelles, de conditions d'éclairage et de météo. Point clé pour la fiabilité scientifique : les trajectoires de référence (ground truth) proviennent de GNSS RTK par satellite et d'une station totale Leica Geosystems, offrant une précision de localisation bien supérieure aux méthodes d'estimation embarquées classiques. Selon les auteurs, il s'agit du plus grand jeu de données en accès libre jamais publié pour la robotique à pattes. Ce type de ressource comble un manque criant dans la recherche en robotique légère : jusqu'ici, aucun jeu de données public à grande échelle ne permettait de développer et de comparer rigoureusement des algorithmes de SLAM, d'estimation d'état et de fusion de capteurs pour des quadrupèdes évoluant en conditions réelles, hors laboratoire. Pour les équipes travaillant sur la navigation autonome de robots à pattes, en particulier dans des environnements non structurés (chantiers, sites industriels accidentés, terrains extérieurs), GrandTour offre un benchmark commun et une vérité terrain de précision géodésique, rare dans ce domaine. C'est un signal que la communauté cherche à standardiser l'évaluation des systèmes de perception embarqués, plutôt que de se fier à des démonstrations isolées difficiles à reproduire. Le projet s'inscrit dans la lignée des travaux du Robotic Systems Lab, à l'origine de la plateforme ANYmal, aujourd'hui commercialisée par ANYbotics, acteur suisse reconnu de la robotique quadrupède industrielle aux côtés de Boston Dynamics (Spot) et Unitree. La publication constitue une mise à jour (version 3) d'un article déposé sur arXiv sous la référence 2602.18164. Les auteurs annoncent la mise à disposition d'outils et de ressources de démonstration pour faciliter l'adoption du jeu de données par la communauté SLAM et apprentissage multimodal, sans toutefois préciser de calendrier pour d'éventuelles extensions futures du corpus.

UECe jeu de donnees en acces libre, issu du Robotic Systems Lab (ETH Zurich) et d'ANYbotics (Suisse), constitue une ressource directement utile aux equipes de recherche francaises et europeennes travaillant sur le SLAM et l'estimation d'etat pour robots a pattes.

RecherchePaper
1 source
RoboLight : un jeu de données à éclairage linéairement composable pour la manipulation robotique
248arXiv cs.RO 

RoboLight : un jeu de données à éclairage linéairement composable pour la manipulation robotique

Voici l'article traduit et résumé. RoboLight, présenté dans un article arXiv, est le premier jeu de données de manipulation robotique capturant des épisodes synchronisés sous des conditions d'éclairage systématiquement variées. Il comprend deux volets : RoboLight-Real, avec 2 800 épisodes réels collectés sur un dispositif calibré baptisé Light Cube, équipé de huit lampes LED RGB programmables et faisant varier trois dimensions indépendantes (couleur, direction, intensité), chaque dimension étant associée à une tâche dédiée impliquant des objets de géométries et matériaux différents pour créer des défis perceptifs ; et RoboLight-Synthetic, qui compte 196 000 épisodes générés par interpolation dans l'espace image HDR de RoboLight-Real, un volume potentiellement extensible à volonté en affinant la granularité d'interpolation. Toutes les images sont enregistrées au format HDR pour préserver la précision radiométrique. Les auteurs valident la qualité du jeu de données via une analyse qualitative et des déploiements de politiques en conditions réelles, en étudiant la difficulté des tâches, la diversité de distribution et l'efficacité des données synthétisées, avec trois cas d'usage représentatifs à l'appui. Pour l'industrie robotique, ce jeu de données cible un angle mort persistant des modèles vision-langage-action (VLA) et des politiques de manipulation apprises : leur fragilité face aux variations d'éclairage, un facteur rarement isolé et contrôlé dans les données d'entraînement existantes. En permettant de faire varier couleur, direction et intensité lumineuse de façon indépendante et reproductible, RoboLight offre un banc d'essai pour mesurer la robustesse réelle des politiques de perception, une question centrale pour tout déploiement industriel où l'éclairage n'est jamais parfaitement contrôlé, entrepôt, ligne de production, environnement extérieur. L'approche par interpolation HDR pour générer des données synthétiques à moindre coût illustre aussi une piste concrète pour réduire la dépendance à la collecte réelle, un goulot d'étranglement connu pour l'entraînement des modèles de manipulation à grande échelle. Le projet s'inscrit dans la lignée des efforts récents visant à combler l'écart entre démonstrations en laboratoire et robustesse en conditions réelles, un problème régulièrement pointé du doigt concernant les modèles VLA générique (dans la veine de Pi-0 ou GR00T N2). Contrairement à des jeux de données généralistes, RoboLight isole spécifiquement la variable lumineuse via un montage matériel dédié, ce qui le distingue des benchmarks existants qui ne contrôlent pas systématiquement ce paramètre. Les auteurs annoncent la publication en open source du jeu de données complet, ainsi que des conceptions logicielle et matérielle du système Light Cube, ce qui laisse présager une adoption possible comme outil de benchmark standard par la communauté robotique si la promesse de reproductibilité est tenue.

RecherchePaper
1 source
Rapide apprentissage du contrôle de robots souples via un pas de temps implicite
249arXiv cs.RO 

Rapide apprentissage du contrôle de robots souples via un pas de temps implicite

Des chercheurs démontrent qu'un apprentissage rapide de politiques de contrôle pour robots souples est possible grâce au pas de temps implicite, une avancée jusqu'ici jugée hors de portée en raison du coût de calcul de la simulation de mécanique des milieux continus. Leur simulateur, DisMech, est un moteur généraliste entièrement implicite capable de gérer à la fois la dynamique des corps souples et les contacts frictionnels. L'équipe introduit aussi le contrôle par delta de courbure naturelle, une méthode analogue au contrôle delta de position articulaire des manipulateurs rigides, offrant un moyen intuitif d'appliquer des commandes lors de l'apprentissage. Testée sur quatre tâches de manipulation souple et comparée à Elastica, l'un des frameworks de simulation souple les plus répandus, l'approche atteint jusqu'à 6 fois la vitesse d'exécution sur les scénarios sans contact et jusqu'à 40 fois sur les scénarios riches en contact, avec 500 environnements simulés en parallèle. Une évaluation de l'écart sim à sim, entraînement dans un simulateur puis test dans un autre, confirme que ces gains de vitesse ne sacrifient pas la précision. Cette avancée s'attaque à un verrou connu du secteur : la simulation de corps rigides a permis l'essor massif de l'apprentissage par renforcement pour les robots articulés classiques, mais la robotique souple est restée à la traîne faute d'outils accessibles et rapides. Pour les chercheurs et industriels développant des préhenseurs souples, des trompes robotiques ou des manipulateurs continus destinés à la manutention délicate, ce travail suggère que l'apprentissage de politiques par simulation, longtemps réservé aux morphologies rigides, devient enfin praticable pour les morphologies déformables. Cela pourrait accélérer le transfert de techniques d'apprentissage de bout en bout vers des applications comme la préhension d'objets fragiles ou la chirurgie assistée, où la rigidité mécanique classique est un handicap. Le fossé entre simulateurs rigides matures et frameworks souples rudimentaires explique en partie le retard de la robotique douce sur l'apprentissage par simulation, un constat que ce travail cherche à combler en misant sur un solveur implicite plutôt que sur des approches explicites plus lentes comme Elastica. L'article, publié sur arXiv en version révisée (arXiv:2511.06667v2), s'inscrit dans une dynamique de recherche visant à doter la robotique souple d'outils logiciels aussi matures que ceux dont bénéficie la robotique rigide depuis des années, ouvrant la voie à de futurs benchmarks entre frameworks concurrents.

RecherchePaper
1 source
Recherche technique d'ABot-C0 sur les comportements fondamentaux pour robots quadrupèdes
250arXiv cs.RO 

Recherche technique d'ABot-C0 sur les comportements fondamentaux pour robots quadrupèdes

ABot-C0, présenté dans un rapport technique publié sur arXiv (2607.07370), est un système généraliste de contrôle de mouvement pour robots quadrupèdes reposant sur trois piliers complémentaires. Les chercheurs ont d'abord construit une pyramide de données combinant génération vidéo conditionnelle, capture de mouvement annotée, téléopération et conception manuelle, pour produire 16 074 séquences de mouvement physiquement réalisables. Sur cette base, ils ont entraîné une politique généraliste par flow-matching qui, selon les auteurs, démontre pour la première fois une loi d'échelle pour le suivi de mouvement chez les quadrupèdes: les performances s'améliorent de façon constante avec l'augmentation des données d'entraînement, avec une capacité à suivre des mouvements inédits sans exemples spécifiques (zero-shot). Pour la locomotion sur tout-terrain, l'équipe a développé un cadre en trois étapes passant d'un contrôle privilégié à un contrôle perceptif, appuyé sur une mémoire temporelle LiDAR et une supervision prédictive du terrain. Le système a été testé en navigation autonome sur terrain urbain et en interaction multimodale de type compagnon. L'enjeu dépasse la simple démonstration technique. Contrairement aux robots humanoïdes, qui bénéficient de vastes corpus de capture de mouvement humain et d'un paradigme de motion-tracking déjà mature, les quadrupèdes souffrent d'un manque criant de données animales exploitables, et le transfert d'un squelette à un autre reste fragile. En traitant ce problème par la synthèse vidéo et une politique d'apprentissage unifiée, ce travail cherche à combler l'écart entre les deux familles de robots. La revendication centrale, faire passer les quadrupèdes de démonstrations mono-fonction à une intelligence comportementale de niveau produit, doit toutefois être lue comme une affirmation d'auteurs de papier de recherche, non comme un déploiement commercial vérifié: les expériences relatées restent des tests en conditions contrôlées ou semi-contrôlées, pas des mises en service industrielles à grande échelle. Ce travail s'inscrit dans une dynamique plus large où l'apprentissage de bout en bout par grands modèles de mouvement, déjà éprouvé sur les humanoïdes commerciaux, cherche à s'étendre aux plateformes quadrupèdes utilisées en inspection, sécurité ou logistique, un segment où des acteurs comme Unitree, ANYbotics ou Boston Dynamics dominent aujourd'hui avec des commandes plus classiques. En s'appuyant sur des données synthétiques plutôt que sur la capture animale, coûteuse et rare, les auteurs ouvrent une piste pour industrialiser l'entraînement de ces robots. Aucune date de déploiement commercial ni partenaire industriel n'est mentionnée dans ce rapport, qui reste à ce stade une contribution académique destinée à être suivie par d'autres itérations.

RecherchePaper
1 source