Aller au contenu principal

Actualités robotique — page 28

4 604 articles au fil, du plus récent au plus ancien.

Rapide apprentissage du contrôle de robots souples via un pas de temps implicite
1351arXiv cs.RO 

Rapide apprentissage du contrôle de robots souples via un pas de temps implicite

Des chercheurs démontrent qu'un apprentissage rapide de politiques de contrôle pour robots souples est possible grâce au pas de temps implicite, une avancée jusqu'ici jugée hors de portée en raison du coût de calcul de la simulation de mécanique des milieux continus. Leur simulateur, DisMech, est un moteur généraliste entièrement implicite capable de gérer à la fois la dynamique des corps souples et les contacts frictionnels. L'équipe introduit aussi le contrôle par delta de courbure naturelle, une méthode analogue au contrôle delta de position articulaire des manipulateurs rigides, offrant un moyen intuitif d'appliquer des commandes lors de l'apprentissage. Testée sur quatre tâches de manipulation souple et comparée à Elastica, l'un des frameworks de simulation souple les plus répandus, l'approche atteint jusqu'à 6 fois la vitesse d'exécution sur les scénarios sans contact et jusqu'à 40 fois sur les scénarios riches en contact, avec 500 environnements simulés en parallèle. Une évaluation de l'écart sim à sim, entraînement dans un simulateur puis test dans un autre, confirme que ces gains de vitesse ne sacrifient pas la précision. Cette avancée s'attaque à un verrou connu du secteur : la simulation de corps rigides a permis l'essor massif de l'apprentissage par renforcement pour les robots articulés classiques, mais la robotique souple est restée à la traîne faute d'outils accessibles et rapides. Pour les chercheurs et industriels développant des préhenseurs souples, des trompes robotiques ou des manipulateurs continus destinés à la manutention délicate, ce travail suggère que l'apprentissage de politiques par simulation, longtemps réservé aux morphologies rigides, devient enfin praticable pour les morphologies déformables. Cela pourrait accélérer le transfert de techniques d'apprentissage de bout en bout vers des applications comme la préhension d'objets fragiles ou la chirurgie assistée, où la rigidité mécanique classique est un handicap. Le fossé entre simulateurs rigides matures et frameworks souples rudimentaires explique en partie le retard de la robotique douce sur l'apprentissage par simulation, un constat que ce travail cherche à combler en misant sur un solveur implicite plutôt que sur des approches explicites plus lentes comme Elastica. L'article, publié sur arXiv en version révisée (arXiv:2511.06667v2), s'inscrit dans une dynamique de recherche visant à doter la robotique souple d'outils logiciels aussi matures que ceux dont bénéficie la robotique rigide depuis des années, ouvrant la voie à de futurs benchmarks entre frameworks concurrents.

RecherchePaper
1 source
PriGo : guidage de primitives en temps de test pour les politiques de diffusion et de flux en manipulation robotique adaptative
1352arXiv cs.RO 

PriGo : guidage de primitives en temps de test pour les politiques de diffusion et de flux en manipulation robotique adaptative

Un nouveau papier arXiv (2607.07076v1) présente PriGo, un framework qui améliore les politiques de manipulation robotique basées sur diffusion et flow matching sans nécessiter de réentraînement. Le système repose sur PANet, un module léger qui infère des distributions de primitives d'action directement à partir des observations, couplé à un mécanisme de guidage différentiable qui corrige les trajectoires générées pendant l'inférence pour les aligner sur des comportements sémantiquement cohérents. Contrairement aux approches précédentes conditionnées par primitives, qui exigeaient des labels dès l'entraînement, PriGo s'intègre directement sur des politiques diffusion et flow déjà pré-entraînées. Les auteurs rapportent des gains de robustesse, d'exécution sur horizon long et de généralisation sur les benchmarks LIBERO, CALVIN et SIMPLER, ainsi que sur des tâches robotiques réelles. L'enjeu touche un point faible bien identifié des politiques par imitation apprises à partir de démonstrations: elles ont tendance à mémoriser des corrélations d'actions superficielles plutôt qu'à capturer l'intention sous-jacente du geste, ce qui limite leur transfert à de nouvelles tâches ou environnements. Pour les intégrateurs et les équipes de recherche en robotique, une méthode agissant uniquement au moment de l'inférence est particulièrement intéressante: elle évite le coût d'un réentraînement complet des grands modèles VLA, un frein pratique majeur au déploiement de ces politiques hors laboratoire. C'est un signal de plus que le secteur cherche des correctifs légers pour combler l'écart entre démonstrations en conditions contrôlées et exécution robuste en environnement réel. Ce travail s'inscrit dans la lignée des politiques visuomotrices génératives (diffusion, flow matching) qui ont dominé l'apprentissage par imitation en robotique ces dernières années, dans le sillage de modèles comme GR00T ou Pi-0. Il reste à ce stade une contribution académique, validée sur des benchmarks de simulation standards et des essais réels limités, sans indication de déploiement industriel ou d'intégration dans un produit commercial. Les auteurs ne précisent pas de calendrier pour une extension à d'autres plateformes robotiques.

IA physiqueActu
1 source
Valider le rêve avant de faire confiance à son verdict : l'admissibilité des simulateurs à modèle du monde
1353arXiv cs.RO 

Valider le rêve avant de faire confiance à son verdict : l'admissibilité des simulateurs à modèle du monde

Des chercheurs publient un nouveau cadre méthodologique pour évaluer la fiabilité des modèles de monde (World Models, WM) utilisés en robotique et en conduite autonome, dans un article arXiv (2607.07196) diffusé début juillet 2026. Le constat de départ : ces modèles génératifs, de plus en plus employés comme "oracles" pour tester des politiques d'action en simulant les conséquences de leurs décisions, rendent un verdict de succès ou de sécurité sans que leur propre fiabilité soit vérifiée. Les auteurs pointent une faille des métriques actuelles comme la Fréchet Video Distance (FVD), qui juge le réalisme visuel des vidéos générées mais ignore si le monde simulé réagit correctement aux actions testées, notamment celles absentes des données d'entraînement. Pour y remédier, ils proposent une "échelle d'admissibilité" en cinq niveaux (L0 à L4) que tout WM devrait franchir avant que ses verdicts en boucle fermée soient acceptés comme preuve d'assurance qualité. Le cadre, conçu pour être indépendant du type de robot, est testé sur deux modèles de monde dédiés à la conduite autonome. Le résultat le plus frappant : le modèle qui obtient le meilleur score en qualité visuelle de génération (niveau L0) se classe moins bien sur le suivi effectif des actions demandées (niveaux L1-L2). Autrement dit, la fidélité visuelle d'une simulation ne garantit pas sa robustesse à l'action, ce qui remet en cause l'usage de métriques purement esthétiques pour valider des systèmes destinés à juger des politiques de conduite ou de manipulation robotique en conditions réelles. Pour les industriels et intégrateurs qui misent sur les modèles génératifs pour accélérer les tests en sim-to-real, notamment dans le contexte des architectures VLA (vision-langage-action) où la simulation sert de banc d'essai avant déploiement physique, ce travail est un signal d'alerte méthodologique plutôt qu'une remise en cause technologique. L'approche s'appuie sur des pratiques éprouvées de la simulation critique pour la sécurité, comme la Vérification, Validation et Accréditation (VV&A), le cadre SOTIF (Safety of the Intended Functionality) et les normes de test par scénarios, déjà utilisées dans l'aéronautique et l'automobile. Les auteurs choisissent la conduite autonome comme premier terrain d'application car les méthodes d'assurance qualité pour la simulation classique y sont les plus matures, ouvrant la voie à une extension future vers d'autres domaines robotiques comme la manipulation ou l'humanoïde.

RecherchePaper
1 source
GeoProp : ancrer l'état du robot dans la vision pour une manipulation généraliste
1354arXiv cs.RO 

GeoProp : ancrer l'état du robot dans la vision pour une manipulation généraliste

La proprioception, c'est-à-dire la connaissance par le robot de la position et de la vitesse de ses propres articulations, est généralement injectée dans les politiques de manipulation comme un simple vecteur numérique, sans lien explicite avec les images captées par les caméras. Des chercheurs de l'Alibaba DAMO Academy proposent GeoProp, un module léger et greffable qui corrige ce défaut en projetant géométriquement l'état du robot sur le plan image pour échantillonner les caractéristiques visuelles locales correspondantes, créant un "jeton d'état ancré" dans la scène. Le système injecte ensuite ces informations spatiales dans les caractéristiques visuelles via une modulation FiLM, et anticipe le mouvement en échantillonnant également les caractéristiques à une position future prédite à court terme à partir de la cinématique récente. Testé sur 67 tâches, GeoProp améliore Diffusion Policy de 8,7% sur 63 tâches en simulation, la politique pi0 de 4,0% sur un sous-ensemble RoboTwin, et apporte un gain moyen de 10,6% en conditions réelles sur les deux familles de politiques, pour un coût de seulement 2 à 3% de paramètres supplémentaires. Ce résultat cible un problème connu mais peu résolu du secteur des politiques génératives pour la manipulation robotique: sans ancrage explicite entre kinématique 3D et cartes de caractéristiques 2D, les modèles peinent à situer le bras ou la pince du robot dans la scène, au point de parfois moins bien performer que des politiques n'utilisant que la vision. Pour les intégrateurs qui déploient des politiques de type Vision-Language-Action (VLA) sur des tâches de préhension ou d'assemblage, ce type d'adaptateur plug-and-play est significatif car il s'insère dans des architectures existantes sans réentraînement complet ni changement de backbone, avec un surcoût de calcul marginal. Le problème de fusion proprioception-vision remonte aux premières politiques de manipulation par apprentissage par imitation, où l'état articulaire était généralement simplement concaténé aux caractéristiques visuelles en fin de réseau. L'essor récent des politiques génératives comme Diffusion Policy et des modèles VLA généralistes tels que pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA) a remis cette question au centre des préoccupations, chaque laboratoire cherchant sa propre méthode d'alignement multimodal. Les auteurs positionnent GeoProp comme une brique générique compatible avec plusieurs familles de politiques plutôt qu'une architecture concurrente, et mettent à disposition une page projet dédiée, laissant présager une publication de code pour validation par la communauté.

IA physiqueOpinion
1 source
SPECTRA : primitives de mouvement spectrales conditionnées par le contexte pour la généralisation des compétences robotiques
1355arXiv cs.RO 

SPECTRA : primitives de mouvement spectrales conditionnées par le contexte pour la généralisation des compétences robotiques

Des chercheurs proposent SPECTRA (Spectral Movement Primitive, SMP), un framework d'apprentissage par imitation dans le domaine fréquentiel pour la manipulation robotique, décrit dans un article publié sur arXiv (2607.06978v1). Le principe consiste à représenter les démonstrations de trajectoire par des coefficients de Fourier tronqués sur horizon fini, plutôt que par des points temporels bruts. Une bande de fréquences basses, sélectionnée empiriquement, capture la géométrie dominante du mouvement, tandis que les harmoniques plus élevées, responsables d'une croissance disproportionnée des dérivées (vitesse, accélération, jerk), sont écartées. Un modèle GMM/GMR (mélange de gaussiennes avec régression) conditionné par le contexte et sensible au référentiel prédit les coefficients de la bande de tâche dans un repère canonique ; la trajectoire cartésienne obtenue est ensuite convertie en espace articulaire via cinématique inverse séquentielle. Un régulateur couplé en phase limite la progression temporelle demandée sans toucher aux coefficients spectraux, imposant ainsi les limites de vitesse et d'accélération articulaires tout en conservant le chemin de l'effecteur. Les auteurs valident l'approche sur plusieurs critères (reconstruction de la bande de tâche, robustesse à des démonstrations corrompues, généralisation hors distribution entre repères non vus, admissibilité dynamique en espace articulaire, préservation du chemin) et un déploiement réel sur un bras Franka Panda. Le problème que cible SPECTRA est concret pour tout intégrateur en apprentissage par imitation : les pipelines classiques apprennent une trajectoire en espace de tâche puis lui imposent après coup des limites d'exécution (filtrage, lissage, écrêtage, mise à l'échelle temporelle), ce qui déforme souvent le chemin de l'effecteur jugé critique pour la tâche, par exemple lors d'un versement, d'une insertion de pièce ou du suivi d'un contour précis. En couplant génération de trajectoire et régulation dynamique dès la conception, dans le domaine fréquentiel, SPECTRA évite cette distorsion a posteriori : les résultats rapportés montrent une réduction substantielle des violations dynamiques et du jerk, tout en préservant le chemin voulu pendant la régulation de phase. Pour la robotique industrielle, où les cycles de préhension et d'insertion tolèrent mal les à-coups mécaniques, cela offre une alternative aux primitives de mouvement dynamiques (DMP) classiques et aux méthodes de lissage a posteriori. Les primitives de mouvement existent depuis les Dynamic Movement Primitives (DMP), introduites il y a une vingtaine d'années et largement utilisées en apprentissage par imitation pour encoder des trajectoires robustes et reproductibles. SPECTRA s'en démarque en travaillant dans le domaine fréquentiel plutôt que temporel, et en couplant explicitement génération de tâche et contraintes d'exécution articulaire plutôt que de les traiter séparément. Le choix du Franka Panda comme plateforme de validation, un bras collaboratif conçu par l'allemand Franka Robotics (ex Franka Emika) très utilisé en recherche académique, ancre les travaux dans l'écosystème européen de manipulation robotique. L'article ne mentionne ni calendrier de transfert industriel ni partenariat commercial : il s'agit à ce stade d'une contribution de recherche évaluée en laboratoire, dont la suite logique serait une validation sur des tâches de manipulation plus complexes et une comparaison directe avec les approches DMP existantes.

RecherchePaper
1 source
RoboLight : un jeu de données à éclairage linéairement composable pour la manipulation robotique
1356arXiv cs.RO 

RoboLight : un jeu de données à éclairage linéairement composable pour la manipulation robotique

Voici l'article traduit et résumé. RoboLight, présenté dans un article arXiv, est le premier jeu de données de manipulation robotique capturant des épisodes synchronisés sous des conditions d'éclairage systématiquement variées. Il comprend deux volets : RoboLight-Real, avec 2 800 épisodes réels collectés sur un dispositif calibré baptisé Light Cube, équipé de huit lampes LED RGB programmables et faisant varier trois dimensions indépendantes (couleur, direction, intensité), chaque dimension étant associée à une tâche dédiée impliquant des objets de géométries et matériaux différents pour créer des défis perceptifs ; et RoboLight-Synthetic, qui compte 196 000 épisodes générés par interpolation dans l'espace image HDR de RoboLight-Real, un volume potentiellement extensible à volonté en affinant la granularité d'interpolation. Toutes les images sont enregistrées au format HDR pour préserver la précision radiométrique. Les auteurs valident la qualité du jeu de données via une analyse qualitative et des déploiements de politiques en conditions réelles, en étudiant la difficulté des tâches, la diversité de distribution et l'efficacité des données synthétisées, avec trois cas d'usage représentatifs à l'appui. Pour l'industrie robotique, ce jeu de données cible un angle mort persistant des modèles vision-langage-action (VLA) et des politiques de manipulation apprises : leur fragilité face aux variations d'éclairage, un facteur rarement isolé et contrôlé dans les données d'entraînement existantes. En permettant de faire varier couleur, direction et intensité lumineuse de façon indépendante et reproductible, RoboLight offre un banc d'essai pour mesurer la robustesse réelle des politiques de perception, une question centrale pour tout déploiement industriel où l'éclairage n'est jamais parfaitement contrôlé, entrepôt, ligne de production, environnement extérieur. L'approche par interpolation HDR pour générer des données synthétiques à moindre coût illustre aussi une piste concrète pour réduire la dépendance à la collecte réelle, un goulot d'étranglement connu pour l'entraînement des modèles de manipulation à grande échelle. Le projet s'inscrit dans la lignée des efforts récents visant à combler l'écart entre démonstrations en laboratoire et robustesse en conditions réelles, un problème régulièrement pointé du doigt concernant les modèles VLA générique (dans la veine de Pi-0 ou GR00T N2). Contrairement à des jeux de données généralistes, RoboLight isole spécifiquement la variable lumineuse via un montage matériel dédié, ce qui le distingue des benchmarks existants qui ne contrôlent pas systématiquement ce paramètre. Les auteurs annoncent la publication en open source du jeu de données complet, ainsi que des conceptions logicielle et matérielle du système Light Cube, ce qui laisse présager une adoption possible comme outil de benchmark standard par la communauté robotique si la promesse de reproductibilité est tenue.

RecherchePaper
1 source
Communication efficace du mouvement du cou d'un robot : axe unique vs multi-axes
1357arXiv cs.RO 

Communication efficace du mouvement du cou d'un robot : axe unique vs multi-axes

Un consortium de chercheurs en robotique publie sur arXiv (arXiv:2607.07390v1) un cadre théorique inédit pour mesurer l'efficacité communicative des mouvements de cou robotiques. L'équipe a utilisé une plateforme de cou robotique dotée de trois degrés de liberté (DoF) en rotation et a enregistré 84 stimuli vidéo en faisant varier l'amplitude, l'accélération et la fréquence des mouvements sur un, deux ou trois axes simultanément. Pour chaque configuration, les chercheurs ont calculé l'entropie de Shannon des signaux de changement de pixels, une mesure de l'information transmise visuellement, tout en mesurant la consommation énergétique associée. Une étude perceptive complémentaire a permis de valider comment des observateurs humains interprètent ces gestes. Résultat central: l'information communicative culmine à deux DoF actifs puis chute au troisième, alors même que la dépense énergétique continue d'augmenter, un phénomène que les auteurs baptisent le goulot d'étranglement informationnel morphologique. Cette découverte contredit une hypothèse répandue dans la conception des robots humanoïdes, selon laquelle multiplier les degrés de liberté du cou améliorerait automatiquement l'expressivité. Pour les ingénieurs et intégrateurs qui conçoivent des interfaces homme-robot, cela signifie qu'ajouter un troisième axe de rotation n'apporte aucun bénéfice communicatif, gaspille de l'énergie et, pire, brouille la lisibilité du geste selon les données perceptives collectées auprès des participants humains. Les auteurs proposent un nouvel outil, le Motor Information Space, qui met en regard entropie et énergie pour comparer différentes morphologies de cou robotique. Dans ce cadre, la configuration optimale identifiée atteint 5,26 bits d'information pour un coût énergétique jugé compétitif. Ce travail s'inscrit dans un champ de recherche plus large sur la communication non verbale des robots sociaux, où le mouvement de tête et de cou joue un rôle clé dans la signalisation d'intentions ou d'émotions chez l'humain. En établissant une base quantitative pour arbitrer entre complexité mécanique et clarté du signal, l'étude fournit aux concepteurs de robots humanoïdes un critère chiffré pour orienter le choix du nombre d'axes motorisés au niveau du cou, plutôt que de calquer par défaut l'anatomie humaine ou de multiplier les DoF par souci de réalisme.

RecherchePaper
1 source
Recherche technique d'ABot-C0 sur les comportements fondamentaux pour robots quadrupèdes
1358arXiv cs.RO 

Recherche technique d'ABot-C0 sur les comportements fondamentaux pour robots quadrupèdes

ABot-C0, présenté dans un rapport technique publié sur arXiv (2607.07370), est un système généraliste de contrôle de mouvement pour robots quadrupèdes reposant sur trois piliers complémentaires. Les chercheurs ont d'abord construit une pyramide de données combinant génération vidéo conditionnelle, capture de mouvement annotée, téléopération et conception manuelle, pour produire 16 074 séquences de mouvement physiquement réalisables. Sur cette base, ils ont entraîné une politique généraliste par flow-matching qui, selon les auteurs, démontre pour la première fois une loi d'échelle pour le suivi de mouvement chez les quadrupèdes: les performances s'améliorent de façon constante avec l'augmentation des données d'entraînement, avec une capacité à suivre des mouvements inédits sans exemples spécifiques (zero-shot). Pour la locomotion sur tout-terrain, l'équipe a développé un cadre en trois étapes passant d'un contrôle privilégié à un contrôle perceptif, appuyé sur une mémoire temporelle LiDAR et une supervision prédictive du terrain. Le système a été testé en navigation autonome sur terrain urbain et en interaction multimodale de type compagnon. L'enjeu dépasse la simple démonstration technique. Contrairement aux robots humanoïdes, qui bénéficient de vastes corpus de capture de mouvement humain et d'un paradigme de motion-tracking déjà mature, les quadrupèdes souffrent d'un manque criant de données animales exploitables, et le transfert d'un squelette à un autre reste fragile. En traitant ce problème par la synthèse vidéo et une politique d'apprentissage unifiée, ce travail cherche à combler l'écart entre les deux familles de robots. La revendication centrale, faire passer les quadrupèdes de démonstrations mono-fonction à une intelligence comportementale de niveau produit, doit toutefois être lue comme une affirmation d'auteurs de papier de recherche, non comme un déploiement commercial vérifié: les expériences relatées restent des tests en conditions contrôlées ou semi-contrôlées, pas des mises en service industrielles à grande échelle. Ce travail s'inscrit dans une dynamique plus large où l'apprentissage de bout en bout par grands modèles de mouvement, déjà éprouvé sur les humanoïdes commerciaux, cherche à s'étendre aux plateformes quadrupèdes utilisées en inspection, sécurité ou logistique, un segment où des acteurs comme Unitree, ANYbotics ou Boston Dynamics dominent aujourd'hui avec des commandes plus classiques. En s'appuyant sur des données synthétiques plutôt que sur la capture animale, coûteuse et rare, les auteurs ouvrent une piste pour industrialiser l'entraînement de ces robots. Aucune date de déploiement commercial ni partenaire industriel n'est mentionnée dans ce rapport, qui reste à ce stade une contribution académique destinée à être suivie par d'autres itérations.

RecherchePaper
1 source
GemNav : navigation robotique visuelle par tokens discrets via un grand modèle de langage multimodal
1359arXiv cs.RO 

GemNav : navigation robotique visuelle par tokens discrets via un grand modèle de langage multimodal

GemNav, une nouvelle politique de navigation visuelle pour robots, s'écarte de la recette habituelle du secteur : un encodeur visuel dédié, une tête d'action sur mesure, et un entraînement sur des milliers d'heures de données cross-embodiment. À la place, l'équipe adapte un Modèle de Langage Multimodal (MLLM) figé via LoRA appliqué uniquement à la tour langage, sans encodeur visuel auxiliaire ni tête de régression continue. Les waypoints et les signaux de navigation catégoriels partagent un unique vocabulaire de tokens discrets généré par la tête du modèle de langage, et une perte auxiliaire "soft-decoded" permet de récupérer la structure métrique que l'entropie croisée pure perdrait autrement. Entraîné sur un seul corpus ouvert de 8,7 heures, soit environ mille fois moins de données que les jeux d'entraînement concurrents, GemNav transfère en zero-shot vers quatre environnements physiquement distincts et inédits. Sur 20 essais réels, le robot s'arrête entre 0,25 et 0,42 mètre de l'objectif, couvrant un parking extérieur, un parking avec obstacles, une longue cour industrielle chimique en extérieur et un entrepôt intérieur. Ce résultat pèse sur un débat central de la robotique fondée sur les modèles de fondation : faut-il vraiment des encodeurs visuels spécialisés et des volumes massifs de données pour obtenir une navigation robuste et généralisable ? En montrant qu'une simple adaptation par tokens discrets d'un MLLM déjà pré-entraîné suffit à atteindre une précision d'arrivée sous le demi-mètre sur des terrains variés jamais vus à l'entraînement, GemNav suggère une voie plus économe en données et en calcul pour déployer des politiques de navigation, un argument qui parlera directement aux intégrateurs et décideurs B2B soucieux du coût d'entraînement et de collecte de données. L'étude apporte aussi une nuance utile : ajouter un historique d'images courtes améliore les métriques hors ligne mais n'apporte aucun bénéfice mesurable sur le robot réel, ce qui indique un plafond sur l'utilité du contexte temporel une fois que les features visuelles pré-entraînées sont en place. Le travail s'inscrit dans la lignée des politiques de navigation dites "VLA" (vision-language-action) qui cherchent à réutiliser des modèles de fondation existants plutôt que d'entraîner des architectures spécialisées from scratch, une tendance également explorée par des approches comme GR00T N2 ou Pi-0 dans le domaine de la manipulation. En limitant drastiquement la taille du corpus d'entraînement nécessaire, GemNav ouvre la voie à des déploiements plus rapides et moins coûteux pour des flottes de robots mobiles autonomes (AMR) en environnement industriel ou logistique, même si la validation reste pour l'instant limitée à des essais ponctuels plutôt qu'à un déploiement à grande échelle.

IA physiqueOpinion
1 source
VOTE : optimisation vision-langage-action par vote d'ensemble de trajectoires
1360arXiv cs.RO 

VOTE : optimisation vision-langage-action par vote d'ensemble de trajectoires

Le papier VOTE ("Vision-Language-Action Optimization with Trajectory Ensemble Voting"), publié sur arXiv sous la référence 2507.05116, propose une nouvelle méthode d'entraînement pour les modèles Vision-Language-Action (VLA) utilisés en robotique manipulatrice. Les auteurs, dont le code est disponible sur GitHub (LukeLIN-web/VOTE), s'attaquent à deux limites des VLA actuels : la génération de tokens d'action très nombreux, qui alourdit la latence d'inférence et le coût d'entraînement, et une exploitation insuffisante des actions déjà générées, qui dégrade les performances. Leur framework finetune les modèles pour produire beaucoup moins de tokens d'action, en parallélisant fortement le décodage, puis combine les prédictions courantes et passées via une stratégie de vote d'ensemble au moment de l'inférence. Résultat annoncé : des taux de réussite supérieurs à l'état de l'art, avec une inférence 39 fois plus rapide qu'OpenVLA et un débit de 46 Hz sur plateformes embarquées. Ce gain de vitesse cible directement le principal frein au déploiement réel des VLA : leur latence, souvent incompatible avec un contrôle robotique en temps réel sur du matériel embarqué à ressources limitées. Si les chiffres se confirment en dehors des benchmarks propriétaires des auteurs, cela renforcerait l'idée qu'on peut réduire drastiquement la latence sans changer d'architecture ni ajouter de puissance de calcul, simplement en repensant le nombre de tokens générés et leur exploitation post-inférence. C'est un argument concret pour les intégrateurs qui cherchent à faire tourner des politiques VLA sur des bras robotiques ou plateformes mobiles sans GPU serveur. Le travail s'inscrit dans une course plus large à l'efficacité des VLA, où OpenVLA sert de référence open source largement citée, aux côtés d'approches comme Pi-0 (Physical Intelligence), GR00T (NVIDIA) ou Helix (Figure), toutes confrontées au même compromis entre richesse de représentation et vitesse d'exécution. VOTE se positionne comme une optimisation d'inférence complémentaire à ces modèles plutôt qu'un concurrent direct, avec pour prochaine étape l'adoption par la communauté via son code publié.

IA physiqueActu
1 source
IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains
1361arXiv cs.RO 

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains

Des chercheurs présentent HumAIN (Human-Aware Implicit Social Robot Navigation), un nouveau framework publié sur arXiv (arXiv:2607.07357v1) qui vise à rendre la navigation des robots sociaux plus sensible aux comportements humains. Le système repose sur un modèle enseignant de type transformer qui fusionne plusieurs sources de données : images historiques, points clés du squelette humain (keypoints), état du robot et objectif de destination, afin d'apprendre des représentations robustes pour planifier la trajectoire future du robot. Cette connaissance est ensuite distillée dans un modèle élève beaucoup plus léger, optimisé conjointement pour reconstruire la trajectoire et aligner ses caractéristiques latentes sur celles de l'enseignant, ce qui permet un déploiement en temps réel. Lors des tests, HumAIN améliore les métriques de prédiction de trajectoire de 29,8% en moyenne sur l'ensemble des métriques évaluées, par rapport aux meilleures méthodes existantes. L'enjeu principal de ces travaux est de combler l'écart entre prédiction et planification, un problème récurrent dans la navigation robotique en environnement humain : beaucoup de systèmes prédisent bien le mouvement des piétons mais peinent à traduire cette prédiction en trajectoire exploitable en temps réel, surtout sur du matériel aux ressources limitées. En s'appuyant sur des indices sociaux implicites, comme la démarche ou l'orientation du corps, plutôt que sur des règles explicites ou des modèles de forces sociales classiques, cette approche pourrait rendre les robots mobiles (AMR, robots de service, plateformes embarquées) plus fluides et prévisibles dans des espaces partagés avec des humains, un facteur clé pour l'acceptabilité et la sécurité de ces systèmes en usage réel, notamment en logistique ou en environnement industriel où humains et robots cohabitent. Ce travail s'inscrit dans la lignée des recherches sur la navigation sociale des robots, un domaine qui cherche depuis plusieurs années à dépasser les modèles purement géométriques d'évitement d'obstacles pour intégrer une compréhension plus fine du comportement humain. La technique de distillation de connaissances, empruntée à l'apprentissage profond, est ici appliquée pour rendre exploitables sur des plateformes à ressources contraintes des représentations normalement coûteuses à calculer. Les auteurs positionnent HumAIN par rapport à des méthodes de l'état de l'art en prédiction de trajectoire, et les prochaines étapes attendues porteraient sur une validation au-delà de la simulation, sur des robots physiques en conditions réelles.

RecherchePaper
1 source
SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche
1362arXiv cs.RO 

SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche

Une équipe de recherche présente SPEAR (Simulator for Photorealistic Embodied AI Research), un nouveau simulateur conçu pour entraîner des agents incarnés (embodied agents) et générer des données visuelles synthétiques photoréalistes. Publié sur arXiv début juillet 2026, SPEAR se présente comme une bibliothèque Python capable de se connecter à n'importe quelle application Unreal Engine (UE) et de la piloter via une architecture de plugins modulaires. Elle expose plus de 14 000 fonctions UE uniques à Python, soit un gain d'un ordre de grandeur en fonctionnalités programmables par rapport aux simulateurs UE existants. Côté performance, une seule instance de SPEAR peut rendre des images photoréalistes en 1920x1080 directement dans un tableau NumPy à 73 images par seconde, également dix fois plus rapide que les plugins UE existants, tout en fournissant des modalités de vérité terrain inédites, comme la décomposition intrinsèque non diffuse, les IDs de matériaux ou les paramètres de shading physiquement basé (PBR). Pour un ingénieur en robotique ou en IA incarnée, l'enjeu dépasse la simple prouesse technique : la plupart des simulateurs photoréalistes actuels souffrent d'un compromis entre réalisme visuel et vitesse de rendu, ou entre flexibilité de programmation et généralité. En combinant vitesse élevée, richesse des modalités de sortie et contrôle programmatique fin de scènes UE complexes, SPEAR vise à réduire l'écart entre simulation et réalité (sim-to-real) pour l'entraînement d'agents visuels, un point critique pour la robotique mobile, les véhicules autonomes et les modèles vision-langage-action (VLA). Les chercheurs démontrent l'outil sur des cas variés : contrôle de multiples agents aux espaces d'action distincts (humains, voitures, robots) dans des projets UE existants, rendu d'environnements urbains à grande échelle, manipulation des systèmes de génération procédurale de contenu d'UE, rendu multi-vues synchronisé de visages humains détaillés, co-simulation avec le moteur physique MuJoCo, et édition de scènes en langage naturel via un assistant de code IA. SPEAR s'inscrit dans la lignée des simulateurs bâtis sur Unreal Engine comme AirSim ou CARLA, mais cherche à en dépasser les limites de généralité et de vitesse.

RecherchePaper
1 source
Robots miniatures modulaires : des graphes de synchronisation programmables pour plus d'adaptabilité et de tolérance aux pannes
1363arXiv cs.RO 

Robots miniatures modulaires : des graphes de synchronisation programmables pour plus d'adaptabilité et de tolérance aux pannes

Des chercheurs publient sur arXiv (arXiv:2607.07281v1) un nouveau cadre appelé "programmable synchronization graphs" pour coordonner des essaims de robots miniatures modulaires, chaque module associant un actionneur et un capteur. Le principe : représenter chaque paire actionneur-capteur comme un nœud de réseau, et encoder la coordination locomotrice via un couplage de graphe plutôt que via un leader central ou un gabarit de démarche fixe. Des liens fixes à l'intérieur de sous-groupes synchronisent des groupes hétérogènes d'actionneurs, tandis qu'un petit nombre de liens signés entre sous-groupes programme les relations de phase. Sur des collectifs physiques allant jusqu'à neuf modules, les chercheurs montrent l'émergence de la synchronisation, un contrôle du déphasage entre mouvement en phase et en opposition de phase, et des allures de type galop ou trot sur un assemblage de cinq modules au sol. Remplacer un couplage dense (tous les modules connectés entre eux) par des topologies creuses "d-régulières" préserve la synchronisation tout en réduisant la charge de communication. Un algorithme d'apprentissage par sélection de liens (upper-confidence-bound) permet en outre au système d'apprendre en ligne les connexions nécessaires pour atteindre un état de phase cible. L'intérêt pratique tient surtout à la tolérance aux pannes : plus le degré du graphe de couplage est élevé, plus le système supporte de désactivations de modules avant de perdre la synchronisation. Sur un test de désactivation, ce contrôleur distribué évite le mode de défaillance typique du contrôle centralisé leader-suiveur, où la perte du module leader fait s'effondrer toute la coordination, et réduit l'erreur de phase dans le pire cas d'un facteur d'environ trois. Pour l'industrie des robots modulaires et essaims miniatures, c'est une piste concrète pour des systèmes robustes sans point de défaillance unique, un enjeu classique en robotique en essaim et en inspection dans des environnements confinés. Ce travail s'inscrit dans une problématique ancienne de la robotique modulaire : comment coordonner de nombreux modules imparfaits, à calcul et communication limités, sans dépendre d'une hiérarchie rigide. Les approches concurrentes reposent typiquement sur des architectures leader-suiveur ou des gabarits de démarche prédéfinis, moins robustes à la perte d'unités. Le papier ne précise pas de calendrier de déploiement industriel ; il s'agit à ce stade d'une démonstration en laboratoire sur des collectifs à petite échelle (jusqu'à neuf modules), dont la généralisation à des essaims plus grands reste à établir.

RecherchePaper
1 source
Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels
1364arXiv cs.RO 

Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels

Une équipe de recherche propose une nouvelle architecture pour piloter des robots de morphologies très différentes avec un seul contrôleur, dans un article intitulé "Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control" (arXiv:2506.08630, version 3, republiée en cross-listing début juillet 2026). Le système repose sur une architecture transformer combinée à une récurrence modulaire partagée entre les composants du robot (bras, jambes, articulations), conçue pour reconstruire des informations contextuelles sur les propriétés physiques d'un robot même quand ces données ne sont que partiellement disponibles au départ. Les chercheurs l'ont testé sur un large ensemble de robots simulés dans MuJoCo, le moteur physique open source largement utilisé en apprentissage par renforcement, à travers quatre environnements distincts. Résultat clé: le modèle affiche un gain net en généralisation zero-shot, c'est-à-dire sa capacité à piloter correctement des robots aux dynamiques, cinématiques et topologies jamais rencontrées pendant l'entraînement, sans réglage additionnel. Cette avancée s'inscrit dans un enjeu central pour l'industrie robotique: réduire le coût d'entraînement et de déploiement de contrôleurs spécifiques à chaque morphologie de robot. Un contrôleur universel capable de généraliser à de nouveaux designs mécaniques réduirait drastiquement les besoins en données et en calcul pour chaque nouveau modèle de robot, un problème que rencontrent aujourd'hui les fabricants de robots humanoïdes et de bras manipulateurs multiples. C'est aussi une contribution au débat sur la viabilité des architectures de type VLA (vision-language-action) et des politiques génériques à grande échelle: ici, la généralisation ne vient pas d'un volume massif de données mais d'une architecture qui exploite explicitement la structure modulaire du robot. L'approche s'inscrit dans une lignée de travaux en RL contextuel et en contrôle multi-robots qui exploitent déjà des informations sur la morphologie pour entraîner des agents partagés, mais qui peinaient jusqu'ici à généraliser à des morphologies fortement dissimilaires. Le fait que cet article soit republié en tant que "replace-cross" sur arXiv suggère une révision après retours de la communauté, un signe que le sujet suscite un intérêt actif en apprentissage par renforcement appliqué à la robotique. Les prochaines étapes attendues concernent une validation sur robots physiques réels, au-delà des simulations MuJoCo, pour confirmer le transfert sim-to-real.

RecherchePaper
1 source
Multi-agent : contrôle robotique par modèles vision-langage embarqués
1365arXiv cs.RO 

Multi-agent : contrôle robotique par modèles vision-langage embarqués

Une équipe de recherche présente, dans un article publié sur arXiv (arXiv:2607.07403v1), une architecture multi-agents (MAS) pour le contrôle robotique conçue pour fonctionner entièrement en local, sans dépendre d'une infrastructure de calcul externe. Le système pilote un manipulateur mobile autonome polyvalent dans un entrepôt industriel simulé, où il exécute cinq catégories de tâches : inspection de sécurité, maintenance de l'entrepôt, recherche d'objets, vérification de la qualité des colis, et réponse aux demandes humaines. L'architecture s'appuie sur des modèles vision-langage (VLM) compacts, entre 3 et 20 milliards de paramètres, avec un fine-tuning appliqué spécifiquement pour améliorer la précision de l'inspection des colis. Un agent d'orchestration baptisé "Megamind" a été conçu pour limiter les pertes de contexte que subissent les petits modèles sur des tâches de planification à long horizon. Le système a été validé en configuration hardware-in-the-loop, sur un mini PC AMD Ryzen AI, combinant simulation et matériel embarqué réel. Ce travail s'attaque à trois limites récurrentes des VLM et des modèles vision-langage-action (VLA) appliqués à la robotique : l'explicabilité, la généralisation et les besoins en calcul. En s'appuyant sur des modèles compacts exécutés localement plutôt que sur des VLA massifs hébergés dans le cloud, l'approche promet une réduction des coûts d'infrastructure et une latence moindre, deux critères déterminants pour les intégrateurs industriels qui veulent déployer des robots autonomes sans dépendre d'une connectivité permanente. Les auteurs présentent leurs résultats comme une preuve qu'une architecture multi-agents entièrement embarquée constitue une alternative viable et économique aux déploiements dépendants du cloud, avec un potentiel de transfert vers le réel. Ces résultats restent toutefois obtenus en environnement simulé ; le passage à un robot physique en conditions réelles d'entrepôt demeure l'étape déterminante pour confirmer la promesse. L'essor de VLA comme Pi-0, GR00T N2 ou Helix a mis en évidence la dépendance de nombreux systèmes robotiques à des clusters de calcul distants, un frein pour les déploiements industriels à grande échelle. En misant sur des modèles plus petits orchestrés collectivement plutôt que sur un modèle monolithique unique, cette recherche se distingue des approches dominantes centrées sur des VLA de grande taille. Les chercheurs ont publié l'environnement de simulation en open source sous licence Apache 2.0, ouvrant la voie à des extensions et comparaisons par la communauté robotique. Les prochaines étapes attendues concernent la validation sur robot physique en entrepôt réel ainsi que l'élargissement des catégories de tâches couvertes par le système.

RecherchePaper
1 source
Robotique sociale : projection multimodale de l'activité vocale pour la gestion des tours de parole avec des encodeurs préentraînés liés à l'activité vocale
1366arXiv cs.RO 

Robotique sociale : projection multimodale de l'activité vocale pour la gestion des tours de parole avec des encodeurs préentraînés liés à l'activité vocale

Les chercheurs à l'origine de ce travail présentent MM-VAP (Multimodal Voice Activity Projection), un système de prédiction des tours de parole conçu pour les robots sociaux impliqués dans des interactions humain-humain, en particulier en contexte de médiation. Contrairement à l'approche VAP originale qui ne traite que l'audio, MM-VAP synchronise les flux audio et visuel tout en conservant l'objectif d'apprentissage auto-supervisé de projection future. Le système s'appuie sur des architectures audio-visuelles pré-entraînées, initialement conçues pour des tâches liées à la parole, adaptées au problème du tour de parole via la technique LoRA (Low-Rank Adaptation), qui permet un fine-tuning léger sans réentraîner l'intégralité des poids. Après un encodage indépendant de chaque locuteur, une couche d'attention inter-locuteurs modélise les dynamiques relationnelles nécessaires pour anticiper l'activité vocale future, complétée par une fonction de perte de cohérence sémantique régularisant un espace de sortie à 256 états selon des patterns de dialogue de plus haut niveau. Les tests ont été menés sur les corpus NoXi et NoXi+J, avec une évaluation complémentaire sur le corpus Haru EDR. Ce travail s'inscrit dans un enjeu clé pour les robots conversationnels et sociaux : anticiper la dynamique d'une conversation plutôt que réagir mécaniquement aux silences, ce qui reste un point faible des systèmes de dialogue actuels. Pour les concepteurs de robots de médiation ou d'assistance sociale (accueil, animation de réunion, robots compagnons), une meilleure prédiction des tours de parole se traduit directement par des interactions moins mécaniques et plus naturelles. Les résultats montrent des améliorations par rapport aux références existantes, notamment sur certains types spécifiques d'événements de tour de parole, ce qui suggère que l'ajout de la modalité visuelle apporte un signal réellement exploitable, au-delà du simple audio, pour ce type de tâche. Le champ du "turn-taking" prédictif s'appuie historiquement sur des modèles purement acoustiques, le cadre VAP servant de référence. Cette extension multimodale s'inscrit dans une tendance plus large de l'interaction humain-robot consistant à combiner plusieurs canaux sensoriels pour améliorer la robustesse des modèles conversationnels, avec le corpus Haru comme banc d'essai orienté robotique de médiation, ouvrant la voie à des évaluations sur des plateformes robotiques réelles au-delà des corpus d'interaction humain-humain enregistrés.

RecherchePaper
1 source
EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée
1367arXiv cs.RO 

EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée

Une équipe de recherche a publié EmbodiedGen V2 sur arXiv (2607.07459v1), un moteur génératif de mondes 3D destiné à produire des environnements de simulation directement exploitables pour l'entraînement de robots. Le problème visé est concret : générer des assets 3D "sim-ready" est devenu rapide, mais les assembler en environnements de tâches réellement utilisables pour l'apprentissage reste largement manuel, ce qui limite le passage à l'échelle de l'apprentissage en boucle fermée. EmbodiedGen V2 propose une représentation unifiée qui relie assets compatibles multi-simulateurs, affordances d'interaction, mondes orientés tâches, scènes multi-pièces à grande échelle, et un système de "Vibe Coding" avec état, le tout dans un pipeline génératif, éditable et réutilisable. Les environnements produits couvrent la manipulation, la navigation, la manipulation mobile, le déploiement cross-simulateur et l'entraînement de politiques robotiques. Sur le plan chiffré, le pipeline de génération d'assets atteint 96,5% d'acceptation humaine et 98,6% de réussite de détection de collisions, et 83,3% des mondes orientés tâches sont directement utilisables en simulation sans retouche manuelle. L'intérêt principal tient aux résultats de transfert obtenus grâce à ces environnements générés. Un entraînement par renforcement en ligne fait passer le taux de succès en simulation de 9,7% à 79,8%, et ces gains se transfèrent à des robots réels avec un taux de succès en tâche réelle passant de 21,7% à 75,0%. Pour un secteur où l'écart entre démonstration simulée et comportement réel reste un obstacle majeur à la commercialisation de robots humanoïdes ou mobiles pilotés par des politiques apprises, ce type de résultat constitue un argument concret en faveur de la génération procédurale de mondes comme infrastructure d'entraînement, plutôt qu'une simple preuve de concept de génération d'assets visuels. Le travail s'inscrit dans la lignée des efforts récents de génération de scènes 3D et d'assets simulables pour l'IA incarnée, où la difficulté ne portait plus tant sur la qualité visuelle des objets générés que sur leur intégration fonctionnelle dans des tâches robotiques complètes et transférables entre simulateurs. Le papier ne mentionne pas de partenariat industriel ni de déploiement sur robot commercial identifié, et se positionne comme une contribution d'infrastructure de recherche, dont l'adoption dépendra de sa reproductibilité et de son intégration par d'autres laboratoires travaillant sur l'apprentissage par renforcement pour la robotique.

RechercheActu
1 source
Opérateur en douceur : un algorithme d'échantillonnage en temps réel pour le retargeting cinématique des mains
1368arXiv cs.RO 

Opérateur en douceur : un algorithme d'échantillonnage en temps réel pour le retargeting cinématique des mains

Des chercheurs publient sur arXiv (2607.07491, juillet 2026) un nouvel algorithme de retargeting cinématique des mains baptisé Sampling-Based Retargeter (SBR), conçu pour convertir en temps réel les mouvements d'un opérateur humain en commandes pour une main robotique, sans les à-coups (jitter) qui affectent les méthodes actuelles basées sur le gradient. Contrairement à ces approches classiques, qui convergent souvent vers des minima locaux différents et produisent des mouvements saccadés, SBR s'appuie sur les techniques de contrôle par échantillonnage, sans calcul de gradient. L'équipe l'a testé en simulation puis lors d'une étude utilisateur en conditions réelles avec 18 participants effectuant trois tâches de manipulation complexes. Résultat : SBR obtient le meilleur taux de réussite global des baselines comparées, 54,1%, tout en réduisant significativement la fatigue cognitive des opérateurs, avec le score de charge de travail NASA-TLX le plus bas relevé, 36,4 sur 100. L'enjeu dépasse la seule fluidité du geste téléopéré. Les modèles Vision-Language-Action (VLA) et les Video Action Models, aujourd'hui au cœur des pipelines d'apprentissage pour la manipulation robotique dexterous, sont entièrement bornés par la qualité des démonstrations humaines collectées en téléopération. Un retargeting bruité ou saccadé dégrade directement les données d'entraînement, donc les capacités finales du robot, quelle que soit la sophistication du modèle en aval. En réduisant le jitter et la fatigue de l'opérateur, SBR s'attaque donc à un goulot d'étranglement amont, souvent négligé face aux annonces spectaculaires sur les modèles eux-mêmes : la qualité de la donnée de téléopération conditionne tout le reste. Un taux de succès de 54,1% reste toutefois modeste en valeur absolue, signe que la manipulation dexterous téléopérée demeure un problème ouvert même avec un meilleur retargeting. Le retargeting cinématique, c'est-à-dire la traduction des degrés de liberté (DOF) d'une main humaine vers ceux, différents, d'une main robotique, est un problème classique de téléopération dexterous, historiquement traité par optimisation gradient-based. Les auteurs positionnent explicitement SBR contre ces baselines à gradient et livrent, au-delà de l'algorithme, une méthodologie de benchmarking destinée à structurer les évaluations futures dans ce domaine encore fragmenté.

RecherchePaper
1 source
EvoPlan : planification robotique neuro-symbolique évolutionnaire avec garanties spatio-temporelles
1369arXiv cs.RO 

EvoPlan : planification robotique neuro-symbolique évolutionnaire avec garanties spatio-temporelles

Une nouvelle publication arXiv (2607.06724v1) présente EvoPlan, un framework neuro-symbolique pour la planification robotique combinant modèles de langage et méthodes formelles. Le système repose sur trois composants fonctionnant avec un LLM open-weight hébergé localement, permettant un déploiement embarqué sans dépendance au cloud. Le premier module extrait hors ligne une contrainte globale de logique temporelle signal (STL) portant sur la mobilité, à partir de données de démonstration : règles codifiées comme l'arrêt aux feux rouges, minées des journaux de conduite nuPlan, ou préférences comportementales comme le confort en navigation sociale, extraites des données de téléopération SCAND. Comme ces démonstrations ne fournissent que des exemples positifs, les chercheurs génèrent des contre-exemples par perturbations contrefactuelles et un générateur de violations basé sur LLM, puis ajustent la contrainte par recherche évolutionnaire. Cette contrainte sert ensuite à encadrer une politique de conduite vision-langage testée sur Bench2Drive et deux politiques de navigation discrète sur HA-VLN-CE. Le deuxième module est un planificateur PDDL évolutionnaire où un LLM propose et corrige des plans, validés par des vérificateurs programmatiques, testé sur le benchmark ALFWorld Text. Le troisième module est une boucle d'exécution contrainte qui compile les plans en trajectoires, vérifiées contre la contrainte STL, avec replanification en cas de violation. L'enjeu pointé par les auteurs est concret pour l'industrie : les planificateurs purement LLM sont fluides mais n'offrent aucune garantie d'exécutabilité ou de sécurité, tandis que les planificateurs PDDL classiques garantissent ces propriétés mais exigent une spécification complète du problème et exploitent mal la capacité des LLM à lire le contexte et réparer un plan. EvoPlan tente de concilier les deux approches, un enjeu central pour tout déploiement robotique en environnement réel où sécurité et adaptabilité doivent coexister sans validation manuelle exhaustive. Il s'agit à ce stade d'un travail de recherche académique, illustré uniquement par des démonstrations dans le simulateur Gazebo, sans déploiement sur robot physique ni annonce industrielle associée. Le planificateur reste robuste même quand le vocabulaire des objectifs ne correspond pas à celui du modèle d'actions, un point que les auteurs présentent comme un résultat significatif face aux baselines existantes.

RecherchePaper
1 source
TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique
1370arXiv cs.RO 

TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique

Une équipe de recherche présente TouchWorld, un modèle fondationnel tactile conçu pour la manipulation dextre, dans un article publié sur arXiv (2607.07287v1) début juillet 2026. Le système repose sur une politique hiérarchique en trois couches : une couche de planification vision-langage qui découpe la tâche en sous-objectifs et prédit des sous-buts tactiles, une politique visuo-tactile conditionnée par objectif qui génère des séquences d'actions nominales, et une politique de raffinement conditionnée par le toucher qui corrige en temps réel à partir du retour tactile et proprioceptif haute fréquence. Évalué sur six tâches de manipulation dextre longues et riches en contacts, TouchWorld atteint 65,0% de réussite en conditions propres et 53,7% sous perturbations humaines, soit 15,7 et 18,5 points de plus que la meilleure référence testée. L'apport principal tient à la séparation des échelles de temps : la plupart des politiques existantes traitent le toucher comme un simple flux d'observation basse fréquence, mélangé dans la même boucle que le raisonnement de tâche et la génération d'action. TouchWorld découple ce retour rapide (glissement, désalignement, force, stabilité de prise) du raisonnement sémantique lent porté par la vision et le langage. Pour les intégrateurs et chercheurs en robotique, cela répond directement à une limite connue des architectures vision-langage-action : leur capacité de généralisation sémantique ne suffit pas à gérer les micro-corrections de contact nécessaires en manipulation fine, un écart souvent cité entre démonstrations impressionnantes et robustesse réelle en conditions perturbées. L'article s'inscrit dans la lignée des travaux récents sur les modèles de fondation tactiles et les politiques visuo-tactiles pour la robotique, un axe de recherche encore jeune comparé aux modèles vision-langage-action purement visuels. Les auteurs ne précisent pas d'affiliation ni de calendrier de déploiement dans le résumé ; il s'agit à ce stade d'un travail de recherche évalué en environnement contrôlé, sans indication de transfert vers un produit ou un déploiement industriel.

RecherchePaper
1 source
Immersion sociale en réalité virtuelle avec des humanoïdes assistés par LLM
1371arXiv cs.RO 

Immersion sociale en réalité virtuelle avec des humanoïdes assistés par LLM

Des chercheurs présentent un système de téléopération immersive pour robots humanoïdes combinant casque Apple Vision Pro et modèle de langage, testé sur un robot Unitree H1 équipé de mains dextres. L'opérateur reçoit un flux vidéo à la première personne directement depuis les caméras du robot, pilote ses déplacements par commandes vocales en langage naturel converties en instructions de haut niveau par un module LLM, et contrôle les bras et les doigts du robot par suivi du poignet et des mains, retranscrit via cinématique inverse et régulation PD. Le système enregistre en parallèle des données multimodales : images RGB égocentriques, commandes vocales et texte, états articulaires, mouvements des mains et signaux de regard, en vue d'un futur entraînement par apprentissage par imitation. Les auteurs rapportent que des utilisateurs novices, après une brève familiarisation, atteignent 80% de réussite sur des tâches de manipulation d'objets et 70% sur une tâche d'interaction sociale consistant à se faire passer un cube avec le robot. L'intérêt de ces travaux tient moins à la performance brute qu'à la démonstration d'une interface de téléopération accessible à des non-experts, sans entraînement lourd ni contrôle bas niveau exigeant. C'est un signal pertinent pour le secteur : la plupart des démonstrations de téléopération humanoïde restent réservées à des opérateurs entraînés maniant des contrôleurs spécialisés, ce qui freine leur adoption pour l'assistance à distance ou la collecte de données d'entraînement à grande échelle. En couplant retour visuel immersif, langage naturel et capture de mouvement fine, cette approche illustre une piste concrète pour réduire la charge cognitive et physique de l'opérateur, un frein connu au déploiement commercial des humanoïdes téléopérés. Il faut toutefois noter que les taux de réussite annoncés, 70 à 80%, restent modestes face aux standards industriels et proviennent d'un nombre d'essais limité en laboratoire, loin d'un déploiement réel. Ce travail s'inscrit dans la lignée des systèmes de téléopération immersive qui se sont multipliés avec l'essor des VLA (modèles vision-langage-action) comme Pi-0 ou GR00T N2, où la collecte de démonstrations humaines de haute qualité est un goulot d'étranglement majeur pour l'apprentissage. Le choix du Vision Pro comme interface, plutôt que des combinaisons de capture de mouvement traditionnelles, reflète une tendance plus large du secteur à exploiter le matériel grand public pour réduire les coûts de téléopération, une direction également explorée par plusieurs laboratoires américains et chinois. Il s'agit ici d'une publication de recherche académique arXiv, sans partenaire industriel ni calendrier de commercialisation annoncé : les prochaines étapes attendues porteraient sur l'exploitation des données multimodales collectées pour entraîner des politiques autonomes, transformant à terme cette téléopération assistée en un système capable d'agir de façon plus indépendante.

RecherchePaper
1 source
LHM-Humanoid : commande longue portée du mouvement humain pour le transport continu d'objets en environnement encombré
1372arXiv cs.RO 

LHM-Humanoid : commande longue portée du mouvement humain pour le transport continu d'objets en environnement encombré

Des chercheurs présentent LHM-Humanoid, un système de contrôle physique pour humanoïdes simulés capable d'enchaîner en continu des cycles complets de collecte, transport et dépôt d'objets, sans réinitialisation entre chaque cycle. L'approche a été testée sur 350 configurations de pièces encombrées, réparties en quatre types d'environnements. Elle repose sur deux contrôleurs conditionnés par objectif : le premier exécute le cycle « aller chercher, porter, déposer » et apprend un comportement de relâchement et de retrait pour terminer dans un état récupérable ; le second prend ensuite le relais depuis cette distribution d'états. Les deux sont régularisés par un a priori de mouvement adversarial, puis distillés en une seule politique capable d'exécuter toute la séquence en un unique passage continu, sans reset. Les travaux, publiés sur arXiv (2508.16943v3, version révisée), montrent des performances nettement supérieures à celles du RL de bout en bout, du RL hiérarchique et des méthodes antérieures d'interaction humain-scène. Le problème central n'est pas la marche, le levage ou le dépôt pris isolément, ces briques sont déjà bien maîtrisées en simulation, mais la transition entre cycles : chaque dépôt laisse le personnage dans une posture déséquilibrée non canonique, où l'apprentissage par renforcement de bout en bout échoue généralement. En traitant ce passage de relais comme un problème de récupérabilité à double contrainte, préserver l'objet tout juste posé tout en atterrissant dans un état permettant une reprise équilibrée, l'équipe s'attaque à un angle mort classique du secteur : la plupart des démonstrations de robotique humanoïde restent des clips courts réinitialisés entre chaque prise, loin des scénarios de production continue visés en logistique ou en usine. Pour les chercheurs et intégrateurs, ce résultat éclaire un vrai obstacle vers l'autonomie longue durée, plutôt qu'une simple performance ponctuelle sur une tâche isolée. Ces travaux s'inscrivent dans le champ du contrôle de mouvement humain basé sur la physique, orienté simulation et réalisme biomécanique, à distinguer des approches VLA appliquées à du matériel réel comme Pi-0 ou GR00T N2, qui elles ciblent le transfert sim-to-real sur robot physique. LHM-Humanoid demeure pour l'instant un résultat purement simulé, validé sur scènes connues et inédites, sans mention de déploiement sur plateforme réelle. La suite logique consisterait à transposer cette stratégie de transition récupérable vers des humanoïdes physiques, à l'image de ceux développés par Figure, Tesla ou Boston Dynamics, où l'enchaînement sans interruption de tâches de manutention reste aujourd'hui un défi ouvert pour l'industrie.

RecherchePaper
1 source
Ace ! Planification de mouvement pour des services de tennis de table de niveau professionnel avec un bras robotique
1373arXiv cs.RO 

Ace ! Planification de mouvement pour des services de tennis de table de niveau professionnel avec un bras robotique

Le laboratoire ayant produit ce travail présente "Ace!", une nouvelle méthode permettant à un bras robotique de générer des services de tennis de table conformes aux règles officielles de la discipline. L'approche combine trois briques techniques : des primitives de mouvement préconçues, une commande prédictive par modèle (Model Predictive Control, MPC) pour l'exécution en temps réel, et une optimisation bayésienne pour ajuster les paramètres du service. Le système parvient à produire des effets (spin) contrôlables allant jusqu'à 550 rad/s et des vitesses de balle atteignant 6,7 m/s, des valeurs qui égalent, voire dépassent, celles observées chez les joueurs de tennis de table de niveau élite. Les travaux sont détaillés dans un article publié sur arXiv (référence 2607.06989v1). Ce résultat comble un angle mort de la robotique sportive : depuis des décennies, la quasi-totalité des recherches sur le tennis de table robotique portait sur la relance, c'est-à-dire la capacité à renvoyer une balle entrante, un problème qui mobilise déjà vision rapide et contrôle en boucle fermée. Le service, lui, restait largement inexploré alors qu'il pose des défis physiques bien plus extrêmes : générer un effet important à partir d'une balle initialement sans rotation, viser avec précision, et arbitrer entre plusieurs objectifs contradictoires (vitesse, spin, placement). Démontrer qu'un bras robotique peut reproduire, voire dépasser, la performance humaine sur cette tâche constitue une preuve de concept significative pour la modélisation physique appliquée à des mouvements dynamiques complexes, au-delà du seul cas du tennis de table. Le tennis de table s'est imposé comme un banc d'essai classique en robotique en raison de sa combinaison unique de vitesse, de précision et d'espace de jeu compact, un terrain propice pour tester vision rapide et planification de trajectoire. Les recherches précédentes s'étaient concentrées presque exclusivement sur la relance ; ce travail ouvre la voie à des systèmes robotiques capables de gérer l'intégralité d'un point, service compris, avec des applications potentielles pour l'entraînement sportif automatisé ou les partenaires de jeu robotisés.

RecherchePaper
1 source
RoboSnap : génération de scènes réel-vers-simulation en un seul essai pour l'apprentissage et l'évaluation généralisables de robots
1374arXiv cs.RO 

RoboSnap : génération de scènes réel-vers-simulation en un seul essai pour l'apprentissage et l'évaluation généralisables de robots

RoboSnap transforme une simple image RGB en environnement de simulation prêt pour l'entraînement robotique, selon un article publié sur arXiv (2607.06699v1). L'équipe de recherche propose une architecture en couches qui sépare la zone d'interaction physique de l'arrière-plan visuel : les objets au premier plan, ceux avec lesquels le robot interagit, sont reconstruits avec une attention particulière à la stabilité de collision, tandis que le fond est restitué par Gaussian splatting 3D pour préserver un rendu fidèle sous des angles de vue inédits. Les tests ont porté sur des scènes issues du jeu de données DROID ainsi que sur des tâches robotiques réelles, montrant une reproduction fiable des trajectoires dans les scènes recréées. Pour accompagner ces travaux, les auteurs publient DROID-Sim, un jeu de données compagnon construit à partir de 564 scènes réelles extraites de DROID. L'enjeu dépasse la simple reconstruction visuelle. Le passage du réel à la simulation ("real-to-sim") est un goulot d'étranglement connu pour l'entraînement des politiques robotiques par apprentissage : générer des environnements à la fois physiquement stables et visuellement réalistes reste coûteux en temps et en ingénierie. RoboSnap promet de générer une scène simulable à partir d'une seule photo, ce qui pourrait accélérer la production de données synthétiques d'entraînement et faciliter l'évaluation reproductible de politiques, un point sensible dans un secteur où les benchmarks physiques réels sont difficiles à standardiser. Les auteurs revendiquent une corrélation significative entre performances en simulation et en conditions réelles, un indicateur clé pour juger si un tel pipeline peut réellement remplacer des tests physiques répétés. Ce travail s'inscrit dans une vague plus large de recherches sur le "real-to-sim" et les architectures vision-langage-action (VLA), où des approches comme Gaussian splatting gagnent du terrain face aux méthodes de reconstruction 3D classiques, jugées plus lentes ou moins fidèles visuellement. L'article, encore au stade de prépublication non revue par les pairs, ne précise pas de calendrier de mise à disposition du code ou du jeu de données DROID-Sim, ni de partenariat industriel. Les prochaines étapes attendues concernent l'extension à des scènes plus complexes et la validation sur davantage de plateformes robotiques.

RecherchePaper
1 source
Initiation Safety : une dimension manquante dans la sécurité des robots généralistes
1375arXiv cs.RO 

Initiation Safety : une dimension manquante dans la sécurité des robots généralistes

Le laïus d'un nouvel article publié sur arXiv (référence 2607.07420v1) pointe un angle mort dans les cadres de sécurité des robots généralistes. Jusqu'ici, la sécurité robotique se pense presque exclusivement autour de deux couches : la sécurité du mouvement (évitement de collision, limitation de force) et la sécurité du dialogue (filtrage de contenu). Les auteurs identifient une troisième dimension absente des architectures actuelles : l'autorisation d'initiation, c'est-à-dire la question de savoir si un robot doit engager de lui-même une première action sociale difficile à annuler, comme saluer une personne, saisir un objet sans y être invité, ou entrer dans son espace personnel. Pour y répondre, ils proposent un protocole baptisé PAS (probe-authorize-speak, soit sonder-autoriser-parler), qu'ils implémentent sur un humanoïde positionné à l'entrée d'une pièce, et qu'ils comparent à une approche directe ("direct-init") à partir de traces d'interactions déjà enregistrées. Une étude utilisateur à trois conditions est proposée pour la suite des travaux. L'argument central est simple mais structurant pour l'industrie : détecter une personne n'équivaut pas à obtenir son consentement pour être abordée. Or les architectures actuelles des robots humanoïdes et des systèmes VLA (vision-language-action) traitent souvent un score d'engagement élevé, ou une prédiction de mouvement jugée fiable, comme un feu vert implicite pour agir. Pour les intégrateurs et décideurs qui déploient des robots généralistes dans des environnements partagés (retail, hôpitaux, hôtellerie), cela signale un risque de confiance et de responsabilité juridique largement ignoré par les filtres de sécurité existants : un robot peut être physiquement sûr tout en étant socialement intrusif. Cette contribution reste pour l'instant un travail de recherche, testé sur un unique prototype de robot en situation de porte d'entrée, sans validation à grande échelle ni étude utilisateur complète. Les auteurs laissent ouvertes plusieurs questions clés : comment mesurer le consentement dans ce type d'interaction, quelle gouvernance ou certification appliquer, et où placer la frontière entre des règles explicites d'initiation et le comportement génératif plus large des modèles fondation qui pilotent ces plateformes, qu'il s'agisse de Figure, Optimus ou d'architectures VLA comme Pi-0, GR00T N2 ou Helix.

RecherchePaper
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
1376arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
WAM-TTT : piloter les modèles monde-action en observant le jeu humain en temps de test
1377arXiv cs.RO 

WAM-TTT : piloter les modèles monde-action en observant le jeu humain en temps de test

Une équipe de recherche présente WAM-TTT, une méthode d'entraînement au moment du test ("test-time training") permettant d'orienter des modèles fondation robotiques de type world-action model (WAM) simplement en leur montrant des vidéos humaines, sans démonstration robotique ni fine-tuning spécifique à la tâche. Publié sur arXiv (2607.06988v1), le système ne traite pas les vidéos humaines comme des trajectoires à imiter directement : il les absorbe dans une mémoire adaptative légère, greffée sur un WAM gelé, via un objectif de prédiction vidéo auto-supervisé. Une étape de méta-entraînement, utilisant des paires de données humain-robot et un objectif de reconstruction de mémoire par clé-valeur, aligne en amont les démonstrations humaines avec les comportements robotiques attendus. Résultat : au moment du déploiement, seules des vidéos humaines non annotées suffisent pour adapter le comportement du robot, le modèle fondation pré-entraîné restant intégralement gelé. Les auteurs rapportent que WAM-TTT surpasse systématiquement les approches de référence par conditionnement contextuel sur vidéos humaines, sur un ensemble varié de tâches de manipulation et de scénarios de généralisation. Cette approche s'attaque à un vrai goulot d'étranglement des modèles fondation robotiques (RFM) : aujourd'hui, adapter un modèle vision-langage-action (VLA) à une nouvelle variante de tâche ou à une préférence utilisateur exige généralement de nouvelles démonstrations robotiques coûteuses à collecter, un fine-tuning dédié, ou un long contexte de conditionnement gourmand en calcul. En permettant un pilotage à partir de simples vidéos humaines, sans action robotique ni annotation, WAM-TTT réduit potentiellement le coût d'adaptation et de personnalisation des robots pour les intégrateurs, tout en préservant les capacités de généralisation du modèle de base, un compromis que les méthodes de fine-tuning classiques peinent souvent à tenir. Le papier s'inscrit dans la lignée des travaux récents sur les world-action models et le conditionnement en contexte par vidéo, dont il cherche explicitement à dépasser les limites en tant que méthode de référence comparée. À ce stade, il s'agit d'un résultat de recherche évalué en simulation et sur des bancs de manipulation expérimentaux, sans indication de déploiement industriel ni de partenariat avec un fabricant de robots humanoïdes ou d'AMR ; les auteurs ne précisent pas de calendrier de transfert vers des plateformes commerciales.

RechercheActu
1 source
Modèle vision-langage-action pour la génération compositionnelle de mouvements à partir de démonstrations avec champs neuronaux centrés sur l'objet
1378arXiv cs.RO 

Modèle vision-langage-action pour la génération compositionnelle de mouvements à partir de démonstrations avec champs neuronaux centrés sur l'objet

Des chercheurs publient sur arXiv (identifiant 2607.07129, soumission de type "new", juillet 2026) un framework d'apprentissage par démonstration pour la génération de mouvement robotique compositionnel. La méthode combine des représentations neuronales centrées objet, des neural fields canoniques associés à des déformations conditionnées par une variable latente, pour rendre des scènes en capturant variations de position et de géométrie de façon lisse et interprétable. Pour la génération de mouvement, un mélange d'experts temporel (temporal mixture-of-experts) utilise un mécanisme de gating qui combine dans le temps des primitives de mouvement conditionnées par objet, produisant des trajectoires complètes. En simulation, le modèle accomplit des tâches de manipulation à long horizon avec significativement moins de données d'entraînement que les méthodes de référence basées sur l'image. Des expériences en conditions réelles confirment la robustesse au bruit, une généralisation au niveau catégoriel grâce à des modèles de segmentation pilotés par le langage, et la capacité d'opérer directement sur des représentations de scène en 3D. Cette approche s'attaque à un problème central de l'apprentissage par démonstration en robotique: généraliser au-delà des configurations de scène vues à l'entraînement sans faire exploser les besoins en données. En ancrant le mouvement dans une structure visuelle explicite plutôt que dans des pixels bruts, la méthode promet une efficacité data nettement supérieure, un enjeu critique pour les intégrateurs industriels qui ne disposent pas des volumes de démonstrations que collectent les grands laboratoires spécialisés en modèles vision-langage-action. Si ces résultats se confirment à plus grande échelle, cette compositionnalité spatio-temporelle pourrait réduire le coût de déploiement de bras manipulateurs dans des environnements variés, sans réentraînement complet à chaque nouvelle configuration. Le travail s'inscrit dans la double lignée des "movement primitives", qui structurent le mouvement en briques réutilisables, et des neural fields appliqués à la robotique, qui représentent la géométrie de façon compacte. Il se positionne comme alternative modulaire et interprétable face aux modèles VLA end-to-end à grande échelle, généralement plus gourmands en données mais plus généralistes. L'article, validé en simulation et par des expériences réelles limitées, ne mentionne aucun déploiement industriel ni partenariat commercial: il s'agit à ce stade d'une contribution académique dont la suite logique serait une évaluation sur des plateformes robotiques partagées et des benchmarks standardisés.

IA physiqueActu
1 source
Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée
1379arXiv cs.RO 

Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée

Un article publié le 9 juillet 2026 sur arXiv (référence 2607.06990) présente un nouveau système multi-agent destiné à fiabiliser la manipulation robotique lorsque plusieurs robots doivent coopérer. Les chercheurs proposent une architecture hiérarchique et bouclée reposant sur trois agents pilotés par un grand modèle de langage (LLM) : un agent de planification qui décompose une instruction globale en sous-tâches réparties entre les robots, un agent de manipulation propre à chaque robot qui exécute les actions en mobilisant dynamiquement des outils adaptés, et un agent de vérification qui observe les résultats physiques réels et renvoie des corrections sémantiques en cas d'échec ou d'écart. Le système a été testé lors d'expériences réelles, sans que l'article ne précise pour l'instant de chiffres exacts (taux de succès, nombre de robots, temps de cycle) au-delà de l'affirmation d'une performance supérieure aux approches existantes, aussi bien sur des tâches limitées à un seul poste de travail que sur des tâches réparties entre plusieurs espaces de travail distincts. L'intérêt de ce travail tient au problème qu'il cible directement : la plupart des approches actuelles combinant LLM et robotique se cantonnent soit à un seul bras manipulateur, où la prise en compte du contact physique est robuste mais sans coordination multi-robot possible, soit à une planification multi-robot de haut niveau qui traite la manipulation comme une brique idéalisée, ignorant les aléas réels d'exécution (glissement, échec de préhension, erreur de perception). En bouclant la boucle perception-action-vérification à l'échelle du système multi-robot, cette architecture s'attaque à un angle mort connu du secteur : la difficulté à faire passer un plan LLM cohérent en langage naturel vers une exécution physique fiable quand plusieurs machines doivent se synchroniser sur des tâches à long horizon. Ce travail s'inscrit dans une tendance de recherche plus large qui cherche à doter les architectures VLA (vision-language-action) et les systèmes agentiques d'un mécanisme de rétroaction correctif, plutôt que de se reposer uniquement sur des plans ouverts non révisables. Il concurrence conceptuellement les approches de planification hiérarchique pure et les méthodes de manipulation mono-robot type Pi-0 ou GR00T N2, en visant explicitement le passage à l'échelle vers des ateliers ou des cellules industrielles à plusieurs robots. L'article, encore un simple dépôt arXiv à ce stade, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial.

RechercheActu
1 source
Context-aware : estimation de force pour la manipulation d'outils déformables lors du prélèvement environnemental robotisé par adaptation continue à faible échantillonnage
1380arXiv cs.RO 

Context-aware : estimation de force pour la manipulation d'outils déformables lors du prélèvement environnemental robotisé par adaptation continue à faible échantillonnage

Une équipe de recherche publie sur arXiv (référence 2607.07574, soumis le 7 juillet 2026) une méthode d'estimation de force par apprentissage pour la manipulation d'outils déformables en robotique, appliquée au prélèvement d'échantillons de surface (swabbing environnemental). Le problème technique visé est précis : quand un bras robotique presse un écouvillon souple contre une surface, l'hystérésis viscoélastique non linéaire de l'outil déforme le signal capté par le capteur de force au poignet, qui ne reflète alors plus fidèlement la force réellement appliquée à la pointe. Intégrer un capteur directement dans l'outil est écarté pour des raisons de stérilité et de jetabilité en contexte de prélèvement. Les chercheurs comparent plusieurs architectures temporelles et retiennent un LSTM compact, qui obtient la meilleure précision avec une latence d'inférence sous la milliseconde. Pour généraliser à des surfaces et outils inédits, ils ajoutent une couche d'adaptation few-shot : un backbone récurrent gelé est modulé par des embeddings de contexte de faible dimension via FiLM (feature-wise linear modulation). Testée sur un bras UR5e à travers neuf régimes d'interaction outil-surface différents, l'approche réduit l'erreur d'estimation en zero-shot jusqu'à 63%, sans dégrader les performances de base (pas d'oubli catastrophique). L'enjeu dépasse le simple prélèvement d'échantillons : c'est un problème générique de manipulation d'outils déformables (compresses, éponges, brosses, tampons) que l'on retrouve en robotique médicale, en laboratoire automatisé et en inspection industrielle, là où le retour de force est indispensable pour garantir une pression de contact constante mais où l'instrumentation directe de l'outil est impossible ou trop coûteuse à jeter à chaque usage. La contribution méthodologique intéressante pour les intégrateurs est la séparation entre une dynamique de déformation partagée, apprise une fois, et un conditionnement spécifique au domaine, adapté avec très peu de données pour chaque nouvelle combinaison outil-surface. Cela répond directement à un point de friction classique du déploiement de systèmes appris en robotique : la plupart des modèles de force ou de contact entraînés en labo s'effondrent face à des surfaces ou des outils jamais vus, obligeant à tout réentraîner. Une adaptation few-shot qui tient sans réentraînement complet, si elle se confirme au-delà des neuf configurations testées en laboratoire, réduirait le coût d'intégration pour des cas d'usage variés (hôpitaux, sites industriels, environnements BSL). Ce travail s'inscrit dans la lignée des recherches sur le contrôle par impédance et l'estimation de force sans capteur dédié, un axe actif depuis plusieurs années en robotique de manipulation fine, mais appliqué ici spécifiquement au cas peu documenté des outils souples à usage unique. Il reste à ce stade un résultat de recherche publié en preprint, validé sur un seul robot (UR5e) et un jeu limité de neuf régimes en environnement contrôlé, sans indication de déploiement réel ni de partenariat industriel annoncé. Les prochaines étapes attendues pour ce type de travaux sont généralement une validation sur du matériel de prélèvement réel (écouvillons médicaux certifiés), un élargissement du nombre de surfaces et de conditions de rigidité testées, et une comparaison directe avec des approches concurrentes de force sensing sans capteur tactile embarqué, avant toute intégration dans un système commercial.

RecherchePaper
1 source
Apprentissage de tubes spatiotemporels pour toutes les tâches de logique temporelle de signal, pour le contrôle de systèmes inconnus sous contraintes d'entrée
1381arXiv cs.RO 

Apprentissage de tubes spatiotemporels pour toutes les tâches de logique temporelle de signal, pour le contrôle de systèmes inconnus sous contraintes d'entrée

Le 9 juillet 2026 (arXiv:2607.07136v1), une équipe de chercheurs a publié un nouveau cadre de contrôle basé sur les "spatiotemporal tubes" (STT) destiné aux systèmes non linéaires inconnus de type Euler-Lagrange, sous contraintes d'entrée, pour satisfaire des spécifications de logique temporelle de signal (STL). L'idée centrale : au lieu de calculer une trajectoire optimale classique, la méthode apprend un tube englobant variable dans le temps, modélisé comme une boule dont le centre et le rayon évoluent, dont le confinement de la trajectoire garantit automatiquement le respect de la tâche STL. Ce tube est paramétré conjointement par un réseau de neurones informé par la physique (PINN), entraîné en intégrant directement la métrique de robustesse de la spécification STL comme fonction de perte. Pour les scénarios multi-agents, une métrique de robustesse globale supplémentaire est ajoutée afin que les tubes individuels ne se chevauchent jamais, évitant ainsi les collisions. Une loi de contrôle en forme close est ensuite dérivée pour maintenir la trajectoire dans le tube tout en respectant les bornes du système. L'approche a été validée sur plusieurs études de cas simulées, pas sur du matériel réel. L'intérêt pratique tient au fait que la méthode ne suppose aucune connaissance du modèle dynamique du système, un point de friction majeur pour appliquer des spécifications formelles (STL) à des robots ou véhicules réels dont la dynamique exacte est rarement connue avec précision. En couplant apprentissage par PINN et garanties de robustesse formelle, le travail tente de combler l'écart entre contrôle par apprentissage, souvent sans garantie, et contrôle formel, souvent limité à des modèles simplifiés. La prise en compte explicite des contraintes d'entrée (actionneurs limités) rapproche aussi la méthode de cas d'usage industriels concrets, comme la coordination de flottes de robots mobiles ou de bras manipulateurs. Ce travail s'inscrit dans la lignée des recherches sur les tubes de contrôle (funnel control, control barrier functions) et sur l'usage croissant des PINN pour encoder des contraintes physiques dans l'apprentissage. Les prochaines étapes attendues concernent la validation sur des plateformes matérielles réelles et l'extension à des dynamiques plus complexes que le formalisme Euler-Lagrange.

RecherchePaper
1 source
ELEANOR, le bras architecturé souple inspiré de la trompe d'éléphant, continu et à grande échelle
1382arXiv cs.RO 

ELEANOR, le bras architecturé souple inspiré de la trompe d'éléphant, continu et à grande échelle

Des chercheurs ont publié sur arXiv, le 7 juillet 2026 (arXiv:2607.07622), une nouvelle conception de bras robotique souple baptisée ELEANOR, inspirée de la trompe de l'éléphant d'Afrique (Loxodonta africana). Contrairement aux robots continus précédents, construits de façon modulaire et à échelle réduite, l'équipe a privilégié la continuité structurelle pour reproduire les propriétés dynamiques macroscopiques de l'organe biologique plutôt que de viser des comportements prédéfinis. Le prototype, imprimé en 3D, mesure 85 cm de long, est effilé, souple et construit selon une architecture tessellée en volume. L'actionnement repose sur des tendons imitant les muscles longitudinaux et obliques de la trompe naturelle. Les chercheurs démontrent des capacités de préhension dite corps entier, c'est à dire une saisie d'objets mobilisant l'ensemble du bras plutôt que sa seule extrémité, sur des objets de formes et de dimensions variées, et comparent le comportement du système à celui de l'organe biologique. Cette approche s'attaque à un défi non résolu de la robotique souple: reproduire la dextérité de la trompe d'éléphant, manipulateur biologique jugé encore inégalé en robotique, malgré des années de recherche en continuum robotics. En misant sur la continuité structurelle plutôt que sur l'assemblage de modules, ELEANOR teste une hypothèse différente des travaux antérieurs, à savoir que les propriétés dynamiques globales du bras, plus que le contrôle fin de segments indépendants, sont ce qui permet des mouvements et une préhension proches de ceux de l'éléphant. Pour l'industrie, cela ouvre une piste de conception pour des bras souples capables de manipuler des objets encombrants ou de forme irrégulière sans préhenseur dédié, utile en logistique, en agriculture ou en intervention en milieu contraint, là où bras rigides et pinces classiques peinent. Le travail reste un démonstrateur académique: aucune donnée de charge utile ni de temps de cycle n'est communiquée, ce qui limite toute comparaison directe avec des bras industriels commerciaux. Le projet s'inscrit dans une lignée de recherche bio-inspirée active depuis plus d'une décennie, dominée jusqu'ici par des robots à continuum modulaires empilant plusieurs segments actionnés indépendamment. ELEANOR s'en démarque en visant un système unique et continu, pari qui, selon les auteurs, rapproche davantage le comportement du bras de celui de l'organe biologique réel. L'article relève de la recherche fondamentale en robotique souple plutôt que d'un produit commercial: aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné. Les auteurs annoncent vouloir approfondir la comparaison entre leur système et la trompe biologique, tant sur le plan de la biologie que de la robotique, ce qui suggère des travaux de caractérisation supplémentaires plutôt qu'une application industrielle immédiate.

RecherchePaper
1 source
Détection dynamique d'objets et suivi sur chantiers : un modèle de fusion caméra fisheye et LiDAR
1383arXiv cs.RO 

Détection dynamique d'objets et suivi sur chantiers : un modèle de fusion caméra fisheye et LiDAR

Des chercheurs présentent, dans une prépublication arXiv (2607.06896v1), une nouvelle méthode de fusion de capteurs pour détecter et suivre des objets mobiles sur les chantiers de construction. Le système équipe un robot quadrupède d'un LiDAR et d'une caméra fisheye orientée vers le haut, combinés en temps réel. Après avoir identifié les objets en mouvement dans un nuage de points recalé (registered point cloud) issu du LiDAR, la méthode projette leurs coordonnées 3D sur un panorama cylindrique 2D, ce qui permet de leur attribuer une étiquette sémantique en les recoupant avec les détections d'image en temps réel. Ces informations alimentent ensuite la mise à jour d'observation d'un filtre de Kalman, chargé du suivi proprement dit. Les auteurs revendiquent une précision élevée, une architecture simple et une robustesse particulière lorsque des objets basculent entre état statique et état dynamique, un cas généralement délicat à gérer. L'enjeu dépasse la seule prouesse technique : sur un chantier, un robot doit distinguer en permanence ce qui bouge (ouvriers, engins, matériaux déplacés) de ce qui reste fixe, sous peine de collisions ou de fausses alertes. La plupart des approches actuelles de vision 3D s'appuient sur des réseaux de neurones pré-entraînés et nécessitent un post-traitement lourd pour isoler les objets mobiles, ce qui pèse sur la latence et la fiabilité en environnement non structuré. En misant sur la fusion LiDAR/caméra plutôt que sur la seule vision par apprentissage profond, les auteurs proposent une alternative plus légère et potentiellement plus robuste pour les intégrateurs de robotique mobile en environnement industriel. Le travail s'inscrit dans la lignée des recherches en SLAM et grilles d'occupation pour la navigation robotique en environnement dynamique, domaine où les chantiers de BTP constituent un cas d'usage particulièrement exigeant en raison du désordre visuel et de la présence humaine constante. Aucun déploiement industriel n'est mentionné à ce stade : il s'agit d'une validation méthodologique en amont d'une éventuelle intégration sur des plateformes commerciales de robots quadrupèdes utilisés pour l'inspection de chantiers.

RecherchePaper
1 source
GeoGS-SLAM : Gaussian Splatting géométrique pur pour le SLAM monoculaire dense
1384arXiv cs.RO 

GeoGS-SLAM : Gaussian Splatting géométrique pur pour le SLAM monoculaire dense

Une équipe de chercheurs vient de publier sur arXiv (2607.07452v1) GeoGS-SLAM, un système de SLAM visuel dense monoculaire fondé sur une nouvelle représentation baptisée Geometry-only Gaussian Splatting (GeoGS). Contrairement aux méthodes 3D Gaussian Splatting classiques utilisées en SLAM, qui modélisent à la fois l'apparence et la géométrie de la scène, GeoGS ne conserve que les paramètres spatiaux de chaque primitive gaussienne, ce qui réduit de plus de 80% le nombre de paramètres par primitive. Le système s'appuie sur un entraînement combinant supervision géométrique et photométrique en vue unique et multi-vues, une initialisation guidée par plans locaux pour accélérer la convergence, et une stratégie de mise à jour de la carte lors des fermetures de boucle qui transforme globalement le nuage de gaussiennes pour éviter les déchirures de carte causées par des corrections de pose incohérentes. Les auteurs affirment que leur méthode dépasse l'état de l'art sur des bancs d'essai synthétiques et réels, tant en efficacité de cartographie en ligne qu'en qualité de reconstruction géométrique. L'intérêt de cette approche tient à un constat simple: pour des tâches robotiques comme la navigation ou l'évitement d'obstacles, c'est la précision géométrique qui compte, pas le rendu photoréaliste. En abandonnant la modélisation d'apparence, GeoGS allège drastiquement le nombre de primitives gaussiennes nécessaires, accélère la convergence géométrique et gagne en robustesse face aux variations d'éclairage, un point faible connu des pipelines 3DGS classiques en conditions réelles. Pour les intégrateurs travaillant sur la localisation et cartographie embarquées, cela ouvre la voie à des systèmes SLAM plus légers en calcul, potentiellement plus adaptés à un déploiement temps réel sur robot mobile. Le papier s'inscrit dans la vague de travaux exploitant le 3D Gaussian Splatting pour le SLAM dense depuis l'essor de cette représentation en 2023, une alternative aux cartes NeRF ou aux nuages de points classiques. Comme il s'agit d'un preprint tout juste déposé, sans revue par les pairs ni code public annoncé à ce stade, les gains revendiqués face à l'état de l'art restent à confirmer par la communauté, notamment sur des séquences réelles complexes en dehors des benchmarks utilisés par les auteurs.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue
1385arXiv cs.RO 

Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue

Une équipe de chercheurs publie sur arXiv (référence 2607.06706, mise en ligne le 7 juillet 2026) une revue de littérature consacrée aux modèles Vision-Language-Action (VLA), ces architectures qui unifient perception visuelle, compréhension du langage naturel et génération d'actions dans un seul modèle de fondation. L'objectif : permettre à un robot d'exécuter une instruction du type "plie la serviette" ou "vole vers le bâtiment rouge" directement à partir d'images caméra, sans étape de programmation intermédiaire. Le travail passe en revue 183 contributions publiées entre 2017 et 2026, organisées selon sept axes : les architectures VLA, les recettes d'entraînement, les représentations d'actions, la coordination bimanuelle (2022-2026), la navigation et le contrôle de drones (2017-2026), l'ancrage du langage dans la perception, et des enjeux transverses comme la mémoire et les modèles du monde. Les auteurs identifient au passage quatorze directions de recherche encore ouvertes dans ces deux domaines. L'intérêt de cette synthèse tient au rapprochement qu'elle opère entre deux champs jusqu'ici traités séparément. La manipulation bimanuelle, où deux bras à 7 degrés de liberté chacun doivent coordonner leurs mouvements pour plier, assembler ou réorienter un objet, sert de banc d'essai le plus exigeant pour les VLA appliqués à la manipulation. Or les auteurs montrent que les stratégies de coordination, les recettes d'entraînement et les représentations d'actions conçues pour ces bras robotiques se transfèrent directement aux drones, confrontés à un défi structurellement similaire : coordonner poussée, attitude et, de plus en plus, commandes de préhenseur à partir d'observations visuelles, sous des contraintes strictes de latence et de charge utile (payload). Pour les intégrateurs et décideurs du secteur robotique, cela suggère qu'un socle technique commun pourrait émerger entre robotique aérienne et manipulation au sol, plutôt que deux écosystèmes cloisonnés. Cette revue s'inscrit dans la montée en puissance des VLA comme cadre dominant de l'apprentissage robotique, portée par leur capacité à hériter des connaissances générales acquises lors d'un pré-entraînement à l'échelle d'Internet, un atout que les approches de contrôle classiques n'offrent pas. En couvrant neuf ans de littérature sur la manipulation bimanuelle et la navigation de drones dans un même cadre d'analyse, le travail offre une cartographie utile pour situer les futures publications et les futurs produits commerciaux dans ce paysage encore mouvant, sans toutefois lui-même annoncer de déploiement ou de système opérationnel nouveau.

RecherchePaper
1 source
Cadre d'apprentissage continu pour le contrôle adaptatif de robots souples modulaires
1386arXiv cs.RO 

Cadre d'apprentissage continu pour le contrôle adaptatif de robots souples modulaires

Une équipe de recherche propose un nouveau cadre de contrôle pour robots souples modulaires (Modular Soft Robots, MSR), basé sur les principes de l'apprentissage continu, selon un article publié sur arXiv le 7 juillet 2026 (arXiv:2607.06740v1). Les MSR sont des systèmes composés de plusieurs segments interconnectés, hautement déformables et reconfigurables, utilisés notamment en intervention médicale, en rééducation et en manipulation robotique. Le problème que résout ce travail est concret : jusqu'ici, changer la morphologie d'un MSR obligeait à réentraîner entièrement son contrôleur, faute de pouvoir réutiliser les connaissances acquises sur les configurations précédentes. Le framework proposé permet au contrôleur d'apprendre séquentiellement de nouvelles configurations sans oublier les précédentes, et peut aussi fonctionner de façon distribuée pour apprendre la dynamique propre de chaque module sur un robot à configuration fixe. La validation s'est faite en deux temps : des expériences de suivi de trajectoire en boucle fermée en simulation sur un robot souple actionné par tendons, puis un test sur un bras robotique souple pneumatique à trois modules, en conditions réelles. Pour l'industrie robotique, l'apport principal est méthodologique plutôt qu'un produit prêt à déployer : il s'attaque à un goulot d'étranglement bien identifié dans la robotique souple, à savoir la difficulté à faire évoluer la morphologie d'un robot sans tout reconstruire. Les MSR intéressent particulièrement les intégrateurs travaillant sur des tâches nécessitant une compliance mécanique élevée, comme la chirurgie mini-invasive ou la manipulation d'objets fragiles, où la rigidité des robots classiques est un handicap. Un contrôleur capable de s'adapter progressivement à des changements de structure, tout en activant sélectivement seulement les modules nécessaires pour atteindre une cible (ce qui réduit la charge de calcul), pourrait accélérer l'itération de conception sur ces plateformes reconfigurables, un axe encore peu mature comparé aux robots humanoïdes rigides à actionneurs classiques. Ce travail s'inscrit dans la lignée des recherches en robotique souple qui cherchent à dompter la nonlinéarité et la redondance hyper-élevée de ces systèmes, deux caractéristiques qui rendent les approches de contrôle classiques inadaptées. L'article ne mentionne pas de partenaire industriel ni de calendrier de commercialisation : il s'agit d'une contribution de recherche académique, à un stade de preuve de concept en laboratoire, dont l'étape suivante logique serait l'extension à des morphologies plus complexes ou à des tâches de manipulation réelles au-delà du suivi de trajectoire.

RecherchePaper
1 source
Agents peuvent exploiter, des motifs de représentation basiques aux motifs complexes
1387arXiv cs.RO 

Agents peuvent exploiter, des motifs de représentation basiques aux motifs complexes

Un article publié sur arXiv (référence 2607.07475v1, catégorie "new") propose une nouvelle représentation formelle des "affordances coopératives" en robotique sociale, c'est-à-dire les situations où plusieurs agents interagissent entre eux pour étendre leurs possibilités d'action individuelles. Les auteurs introduisent le concept d'"agent-exploitation", qui désigne la capacité d'un agent artificiel à mobiliser un autre agent comme ressource pour accomplir des actions que ni l'un ni l'autre ne pourrait réaliser seul. Le papier construit une représentation ontologique dite "tractable", c'est-à-dire exploitable de façon opérationnelle par un système artificiel, en partant de patterns élémentaires d'affordances coopératives. Ces briques de base sont ensuite combinées pour illustrer, à travers plusieurs scénarios, une diversité de situations multi-agents où la coopération élargit le champ d'action possible. L'enjeu pour la robotique sociale et multi-agents est de dépasser la seule modélisation des affordances fonctionnelles, c'est-à-dire la relation entre un agent et les objets ou outils qu'il peut manipuler, un champ déjà largement couvert par la représentation des connaissances. En intégrant la dimension sociale et la présence d'autres agents dans le modèle des possibilités d'action, ce travail ouvre la voie à des architectures de planification où un robot pourrait raisonner explicitement sur ce qu'un partenaire humain ou artificiel peut lui apporter, au-delà de ses propres capteurs et actionneurs. Pour les concepteurs de systèmes multi-robots ou d'interaction homme-robot, cela offre un cadre formel pour raisonner sur la délégation de tâches et la complémentarité des capacités plutôt que de coder ces comportements au cas par cas. Ce travail s'inscrit dans la continuité des recherches en knowledge representation appliquées à la robotique, où les affordances servent depuis longtemps à modéliser les interactions agent-objet. La nouveauté ici est de traiter formellement la dimension sociale, jusqu'ici peu explorée, en la reliant aux affordances déjà connues. Le papier reste à ce stade théorique et ontologique, sans démonstration sur robot physique ni validation expérimentale à grande échelle rapportée dans le résumé, ce qui en fait une contribution conceptuelle destinée à être reprise par des systèmes de planification ou de raisonnement multi-agents.

RecherchePaper
1 source
Usine de robots soudeurs : « Shengshi Weisheng » lève plusieurs centaines de millions de yuans en série B avec son modèle d'IA incarnée pour le soudage
138836Kr 

Usine de robots soudeurs : « Shengshi Weisheng » lève plusieurs centaines de millions de yuans en série B avec son modèle d'IA incarnée pour le soudage

La société chinoise 3Srobotics (昇视唯盛), spécialisée dans les robots industriels à intelligence incarnée pour le soudage, a bouclé un tour de série B de plusieurs centaines de millions de yuans (数亿元), mené par Shanghai Semiconductor Industry Investment et le Jinqiao Fund, avec la participation de Zero1 Ventures, Xinding Capital, Zhongguancun Dinghua et de son investisseur historique Weiguang Capital. Fondée en 2020, certifiée entreprise de haute technologie en 2023 puis reconnue entreprise pionnière "spécialisée, précise et innovante" et entreprise robotique de référence à Shanghai en 2024, la société en est à sa troisième génération de robots soudeurs. Son architecture repose sur un modèle "cerveau" multimodal entraîné sur des dizaines de millions de données de production réelles, couplé à un "cervelet" de contrôle moteur temps réel développé par sa filiale Harbin Institute of Technology Modern (哈工现代). Selon le fondateur Wang Dezhao, un robot 3Srobotics remplace en moyenne 1,5 à 2 soudeurs humains, avec un retour sur investissement de 1 à 1,5 an ; l'entreprise vise plusieurs centaines de millions de yuans de chiffre d'affaires en 2026. Le pari de 3Srobotics illustre une bascule stratégique du secteur robotique chinois : passer d'une automatisation générique, programmée à l'avance et incapable de s'adapter à des pièces non standard, vers des systèmes capables de percevoir en 3D, de raisonner sur une géométrie de soudure inconnue et d'ajuster en temps réel courant, tension et vitesse de déplacement, y compris sans plan technique fourni au préalable. C'est un signal pour les intégrateurs industriels et les décideurs B2B occidentaux : la Chine revendique une pénurie de plusieurs millions de soudeurs qualifiés d'ici 2025, sur un bassin d'environ dix millions de soudeurs enregistrés dont l'âge moyen dépasse 45 ans, et anticipe un marché du soudage intelligent dépassant les 100 milliards de yuans sur dix ans. Reste que les chiffres avancés, notamment ce ratio de remplacement de 1,5 à 2 soudeurs ou le gain d'efficacité de 2,88 fois annoncé pour son offre de "main-d'œuvre robotique" facturée au mètre soudé, proviennent uniquement de la société elle-même et méritent d'être vérifiés en conditions réelles indépendantes. L'entreprise, initialement positionnée sur la robotique industrielle généraliste, s'est recentrée sur le soudage en misant sur un modèle intégré combinant corps robotique, IA et procédé de soudage, avec une usine de fabrication propre garantissant une capacité de production et une chaîne d'approvisionnement maîtrisées, contrairement aux fournisseurs purement logiciels. Sa distribution passe majoritairement par des revendeurs et intégrateurs (les clients finaux directs ne pèsent que 10 à 20 % du chiffre d'affaires), sur des marchés comme la construction métallique, les ponts, le naval, le ferroviaire, les équipements électriques et, dans une moindre mesure, l'aérospatial et les nouvelles énergies. Les fonds levés serviront à faire évoluer les modèles "cerveau" et "cervelet", augmenter la capacité de son usine et étendre les équipes R&D et commerciales, avant une diversification annoncée vers le meulage, la découpe, l'assemblage et la manutention.

Chine/AsieActu
1 source
NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot
1389Robotics Business Review 

NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot

NVIDIA et Hugging Face annoncent l'intégration d'Isaac GR00T 1.7 et du framework Isaac TeleOp dans LeRobot, la bibliothèque open-source de robotique de Hugging Face. Isaac GR00T 1.7 est présenté comme le premier modèle de fondation robotique open-source et commercialement exploitable, une architecture vision-langage-action (VLA) permettant de post-entraîner et déployer des politiques de contrôle sur des robots humanoïdes réels. Isaac TeleOp est un framework de collecte de données par téléopération, qui capture des démonstrations humaines depuis des dispositifs externes dans des formats standardisés et interopérables, facilitant le partage de jeux de données au sein de la communauté. Les deux entreprises annoncent également l'arrivée prochaine de NVIDIA Cosmos 3, un modèle de monde frontière pour l'IA physique, sans donner de date précise. LeRobot compte déjà plus de 15 millions de téléchargements pour son jeu de données ouvert, qui regroupe plus de 350 000 trajectoires réelles et simulées ainsi que 57 millions de préhensions ("grasps"), en complément des frameworks de simulation Isaac Sim et Isaac Lab, dont Isaac Lab-Arena, désormais référencé dans le LeRobot Environment Hub. Cette annonce illustre la tentative de NVIDIA de reproduire, dans la robotique, la dynamique qui a fait le succès de l'IA générative open-source: mutualiser modèles, données et outils pour accélérer l'innovation collective plutôt que de la laisser fragmentée entre acteurs isolés. Pour les intégrateurs et développeurs robotique, l'enjeu concret est l'accès à un pipeline standardisé bout-en-bout, de la collecte de données jusqu'au déploiement, sans avoir à recomposer des briques propriétaires coûteuses. Le rapprochement entre les 3 millions de développeurs robotique de NVIDIA et les 16 millions d'utilisateurs IA de Hugging Face vise à fluidifier le passage entre recherche en IA générale et applications physiques. Toutefois, l'ampleur réelle de l'adoption d'Isaac GR00T 1.7 sur des déploiements industriels reste à démontrer: l'annonce reste pour l'instant centrée sur la disponibilité des outils et des frameworks, pas sur des cas d'usage chiffrés en production, et la mention de Cosmos 3 relève encore de la feuille de route plutôt que d'un produit livré. Ce partenariat s'inscrit dans la continuité de la stratégie NVIDIA autour de sa plateforme Isaac dédiée à la robotique et à l'IA physique, engagée depuis plusieurs années à travers Isaac Sim et Isaac Lab pour la simulation, puis étendue à des modèles de fondation comme GR00T. Hugging Face, de son côté, a positionné LeRobot comme l'équivalent robotique de ses bibliothèques Transformers pour le NLP, avec pour ambition de devenir le hub de référence pour les datasets et modèles robotiques ouverts. Sur le plan concurrentiel, cette annonce se situe face aux approches propriétaires de modèles VLA développés par d'autres laboratoires, à l'image de Pi-0 (Physical Intelligence) ou GR00T N2 concurrencés indirectement par des architectures fermées comme Helix (Figure AI). Thomas Wolf, cofondateur et directeur scientifique de Hugging Face, présente cette intégration comme une étape pour ancrer un cycle collaboratif ouvert dans la robotique, avec Cosmos 3 comme prochaine brique pour générer et simuler des données lorsque la collecte réelle est trop coûteuse ou limitée.

IA physiqueActu
1 source
Robot humanoïde industriel français : apprentissage accéléré grâce aux démonstrations humaines
1390Interesting Engineering 

Robot humanoïde industriel français : apprentissage accéléré grâce aux démonstrations humaines

La startup française UMA a dévoilé le design de son premier robot humanoïde alimenté par IA lors du Machina Summit à Paris. L'engin affiche des proportions à taille humaine, une visière neutre en guise de visage plutôt qu'un visage anthropomorphe, et des articulations mécaniques volontairement visibles. UMA vise en priorité les usines, les entrepôts et les centres logistiques, avec un usage domestique envisagé à terme, et fait de l'Europe son premier marché de déploiement. La société a présenté en parallèle son architecture "Real-Time Learning", un système d'IA qui permet au robot d'apprendre de nouvelles tâches par démonstration humaine plutôt que par programmation manuelle : il observe une tâche, s'entraîne, s'adapte aux conditions changeantes et améliore ses performances avec l'expérience. Aucune spécification technique détaillée (charge utile, degrés de liberté, temps de cycle) n'a été communiquée à ce stade. "Les robots humanoïdes mettront des années à atteindre un déploiement à grande échelle, tout comme Internet et les smartphones ont eu besoin de temps avant de transformer des industries entières", a déclaré Rémi Cadène, PDG et cofondateur d'UMA. L'annonce intervient peu après le dévoilement par l'américain Weave Robotics de son robot domestique Isaac 1, capable de ranger une pièce ou faire la lessive avec assistance humaine à distance. Pour les intégrateurs et décideurs industriels, ce pari sur l'apprentissage par démonstration illustre un basculement plus large du secteur : remplacer la programmation tâche par tâche par des modèles capables de généraliser, la même logique que poursuivent les architectures VLA (vision-language-action) de Physical Intelligence ou de NVIDIA. Si la promesse tient, elle réduirait le temps et le coût d'intégration d'un robot dans une chaîne existante, un frein majeur à l'adoption des humanoïdes en usine. Il faut toutefois noter qu'UMA n'a pour l'instant montré qu'un design et un concept d'architecture, sans vidéo de démonstration ni métrique de performance vérifiable : il s'agit d'une annonce de positionnement, pas d'un produit livré ni d'un déploiement réel. Le choix explicite d'une visière neutre plutôt qu'un visage humain, et l'exposition volontaire des articulations, traduit une volonté de se démarquer des démonstrations spectaculaires façon Tesla Optimus ou Figure, au profit d'un discours centré sur la fiabilité industrielle de long terme plutôt que sur l'effet de démonstration publique. UMA a été cofondée par Rémi Cadène, connu pour avoir dirigé le projet LeRobot chez Hugging Face, une bibliothèque open-source d'apprentissage par imitation qui a contribué à démocratiser l'entraînement de robots par démonstration, un héritage direct dans l'architecture Real-Time Learning présentée aujourd'hui. La startup entre sur un marché déjà occupé par les géants américains (Tesla avec Optimus, Figure et son modèle Helix, Physical Intelligence avec Pi-0) et chinois (Unitree, UBTech), ainsi que par des humanoïdes grand public comme Isaac 1 de Weave Robotics. Face à cette concurrence, UMA mise sur l'écosystème industriel et de recherche européen ainsi que sur la pénurie de main-d'œuvre du continent pour justifier son positionnement. Aucun calendrier précis de commercialisation ni de pilotes clients n'a été communiqué au-delà de cette présentation du design, ce qui laisse ouverte la question du délai entre ce concept et un déploiement industriel effectif.

FR/EU ecosystemeOpinion
1 source
500 kg de robot qui tracte un camion de l'armée US de 24 tonnes grâce à une propulsion intégrée aux roues
1391Interesting Engineering 

500 kg de robot qui tracte un camion de l'armée US de 24 tonnes grâce à une propulsion intégrée aux roues

La société américaine de défense AZAK a présenté une démonstration où un robot terrestre sans pilote (UGV) de 227 kg parvient à remorquer un camion militaire de 24 040 kg, tout en transportant simultanément 453 kg de munitions à bord. Le véhicule cible est le Palletized Load System (PLS) construit par Oshkosh, le camion logistique de référence de l'armée américaine depuis 1993 : 11 mètres de long, 39 000 kg à vide, équipage de deux personnes, et une capacité de charge utile de près de 15 000 kg grâce à un bras hydraulique intégré qui permet de charger et décharger des palettes standardisées sans recourir à des chariots élévateurs. Selon AZAK, le petit robot a donc déplacé une charge totale dépassant cent fois son propre poids. La démonstration, relayée par l'entreprise sur LinkedIn, repose sur une architecture de propulsion embarquée dans chaque roue : le module "S26" pèse 86 livres (39 kg), loge moteur, batterie, boîte de vitesses, freins et électronique de contrôle dans un diamètre de 66 cm, avec un centre de gravité abaissé grâce au positionnement bas des composants. Chaque roue développe environ 147 livres-pied de couple, soit 588 livres-pied cumulés pour la configuration standard à quatre roues. Cette démonstration, si elle reste un test filmé et communiqué par l'entreprise elle-même plutôt qu'un essai indépendant validé par l'Army, illustre une piste concrète pour la logistique militaire automatisée : remplacer des équipages et des véhicules de dépannage lourds par des modules légers, interchangeables et déployables en quelques secondes. Le système de fixation sans outil, par loquets à connexion rapide, permet en théorie de transformer n'importe quel châssis, plateforme de fret ou même une pièce de bois improvisée en véhicule télécommandé pour acheminer du ravitaillement ou évacuer des blessés. Pour les intégrateurs et décideurs de la défense, l'intérêt tient moins à la performance brute affichée qu'à la modularité : en configuration de base, la plateforme à quatre roues supporte une charge utile de 680 kg ; si la traction ne suffit pas pour dégager un véhicule embourbé, il suffit d'ajouter deux ou quatre roues supplémentaires pour augmenter couple et traction. AZAK positionne ce concept de roue autonome comme une alternative aux architectures classiques à moteur central, transmission et arbres de transmission, misant sur la scalabilité modulaire plutôt que sur la puissance brute d'un véhicule unique. Le PLS visé dans la démonstration constitue depuis plus de trente ans l'épine dorsale de la logistique avancée de l'armée américaine, ce qui explique l'intérêt porté à toute solution capable de le dépanner sur le terrain sans matériel lourd supplémentaire. Aucune date de déploiement opérationnel ni contrat avec l'Army n'a pour l'instant été communiqué : il s'agit à ce stade d'une démonstration technologique destinée à valider le concept, pas d'un système livré ou testé en conditions réelles de combat.

IndustrielActu
1 source
Course à l'IA physique : l'Europe peut-elle rivaliser avec la Chine et les États-Unis en robotique humanoïde ?
1392SCMP Tech 

Course à l'IA physique : l'Europe peut-elle rivaliser avec la Chine et les États-Unis en robotique humanoïde ?

The article text you pasted cuts off mid-sentence after "said David Kehr, president...", I only have the headline and the opening lines, not the actual facts (numbers, deployment sites, competitor positioning, etc.) needed to write the 3-paragraph piece per your brief. Can you paste the full article text? I don't want to fabricate the concrete details (payload, DOF, cycle times, dates, company names) the brief specifically calls for, that would go against the "decoder, pas relayer" posture and the accuracy requirement.

FR/EU ecosystemeOpinion
1 source
La décontamination nucléaire au Royaume-Uni pourrait être confiée à des robots téléopérés
1393Interesting Engineering 

La décontamination nucléaire au Royaume-Uni pourrait être confiée à des robots téléopérés

Le site de démantèlement nucléaire d'Oldbury, dans le South Gloucestershire au Royaume-Uni, teste actuellement deux technologies robotiques distinctes pour la gestion des déchets radioactifs hérités. Le premier projet, mené par Nuclear Restoration Services (NRS) via le programme Robotics and Artificial Intelligence Collaboration (RAICo), évalue des bras robotiques téléopérés pour la récupération à distance des débris d'éléments combustibles (FED), ces matériaux qui contenaient autrefois le combustible nucléaire avant son transfert vers Sellafield pour retraitement. Le système intègre de la visualisation 3D et un retour haptique, permettant aux opérateurs de manipuler les débris par mouvements naturels de la main tout en ressentant un retour de force reproduisant le toucher. Le second projet, baptisé Auto-SAS, vise à automatiser l'identification, la catégorisation et la séparation des déchets radioactifs mixtes. Financé à hauteur de 9,5 millions de livres sterling sur quatre ans par la Nuclear Decommissioning Authority (NDA), il repose sur une technologie de capteurs et de scan 3D développée par l'entreprise ARCTEC. Les essais de mise en service sur site sont prévus pour mi-2027. Ces deux initiatives répondent à un problème opérationnel concret du secteur nucléaire: aujourd'hui, la manipulation des FED exige des opérateurs équipés d'équipements de protection complets, maniant de longues pinces mécaniques derrière des écrans de radioprotection épais, une tâche lente et physiquement contraignante. En automatisant une partie du tri des déchets, NRS affirme viser une réduction du volume de matériaux orientés vers des filières d'élimination coûteuses, avec une économie potentielle chiffrée en centaines de millions de livres sterling sur la durée de vie du programme pour le groupe NDA. Au-delà du strict cadre du démantèlement, la robotique de tri développée ici pourrait s'exporter vers d'autres secteurs industriels confrontés à des flux de déchets complexes ou dangereux à séparer manuellement. Il faut toutefois noter que ces chiffres d'économies restent des projections communiquées par l'exploitant, sans détail méthodologique public à ce stade. Ce virage s'inscrit dans une tendance plus large d'adoption de la robotique dans l'industrie nucléaire britannique, où la maintenance d'infrastructures vieillissantes representait jusqu'ici un goulet d'étranglement en main-d'œuvre qualifiée et en sécurité. Le groupe canadien AtkinsRéalis a par ailleurs récemment noué un partenariat avec l'Oxford Robotics Institute pour développer des robots autonomes et de l'IA physique dédiés aux environnements nucléaires dangereux, signe d'un intérêt croissant du secteur pour l'autonomie robotique. Varun Kumar, ingénieur robotique chez RAICo, a déclaré que ces projets devraient permettre à des opérateurs d'effectuer des tâches de tri qualifiées à distance en toute sécurité, et potentiellement d'ouvrir ces postes à des personnes ne pouvant pas travailler dans des environnements confinés.

IndustrielActu
1 source
ABB Robotics complète sa gamme de robots mobiles autonomes à SLAM visuel avec le lancement d'un chariot élévateur autonome
1394Robotics & Automation News 

ABB Robotics complète sa gamme de robots mobiles autonomes à SLAM visuel avec le lancement d'un chariot élévateur autonome

ABB Robotics complète son offre de robots mobiles autonomes (AMR) avec le lancement du Flexley Stack F712, un chariot élévateur autonome basé sur la technologie Visual SLAM (cartographie et localisation simultanées par vision). Avec ce nouveau modèle, l'entreprise suisso-suédoise couvre désormais l'ensemble des catégories majeures d'AMR à navigation visuelle : chariots élévateurs, tracteurs de remorquage (tugs) et convoyeurs mobiles (movers), tous interopérables sur une même plateforme logicielle. L'objectif affiché est de permettre aux clients industriels d'automatiser un spectre plus large de tâches de manutention et de logistique interne, du transport de palettes au déplacement de charges légères, sans multiplier les systèmes de gestion de flotte incompatibles entre eux. Pour les intégrateurs et décideurs industriels, cette annonce marque une étape dans la consolidation du marché des AMR, où l'enjeu central n'est plus seulement la performance individuelle d'un robot mais l'interopérabilité d'une flotte hétérogène pilotée par une seule couche logicielle. En complétant sa gamme plutôt qu'en lançant un produit isolé, ABB répond à une demande récurrente des entrepôts et usines : pouvoir mélanger différents types de robots (levage, traction, transport) sans dépendre de plusieurs fournisseurs ni de plusieurs interfaces de supervision. Le communiqué reste toutefois avare de données chiffrées vérifiables sur les performances du F712 (capacité de charge, autonomie, temps de cycle), ce qui invite à la prudence tant que des retours d'intégrateurs indépendants ne sont pas disponibles. ABB Robotics, acteur historique de la robotique industrielle, investit depuis plusieurs années le segment des AMR pour répondre à la concurrence de spécialistes comme Locus Robotics, Geek+ ou MiR (également détenu par Teradyne comme d'autres poids lourds du secteur). La stratégie de plateforme unifiée s'inscrit dans une tendance de fond de l'intralogistique, où les entrepôts cherchent à réduire la complexité opérationnelle en standardisant leurs flottes robotiques. Aucun calendrier de déploiement client précis n'a été communiqué à ce stade pour le Flexley Stack F712, et il faudra suivre les premiers retours d'implantation en conditions réelles pour évaluer si l'ambition d'interopérabilité totale tient ses promesses face aux contraintes concrètes des sites industriels.

IndustrielActu
1 source
EgoVerse : un ensemble de données humaines égocentriques pour l'apprentissage des robots, venu du monde entier
1395arXiv cs.RO 

EgoVerse : un ensemble de données humaines égocentriques pour l'apprentissage des robots, venu du monde entier

Une équipe de chercheurs vient de publier une nouvelle version de son article sur arXiv (2604.07607v2) présentant EgoVerse, une plateforme collaborative de données humaines égocentriques destinée à l'apprentissage robotique. La version actuelle du jeu de données regroupe 1 362 heures d'enregistrements, soit environ 80 000 épisodes de démonstrations humaines, couvrant 1 965 tâches différentes réalisées dans 240 environnements distincts par 2 087 démonstrateurs uniques. Les données sont standardisées avec des annotations pertinentes pour la manipulation et des outils dédiés à l'entraînement de modèles en aval. Le projet est conçu pour recevoir des contributions aussi bien de chercheurs individuels que de laboratoires académiques et d'acteurs industriels, dans un cadre commun de collecte et de traitement. Ce travail répond à un problème concret du secteur robotique : la collecte de données réelles sur robot reste coûteuse et difficile à faire passer à l'échelle, tandis que les données humaines égocentriques offrent une alternative bien moins onéreuse pour capturer des comportements de manipulation dans des environnements du quotidien. Les auteurs ont mené une étude à grande échelle sur le transfert humain-vers-robot, avec des expériences répliquées dans plusieurs laboratoires, sur différentes tâches et différentes plateformes robotiques, selon des protocoles partagés. Résultat notable : la performance des politiques s'améliore globalement avec davantage de données humaines, mais ce passage à l'échelle n'est efficace que si ces données sont alignées avec les objectifs d'apprentissage du robot ciblé, un nuance importante pour les équipes qui espèrent simplement empiler du volume de données sans questionner leur pertinence. Le problème que EgoVerse cherche à résoudre est la fragmentation des jeux de données humains existants, souvent limités en portée et difficiles à étendre au-delà de l'institution qui les a produits. En unifiant collecte, traitement et accès sous un même cadre partagé, la plateforme se positionne comme une infrastructure de recherche reproductible plutôt qu'un simple jeu de données figé, avec vocation à s'enrichir au fil des contributions externes. Les vidéos et informations complémentaires sont disponibles sur egoverse.ai.

RecherchePaper
1 source
Q-Learning par transport optimal pour le pilotage et l'accélération de politiques de flux
1396arXiv cs.RO 

Q-Learning par transport optimal pour le pilotage et l'accélération de politiques de flux

Des chercheurs proposent une nouvelle méthode baptisée Optimal Transport Q-Learning (OTQL), destinée à affiner et accélérer les politiques robotiques basées sur des modèles de diffusion et de flow matching, très utilisées dans les modèles vision-langage-action (VLA). Publiée le 8 juillet sur arXiv, l'étude combine apprentissage par renforcement (RL) post-entraînement et transport optimal conditionné par l'avantage, pour corriger les comportements sous-optimaux de ces politiques sans recourir à la distillation, coûteuse en calcul. Avec un budget d'interaction limité à seulement 50 à 60 épisodes, la méthode fait grimper le taux de succès moyen de politiques mono-tâche de 36 % à 86 %, et celui d'un modèle VLA pré-entraîné de 38 % à 76 %, tout en réduisant de 70 % le nombre d'étapes d'inférence nécessaires pour générer une action. Les tests ont été menés à la fois en simulation et sur des tâches robotiques réelles. Ces résultats s'attaquent à deux limites bien connues des politiques de diffusion et de flow matching pour la robotique: leur dépendance à des démonstrations de haute qualité, souvent rares ou coûteuses à collecter, et leur lenteur d'inférence, qui freine leur déploiement temps réel sur des robots physiques. En démontrant qu'un nombre restreint d'épisodes d'expérience réelle suffit à corriger significativement les échecs sous décalage de distribution, OTQL apporte un début de réponse à l'écart persistant entre démonstrations en laboratoire et performance en conditions réelles, un problème central pour les intégrateurs qui cherchent à fiabiliser des modèles VLA du type de ceux utilisés dans les bras manipulateurs ou les humanoïdes actuels. La réduction de 70 % des étapes d'inférence est également notable pour les décideurs B2B, car elle touche directement au coût de calcul embarqué et à la latence, deux freins concrets à la commercialisation à grande échelle de politiques génératives sur robot. Les politiques de diffusion et de flow matching se sont imposées ces dernières années comme l'approche dominante pour capturer des distributions de trajectoires multimodales dans les tâches de manipulation robotique, notamment dans les architectures VLA. Mais leur adoption industrielle butait jusqu'ici sur deux verrous: l'accélération de l'inférence, généralement traitée par des méthodes de distillation gourmandes en ressources de simulation, et l'amélioration post-déploiement, qui nécessite habituellement de nouvelles données de démonstration coûteuses à produire. OTQL s'inscrit dans une lignée de travaux cherchant à exploiter le RL pour du post-entraînement léger plutôt que du réentraînement complet. Les auteurs ne précisent pas encore de calendrier de transfert vers des plateformes commerciales, mais la méthode ouvre une piste pour que les opérateurs de flottes robotiques affinent leurs politiques directement à partir de l'expérience de terrain, sans dépendre de nouveaux cycles de collecte de données coûteux.

RechercheActu
1 source
EAGOR : raisonnement incarné omnidirectionnel
1397arXiv cs.RO 

EAGOR : raisonnement incarné omnidirectionnel

Des chercheurs présentent EAGOR, un framework de raisonnement directionnel pour agents dotés de caméras omnidirectionnelles à 360 degrés, conçu pour les tâches de navigation et de recherche d'objets sans carte préalable. Contrairement aux modèles vision-langage (VLM) existants qui projettent les images à 360 degrés en projection équirectangulaire (ERP) et les traitent avec des architectures pensées pour des images classiques, EAGOR traite directement la géométrie sphérique de l'observation via une estimation bayésienne récursive sur la sphère, sans réentraîner le modèle VLM sous-jacent. Sa brique centrale, le Spherical Harmonic Belief Field (SH-BF), maintient une croyance continue sur la direction cible et la propage de façon cohérente lors des déplacements du robot. Évalué sur les benchmarks HOS et OSR-Bench ainsi que sur un robot à pattes en conditions réelles, EAGOR affiche des gains relatifs moyens de 34,4% et 45,6% sur ces deux jeux de données, une amélioration de 14,6% du taux de réussite en navigation, une réduction de 17,7% du nombre de pas nécessaires et une baisse de 24,5% de l'erreur angulaire moyenne. L'enjeu dépasse la simple performance sur benchmark : les VLM actuels perdent en cohérence directionnelle dès que l'agent bouge, car la projection ERP introduit des distorsions de latitude et des discontinuités aux coutures de l'image, ce qui rend peu fiable toute estimation de cap dans un contexte de navigation autonome sans carte. En traitant nativement la sphère plutôt que sa projection 2D, EAGOR répond directement à ce problème d'écart entre démonstration et fiabilité opérationnelle, un point sensible pour les intégrateurs qui cherchent à déployer des agents mobiles ou des robots à pattes capables de s'orienter de manière robuste dans des environnements changeants, sans dépendre d'une cartographie préalable coûteuse à maintenir. Cette approche s'inscrit dans la lignée des travaux cherchant à exploiter la vision omnidirectionnelle pour des tâches embarquées, un domaine où les architectures perspective restent dominantes par simple héritage des VLM génériques. En étant training-free, EAGOR peut potentiellement se greffer sur des piles de navigation existantes sans coût de réentraînement, et les tests menés sur un robot à pattes en conditions réelles, au-delà des seuls benchmarks synthétiques, suggèrent une voie vers une adoption plus rapide dans des systèmes de navigation autonome déployés en environnement réel.

RecherchePaper
1 source
RynnWorld-Teleop : un modèle du monde conditionné par l'action pour la téléopération numérique
1398arXiv cs.RO 

RynnWorld-Teleop : un modèle du monde conditionné par l'action pour la téléopération numérique

Des chercheurs viennent de publier RynnWorld-Teleop (arXiv:2607.06558v1), un système de "téléopération numérique" qui remplace le robot physique par un modèle du monde génératif. Le principe : un flux de poses de main capturé chez l'opérateur pilote un modèle génératif centré-robot qui synthétise, à partir d'une seule image de référence, une vidéo égocentrique haute fidélité simulant ce que verrait le robot en exécutant le geste. Ce flux de poses sert d'étiquette d'action indépendante de l'embodiment, transférable à n'importe quel robot cible via un retargeting standard, ce qui produit des trajectoires état-action complètes sans jamais toucher de matériel réel. Techniquement, le pipeline combine un conditionnement squelettique sensible à la profondeur, un entraînement progressif humain-vers-robot sur un Diffusion Transformer vidéo, et une distillation autorégressive en streaming qui compresse le processus génératif en une seule passe d'inférence, atteignant plus de 40 images par seconde en génération interactive temps réel sur un seul GPU H100. L'enjeu dépasse la prouesse technique : la collecte de données robotiques massives et diversifiées est aujourd'hui bridée par la téléopération physique, où chaque démonstration immobilise du temps opérateur sur un matériel et un espace de travail précis. En découplant la collecte des contraintes physiques, RynnWorld-Teleop promet de faire chuter drastiquement le coût par trajectoire. Les auteurs rapportent que des politiques entraînées exclusivement sur des données générées par leur système atteignent un transfert Sim2Real en zero-shot sur des tâches bimanuelles dextres et variées, et que l'ajout de ces données synthétiques à des jeux réels améliore systématiquement les taux de réussite, un signal fort pour ceux qui cherchent à faire passer les architectures VLA à l'échelle sans exploser les budgets de collecte terrain. Ce travail s'inscrit dans une tendance plus large de modèles du monde génératifs utilisés comme moteurs de données pour l'apprentissage par imitation, en écho à des approches comme les VLA à grande échelle (Pi-0, GR00T). Il s'agit pour l'instant d'une publication de recherche, sans déploiement industriel ni partenariat annoncé, et la prochaine étape naturelle serait une validation sur des plateformes robotiques commerciales tierces.

RecherchePaper
1 source
D'observateur passif à critique actif : l'apprentissage par renforcement révèle un raisonnement de processus pour la manipulation robotique
1399arXiv cs.RO 

D'observateur passif à critique actif : l'apprentissage par renforcement révèle un raisonnement de processus pour la manipulation robotique

Une équipe de recherche propose PRIMO R1 (Process Reasoning Induced Monitoring), un framework de 7 milliards de paramètres qui transforme les modèles vidéo multimodaux (MLLM) en "critiques" actifs capables d'évaluer la progression d'une tâche de manipulation robotique, plutôt qu'en simples "observateurs" qui se contentent de reconnaître les actions en cours. La méthode s'appuie sur de l'apprentissage par renforcement basé sur le résultat final pour inciter le modèle à générer un raisonnement explicite en chaîne de pensée (chain-of-thought) lors de l'estimation de la progression. L'architecture ancre la séquence vidéo entre une image de l'état initial et une image de l'état courant, une construction temporelle structurée soutenue par un nouveau jeu de données et benchmark, le PRIMO Dataset. Les résultats annoncés sont significatifs : une réduction de 50% de l'erreur absolue moyenne par rapport aux meilleures références spécialisées, des gains face à des MLLM généralistes de 72 milliards de paramètres malgré une taille dix fois inférieure, et 67,0% de précision sur le benchmark RoboFail, dépassant le modèle o1 d'OpenAI de 6 points. Cette avancée cible un vrai point de friction du secteur : pour les tâches de manipulation longues, les robots doivent non seulement reconnaître ce qu'ils font, mais estimer où ils en sont par rapport à l'objectif final, une capacité clé pour la détection autonome d'échecs sans supervision humaine. Qu'un modèle de 7B batte des systèmes bien plus lourds, y compris o1, sur ce type de raisonnement suggère que le renforcement orienté résultat peut compenser la taille, un argument important pour un déploiement embarqué sur des robots humanoïdes où latence et coût de calcul comptent. Le travail s'inscrit dans la vague de modèles de raisonnement entraînés par RL appliquée spécifiquement à la robotique, avec des tests validés aussi bien en environnements simulés qu'en scénarios réels sur humanoïdes. Il s'agit à ce stade d'une publication de recherche (preprint arXiv, version révisée) accompagnée d'un dataset et d'un benchmark ouverts, pas d'un produit déployé, mais elle pose une référence explicite face aux modèles généralistes et aux systèmes propriétaires comme o1 sur la détection d'échec robotique.

RecherchePaper
1 source
SIEVE : sélection de données tenant compte de la structure pour l'apprentissage par imitation avec des modèles VLA
1400arXiv cs.RO 

SIEVE : sélection de données tenant compte de la structure pour l'apprentissage par imitation avec des modèles VLA

Des chercheurs proposent SIEVE, une méthode de sélection de données pour l'apprentissage par imitation des modèles Vision-Language-Action (VLA), publiée sur arXiv en juillet 2026. Contrairement aux approches existantes qui évaluent les démonstrations au niveau de la trajectoire complète ou de la paire état-action, SIEVE découpe les démonstrations en primitives visuo-motrices réutilisables et en interfaces de transition entre ces primitives. La méthode alloue ensuite un budget de sélection aux motifs de composition en maximisant l'exposition structurelle sous rendement décroissant, puis retient dans chaque groupe les trajectoires médianes, jugées les plus centrales, stables et propices à l'imitation. Testée sur plusieurs jeux de données, bancs d'essai et modèles VLA, SIEVE dépasse systématiquement les méthodes de sélection concurrentes. Résultat le plus marquant : la méthode surpasse un entraînement sur l'intégralité des données tout en n'utilisant que 50% des démonstrations et 50% des étapes d'entraînement. Pour les équipes qui entraînent des modèles VLA de type Pi-0, GR00T N2 ou Helix, ce travail s'attaque à un goulot d'étranglement concret : la collecte de démonstrations robotiques coûte cher, en téléopération humaine comme en génération synthétique, et empiler toujours plus de données ne garantit pas de meilleures politiques en raison de la redondance et du bruit. En démontrant qu'un entraînement sur moitié moins de données peut surpasser l'usage du jeu complet, SIEVE remet en question l'hypothèse du « plus de données égale de meilleures performances » dans l'apprentissage par imitation, et ouvre une piste d'optimisation des coûts pour les laboratoires et startups qui n'ont pas les ressources de calcul des géants du secteur. C'est un signal direct pour les décideurs B2B qui doivent arbitrer entre volume de collecte et qualité de curation avant de déployer des politiques VLA en production. L'apprentissage par imitation sur de larges jeux de démonstrations est devenu le paradigme dominant pour entraîner les modèles VLA, dans la lignée de travaux comme RT-2, OpenVLA ou les politiques génératives de Physical Intelligence et NVIDIA. La curation des données reste toutefois un problème ouvert : les méthodes précédentes se limitaient à des critères de diversité ou de qualité au niveau de la trajectoire entière, sans capturer les structures réutilisables qui composent les comportements à long horizon, comme saisir puis orienter un objet avant de le placer. SIEVE s'inscrit dans cette lignée de recherche sur l'efficacité des données et ouvre la voie à des travaux futurs sur la généralisation de cette approche structurelle à d'autres familles de modèles VLA et à des tâches de manipulation plus complexes.

RecherchePaper
1 source