Aller au contenu principal

Dossier arXiv cs.RO — page 8

2609 articles · page 8 sur 53

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

351arXiv cs.RO RecherchePaper

Robo-ValueRL : une estimation fiable de la valeur pour l'apprentissage par renforcement hors ligne vers en ligne

Des chercheurs publient Robo-ValueRL, un framework d'apprentissage par renforcement offline-to-online pour la manipulation robotique, décrit dans un article arXiv (2607.09866v1) diffusé cette semaine. Le système entraîne un estimateur de valeur conditionné par l'historique des actions, dont la fiabilité est mesurée via deux métriques, la progression globale et la préférence locale. Ces estimations de valeur alimentent ensuite deux étapes : un pré-entraînement de politique par cohérence conditionnée à la qualité des données, puis un module d'adaptation résiduelle appliqué lors des déploiements en ligne. Les expériences s'appuient sur un volume conséquent, 240 heures de démonstrations hors ligne et plus de 3 000 trajectoires de rollout en ligne. Sur deux tâches de précision, l'insertion de puces électroniques au millimètre près et le désassemblage générique de blocs, le système atteint respectivement 86% et 84% de taux de réussite. L'apport principal ne se situe pas dans un nouveau record de performance mais dans la démonstration d'un lien direct entre la fiabilité de la fonction de valeur et la qualité de la politique finale. Concrètement, un estimateur de valeur fiable permet de prioriser les données de meilleure qualité parmi un ensemble hétérogène de démonstrations, ce qui bat le clonage comportemental classique, indifférent à la qualité des données, et stabilise la phase d'amélioration en ligne. Pour les équipes qui construisent des pipelines de RL robotique à partir de données de téléopération ou de simulation de qualité inégale, ce résultat justifie d'investir dans le diagnostic de la fonction de valeur plutôt que de simplement augmenter le volume de données ou la taille des modèles de politique. Le travail s'inscrit dans la tendance actuelle du secteur à combiner pré-entraînement hors ligne sur de larges jeux de démonstrations et affinage en ligne par rollouts réels, une approche jugée prometteuse pour la manipulation robotique généralisable mais dont la complexité technique rend la reproduction et le diagnostic difficiles, un point que les auteurs soulignent explicitement comme motivation de leur étude. Robo-ValueRL se positionne comme un banc d'essai unifié plutôt qu'un produit fini, destiné à isoler l'effet de la fiabilité de l'estimation de valeur des autres composants du pipeline. L'article ne précise pas de suite industrielle ni de partenaire de déploiement identifié à ce stade, le travail restant à un niveau de recherche académique.

1 source
352arXiv cs.RO 

Navigation dans la foule : commande prédictive non linéaire avec dynamique des forces sociales pour la navigation robotique tenant compte des humains

Une équipe de chercheurs publie sur arXiv (arXiv:2607.10374v1, dépôt du 14 juillet 2026) un nouveau cadre de contrôle baptisé SFM-NMPC, pour Social Force Model based Non-linear Model Predictive Control. L'idée consiste à intégrer directement le Social Force Model, un modèle physique classique de la dynamique des foules, dans la boucle d'optimisation d'un contrôleur prédictif non linéaire (NMPC) pilotant la navigation d'un robot mobile. Concrètement, le contrôleur prédit simultanément les trajectoires futures des humains environnants et celle du robot sur tout l'horizon de prédiction, et s'appuie sur un ensemble de fonctions de coût sociales dédiées pour orienter la planification vers des comportements jugés conformes aux normes sociales, au-delà du simple évitement de collision. Malgré la complexité accrue du modèle, les auteurs annoncent un fonctionnement temps réel à 20 Hz, validé par des tests simulés extensifs en environnements encombrés, ainsi qu'une étude d'ablation isolant la contribution de la dynamique SFM et des termes de coût social. Pour l'industrie de la robotique mobile et les intégrateurs de robots destinés à des environnements partagés avec des humains, entrepôts, hôpitaux, espaces commerciaux, ce travail s'attaque à un point de friction connu: les méthodes classiques d'évitement d'obstacles traitent les piétons comme des obstacles dynamiques sans anticiper leur comportement, ce qui produit une navigation perçue comme intrusive ou erratique. En démontrant qu'un modèle de prédiction humaine sophistiqué peut être embarqué dans la boucle de contrôle sans casser la contrainte temps réel, l'étude apporte un argument concret contre l'hypothèse selon laquelle précision sociale et efficacité computationnelle seraient nécessairement antagonistes en MPC. Reste que les résultats, à ce stade, ne reposent que sur de la simulation: la validation sur robot physique en environnement humain réel, avec ses incertitudes de perception et de suivi de trajectoire, constitue l'étape suivante indispensable avant toute conclusion sur l'applicabilité terrain. Le Model Predictive Control s'est imposé ces dernières années comme alternative robuste aux approches classiques de planification et aux méthodes purement data-driven pour la navigation robotique, mais sa performance dépend étroitement de la qualité des modèles de prédiction humaine qu'il embarque. Le Social Force Model, formalisé dans les années 1990 pour modéliser les dynamiques de foule, offre une base physique interprétable que plusieurs travaux récents cherchent à coupler à des contrôleurs optimaux. SFM-NMPC s'inscrit dans cette lignée et se compare à des méthodes de référence de l'état de l'art sur des métriques de conformité sociale, sans toutefois se positionner face à des acteurs industriels ou des systèmes commerciaux déployés, le travail restant à ce stade de nature académique et exploratoire.

RecherchePaper
1 source
353arXiv cs.RO 

Robotique fiable en ROS 2 : correction des échecs d'outillage dans iG-LIO pour l'odométrie LiDAR-inertielle GICP incrémentale

Un rapport technique publié sur arXiv (2607.09947v1) documente un portage ROS 2 Jazzy d'iG-LIO, système d'odométrie LiDAR-inertielle à couplage fort combinant generalized-ICP et contraintes point-to-plane dans un filtre de Kalman à état d'erreur itéré, appliqué sur une carte voxel incrémentale. L'équipe, rattachée au laboratoire Forestry Robotics de l'Université de Coimbra (Portugal), a migré l'implémentation originale ROS 1 sans toucher aux mathématiques d'estimation, mais le code, bien que compilant et s'exécutant normalement, divergeait avec des valeurs internes NaN. Le diagnostic a identifié deux causes purement liées à la chaîne d'outils ROS 2 : une incompatibilité de Quality-of-Service qui supprime et réordonne silencieusement les échantillons IMU, et un accumulateur de réduction parallèle non initialisé provenant de la combinaison oneTBB et Eigen livrée avec les distributions ROS 2 récentes. L'équipe a aussi corrigé le parsing des champs de points Ouster pour les nouvelles révisions de capteurs, ajouté le support du Velodyne Velarray M1600, proposé une voie Livox CustomMsg ainsi qu'un chemin sans pilote dédié pour les capteurs Livox publiant du PointCloud2 standard comme le Mid-360, et exposé la configuration via YAML. La validation a été menée sur un Ouster OS0 Rev7, un OS1 Rev7 et un Livox MID-360. Le code est disponible sur GitHub (Forestry-Robotics-UC/ig_lio, branche ros2-jazzy). L'intérêt de ce travail dépasse le simple portage : il documente un mode de défaillance silencieux et particulièrement traître pour quiconque migre un système d'odométrie ou de SLAM de ROS 1 vers ROS 2. Une divergence numérique de ce type, provoquée par la chaîne d'outils et non par l'algorithme, peut passer inaperçue lors de tests superficiels puisque le programme continue de tourner sans planter. Pour les intégrateurs travaillant sur des robots mobiles, drones ou véhicules forestiers/agricoles dépendant de fusion LiDAR-inertielle, ce rapport constitue un signal d'alerte méthodologique sur les risques de migration ROS 2 et un cas documenté de debugging reproductible, plutôt qu'une innovation algorithmique. iG-LIO s'inscrit dans la lignée des systèmes d'odométrie LiDAR-inertielle tels que FAST-LIO ou LIO-SAM, désormais largement utilisés en robotique de terrain. Les auteurs précisent explicitement que ce rapport sert de référence citable pour le portage lui-même, sans revendication sur l'algorithme sous-jacent publié séparément. Le support multi-capteurs ajouté (Ouster, Velodyne, Livox Mid-360) suggère un usage visé en environnements forestiers et extérieurs, cohérent avec l'affiliation du laboratoire.

UECe correctif ROS 2, produit par le laboratoire Forestry Robotics de l'Université de Coimbra (Portugal), est directement réutilisable par les intégrateurs européens de robotique forestière, agricole ou mobile s'appuyant sur une fusion LiDAR-inertielle.

FR/EU ecosystemeActu
1 source
354arXiv cs.RO 

IA incarnée guidée par les exigences : conception d'une détection tactile sociale du corps entier via interaction humain-robot virtuelle

Article traduit et résumé en français, prêt à publier : Une équipe de recherche propose une méthodologie inédite pour concevoir la peau tactile des robots humanoïdes destinés à l'interaction physique et sociale avec l'humain (spHRI), en partant des données d'usage plutôt que des contraintes matérielles. Publiée sur arXiv (2607.11690v1), l'étude s'appuie sur une plateforme de réalité virtuelle à retour haptique pour collecter des cartes de contact haute résolution sur l'ensemble du corps d'un robot, à travers plusieurs scénarios sociaux (accolade, tape sur l'épaule, poignée de main, etc.). Neuf gestes tactiles sociaux récurrents ont été identifiés, dont huit ont ensuite fait l'objet d'une collecte contrôlée avec 18 participants, produisant un jeu de données ouvert de 5 520 essais. L'analyse des distributions de contact et de simulations d'encodage tactile fournit des repères quantitatifs sur la couverture cutanée nécessaire et la densité de capteurs à installer sur une plateforme humanoïde donnée. L'enjeu dépasse la simple curiosité académique : jusqu'ici, la conception des capteurs tactiles pour l'interaction sociale suivait une logique matérielle d'abord, où l'emplacement et la résolution des capteurs étaient fixés en amont, limitant de fait la palette de gestes reconnaissables. Cette approche inverse la démarche en dérivant les exigences de capteurs directement des données d'interaction réelles, ce qui pourrait éviter aux fabricants de robots sociaux ou compagnons un surdimensionnement coûteux de la peau tactile, ou au contraire une couverture insuffisante qui dégraderait la reconnaissance des gestes. Pour les intégrateurs et décideurs qui évaluent des robots destinés au contact physique humain (assistance, santé, accueil), disposer de seuils quantitatifs de densité et de placement avant la fabrication du hardware représente un gain de temps et de coûts d'ingénierie concret, plutôt qu'une promesse marketing. Le travail s'inscrit dans une limite bien identifiée de la recherche en robotique tactile : la plupart des peaux artificielles actuelles sont conçues sans données préalables sur la façon dont les humains touchent réellement un robot dans un contexte social, ce qui explique des écarts entre capacités annoncées et usage terrain. Bien que la démonstration ait été menée sur une seule plateforme robotique, les auteurs présentent la méthode comme transférable à d'autres morphologies de robots, ouvrant la voie à des exigences de capteurs spécifiques à chaque design avant même le prototypage physique. Les prochaines étapes attendues concernent la validation de cette méthodologie sur d'autres architectures de robots et son intégration dans des cycles de conception industriels, mais aucun calendrier ni partenariat industriel n'est mentionné à ce stade.

RecherchePaper
1 source
355arXiv cs.RO 

Visibilité et sécurité pour l'exploration multi-robot à perception limitée : SEAMLiS

Une équipe de recherche a publié le 9 juillet 2026 sur arXiv (référence 2607.09959v1) un article décrivant SEAMLiS (Safe Exploration for Autonomous Multi-Robot Systems Under Limited Sensing), un framework de sécurité pour l'exploration décentralisée par flottes de robots dans des environnements inconnus. Le problème visé est concret: avec un champ de vision et une portée de détection limités, les architectures d'exploration classiques planifient des trajectoires vers des zones informatives sans garantir que le capteur reste orienté dans la direction du mouvement, ce qui peut retarder la détection d'un obstacle caché jusqu'à ce qu'il soit trop tard pour une manœuvre d'évitement bornée en actuation. SEAMLiS s'installe à la couche d'exécution, en aval de l'allocateur d'objectifs et du planificateur local existants, et ajoute deux filtres: un filtre d'attitude de type gatekeeper qui bascule entre une politique de lacet favorisant la visibilité de la frontière connu-libre/inconnu et une politique de repli asservie en vitesse, puis un filtre positionnel basé sur des fonctions barrières de contrôle (CBF) qui gère l'évitement des obstacles connus, nouvellement détectés, et des autres robots. Les auteurs fournissent des conditions suffisantes de non-collision et valident l'approche en simulation randomisée, sous Isaac Sim, et sur drones Crazyflie réels. Pour les équipes qui développent des flottes de robots autonomes en environnement non cartographié, ce travail répond à une limite reconnue depuis longtemps: séparer exploration et sécurité en deux modules indépendants introduit un angle mort exploitable par la géométrie même du champ de vision limité. En démontrant un gain de sécurité sans sacrifier l'essentiel de l'efficacité d'exploration, SEAMLiS suggère qu'il est possible de conserver les stacks d'exploration existants (souvent optimisés pour le gain d'information) tout en corrigeant leur angle mort perceptif par une couche d'exécution modulaire, plutôt que de refondre l'ensemble du pipeline de planification. Ce résultat s'inscrit dans une littérature croissante sur les CBF appliqués à la robotique mobile multi-agents, où la difficulté centrale reste la garantie formelle de sécurité sous incertitude de perception plutôt que sous incertitude de dynamique seule. Les auteurs positionnent leur contribution comme complémentaire aux stacks d'exploration standards plutôt que concurrente, et les tests matériels sur Crazyflie, une plateforme de recherche largement utilisée pour les essais multi-drones, indiquent une intention de validation au-delà de la seule simulation, sans toutefois préciser de calendrier vers un déploiement industriel.

RecherchePaper
1 source
356arXiv cs.RO 

SLIDER : recherche de cible pour robot aérien guidée par historique clairsemé, utilisant des cartes locales glissantes

Des chercheurs présentent SLIDER, un nouveau framework logiciel pour la recherche de cibles par drone en environnement inconnu à grande échelle, publié le 14 juillet 2026 sur arXiv (2607.10553v1). Le système abandonne l'approche classique de cartographie dense globale au profit d'une carte locale glissante combinée à un historique global épars. Il embarque une méthode d'évaluation de la qualité d'observation qui exploite les poses historiques et les modèles de capteurs pour analyser les nuages de points en temps réel, ce qui accélère la détection des zones frontières à explorer. Une stratégie de clustering incrémental des points de vue s'adapte dynamiquement aux mises à jour locales, réduisant fortement le nombre de cibles candidates et la charge de calcul. Une carte topologique globale, maintenue de façon incrémentale et éparse, sert de support à la planification et à l'évaluation des coûts de trajectoire. Les auteurs rapportent des résultats supérieurs à l'état de l'art en simulation comme en conditions réelles, sur les critères d'usage mémoire, de latence de décision et d'efficacité de recherche. L'enjeu dépasse la seule prouesse académique : l'exploration autonome de zones inconnues (recherche et sauvetage, inspection industrielle, cartographie de sites difficiles d'accès) reste limitée par le compromis entre couverture spatiale large et perception fine en temps réel, un goulot d'étranglement classique pour les drones embarquant une puissance de calcul contrainte. En réduisant l'empreinte mémoire et la latence de décision par rapport aux méthodes à cartographie dense, SLIDER répond directement à une limite pratique de déploiement : la plupart des algorithmes de pointe en exploration robotique fonctionnent bien en simulation mais deviennent inutilisables sur du matériel embarqué à ressources limitées. Si les gains annoncés se confirment hors du cadre contrôlé des tests des auteurs, cela ouvrirait la voie à des essaims de drones autonomes plus légers, capables d'opérer en temps réel sans liaison permanente vers une station de calcul déportée. Le papier s'inscrit dans une lignée de recherche active sur l'exploration frontière ("frontier-based exploration") et la planification de trajectoire pour robots aériens, un champ où la tension entre richesse de la représentation cartographique et contraintes de calcul embarqué reste un problème ouvert depuis plusieurs années. Contrairement aux approches à carte globale dense, souvent citées comme référence mais coûteuses en mémoire à mesure que l'environnement s'agrandit, SLIDER mise sur la parcimonie pour rester scalable. L'article ne précise pas d'affiliation industrielle ni de calendrier de transfert vers un produit commercial ; il s'agit à ce stade d'une contribution de recherche, validée par simulation et expérimentation réelle, dont la reproductibilité et l'adoption par d'autres équipes détermineront l'impact réel sur le secteur de la robotique aérienne autonome.

RecherchePaper
1 source
Un nouvel indice de similitude humaine et de confort pour les mouvements de robots suivant des trajectoires prédéfinies
357arXiv cs.RO 

Un nouvel indice de similitude humaine et de confort pour les mouvements de robots suivant des trajectoires prédéfinies

Des chercheurs publient sur arXiv (arXiv:2607.08620v1, article de type "new") un indice inédit de similarité humaine et de confort pour évaluer les mouvements de robots suivant une trajectoire imposée. L'étude part du constat que la ressemblance visuelle avec le corps humain, propre aux humanoïdes, ne suffit pas à garantir l'acceptation lors d'une interaction physique : celle-ci dépend directement du confort et de l'ergonomie perçus, liés à la qualité du mouvement exécuté. Les auteurs s'appuient sur la caractérisation cinématique du mouvement humain, en particulier les lois temporelles qui régissent le déplacement de l'organe terminal (end-effector) le long d'un chemin donné, et mobilisent le principe de lognormalité, un modèle reconnu pour décrire la vitesse des gestes humains. Cet indice permet d'évaluer a priori, avant toute exécution, si une trajectoire générée par un algorithme paraîtra naturelle. Pour valider l'approche, 68 sujets ont participé à trois campagnes expérimentales impliquant une interaction physique directe avec un robot, en jugeant leur confort face à différents mouvements. Les résultats montrent une tendance globalement cohérente entre le confort perçu et la distribution de l'indice proposé. Pour l'industrie robotique, cet outil offre un moyen concret de comparer et d'optimiser des algorithmes de génération de trajectoires avant leur déploiement, sans attendre des tests utilisateurs coûteux à chaque itération. Il s'inscrit dans une problématique clé pour les intégrateurs de cobots et de robots humanoïdes destinés à travailler aux côtés d'humains : la fluidité perçue d'un geste pèse autant que sa précision technique dans l'acceptation du robot par les opérateurs, un facteur souvent négligé au profit des seules performances cinématiques (vitesse, précision, répétabilité). Le papier s'inscrit dans un courant de recherche en ergonomie robotique qui cherche à quantifier objectivement ce qui, jusqu'ici, relevait surtout d'évaluations subjectives via questionnaires post-interaction. En proposant une métrique calculable en amont de l'exécution, les auteurs ouvrent la voie à son intégration directe dans les boucles de planification de mouvement, avec des validations complémentaires à prévoir sur d'autres morphologies de robots et contextes d'usage industriel.

RecherchePaper
1 source
Le titre traite d'un article de recherche technique, pas de robotique, je le traduis directement
358arXiv cs.RO 

Le titre traite d'un article de recherche technique, pas de robotique, je le traduis directement

Des chercheurs publient un nouveau cadre méthodologique pour évaluer la fiabilité des modèles de monde (World Models, WM) utilisés en robotique et en conduite autonome, dans un article arXiv (2607.07196) diffusé début juillet 2026. Le constat de départ : ces modèles génératifs, de plus en plus employés comme "oracles" pour tester des politiques d'action en simulant les conséquences de leurs décisions, rendent un verdict de succès ou de sécurité sans que leur propre fiabilité soit vérifiée. Les auteurs pointent une faille des métriques actuelles comme la Fréchet Video Distance (FVD), qui juge le réalisme visuel des vidéos générées mais ignore si le monde simulé réagit correctement aux actions testées, notamment celles absentes des données d'entraînement. Pour y remédier, ils proposent une "échelle d'admissibilité" en cinq niveaux (L0 à L4) que tout WM devrait franchir avant que ses verdicts en boucle fermée soient acceptés comme preuve d'assurance qualité. Le cadre, conçu pour être indépendant du type de robot, est testé sur deux modèles de monde dédiés à la conduite autonome. Le résultat le plus frappant : le modèle qui obtient le meilleur score en qualité visuelle de génération (niveau L0) se classe moins bien sur le suivi effectif des actions demandées (niveaux L1-L2). Autrement dit, la fidélité visuelle d'une simulation ne garantit pas sa robustesse à l'action, ce qui remet en cause l'usage de métriques purement esthétiques pour valider des systèmes destinés à juger des politiques de conduite ou de manipulation robotique en conditions réelles. Pour les industriels et intégrateurs qui misent sur les modèles génératifs pour accélérer les tests en sim-to-real, notamment dans le contexte des architectures VLA (vision-langage-action) où la simulation sert de banc d'essai avant déploiement physique, ce travail est un signal d'alerte méthodologique plutôt qu'une remise en cause technologique. L'approche s'appuie sur des pratiques éprouvées de la simulation critique pour la sécurité, comme la Vérification, Validation et Accréditation (VV&A), le cadre SOTIF (Safety of the Intended Functionality) et les normes de test par scénarios, déjà utilisées dans l'aéronautique et l'automobile. Les auteurs choisissent la conduite autonome comme premier terrain d'application car les méthodes d'assurance qualité pour la simulation classique y sont les plus matures, ouvrant la voie à une extension future vers d'autres domaines robotiques comme la manipulation ou l'humanoïde.

RecherchePaper
1 source
Rapide apprentissage du contrôle de robots souples via un pas de temps implicite
359arXiv cs.RO 

Rapide apprentissage du contrôle de robots souples via un pas de temps implicite

Des chercheurs démontrent qu'un apprentissage rapide de politiques de contrôle pour robots souples est possible grâce au pas de temps implicite, une avancée jusqu'ici jugée hors de portée en raison du coût de calcul de la simulation de mécanique des milieux continus. Leur simulateur, DisMech, est un moteur généraliste entièrement implicite capable de gérer à la fois la dynamique des corps souples et les contacts frictionnels. L'équipe introduit aussi le contrôle par delta de courbure naturelle, une méthode analogue au contrôle delta de position articulaire des manipulateurs rigides, offrant un moyen intuitif d'appliquer des commandes lors de l'apprentissage. Testée sur quatre tâches de manipulation souple et comparée à Elastica, l'un des frameworks de simulation souple les plus répandus, l'approche atteint jusqu'à 6 fois la vitesse d'exécution sur les scénarios sans contact et jusqu'à 40 fois sur les scénarios riches en contact, avec 500 environnements simulés en parallèle. Une évaluation de l'écart sim à sim, entraînement dans un simulateur puis test dans un autre, confirme que ces gains de vitesse ne sacrifient pas la précision. Cette avancée s'attaque à un verrou connu du secteur : la simulation de corps rigides a permis l'essor massif de l'apprentissage par renforcement pour les robots articulés classiques, mais la robotique souple est restée à la traîne faute d'outils accessibles et rapides. Pour les chercheurs et industriels développant des préhenseurs souples, des trompes robotiques ou des manipulateurs continus destinés à la manutention délicate, ce travail suggère que l'apprentissage de politiques par simulation, longtemps réservé aux morphologies rigides, devient enfin praticable pour les morphologies déformables. Cela pourrait accélérer le transfert de techniques d'apprentissage de bout en bout vers des applications comme la préhension d'objets fragiles ou la chirurgie assistée, où la rigidité mécanique classique est un handicap. Le fossé entre simulateurs rigides matures et frameworks souples rudimentaires explique en partie le retard de la robotique douce sur l'apprentissage par simulation, un constat que ce travail cherche à combler en misant sur un solveur implicite plutôt que sur des approches explicites plus lentes comme Elastica. L'article, publié sur arXiv en version révisée (arXiv:2511.06667v2), s'inscrit dans une dynamique de recherche visant à doter la robotique souple d'outils logiciels aussi matures que ceux dont bénéficie la robotique rigide depuis des années, ouvrant la voie à de futurs benchmarks entre frameworks concurrents.

RecherchePaper
1 source
SPECTRA : primitives de mouvement spectrales conditionnées par le contexte pour la généralisation des compétences robotiques
360arXiv cs.RO 

SPECTRA : primitives de mouvement spectrales conditionnées par le contexte pour la généralisation des compétences robotiques

Des chercheurs proposent SPECTRA (Spectral Movement Primitive, SMP), un framework d'apprentissage par imitation dans le domaine fréquentiel pour la manipulation robotique, décrit dans un article publié sur arXiv (2607.06978v1). Le principe consiste à représenter les démonstrations de trajectoire par des coefficients de Fourier tronqués sur horizon fini, plutôt que par des points temporels bruts. Une bande de fréquences basses, sélectionnée empiriquement, capture la géométrie dominante du mouvement, tandis que les harmoniques plus élevées, responsables d'une croissance disproportionnée des dérivées (vitesse, accélération, jerk), sont écartées. Un modèle GMM/GMR (mélange de gaussiennes avec régression) conditionné par le contexte et sensible au référentiel prédit les coefficients de la bande de tâche dans un repère canonique ; la trajectoire cartésienne obtenue est ensuite convertie en espace articulaire via cinématique inverse séquentielle. Un régulateur couplé en phase limite la progression temporelle demandée sans toucher aux coefficients spectraux, imposant ainsi les limites de vitesse et d'accélération articulaires tout en conservant le chemin de l'effecteur. Les auteurs valident l'approche sur plusieurs critères (reconstruction de la bande de tâche, robustesse à des démonstrations corrompues, généralisation hors distribution entre repères non vus, admissibilité dynamique en espace articulaire, préservation du chemin) et un déploiement réel sur un bras Franka Panda. Le problème que cible SPECTRA est concret pour tout intégrateur en apprentissage par imitation : les pipelines classiques apprennent une trajectoire en espace de tâche puis lui imposent après coup des limites d'exécution (filtrage, lissage, écrêtage, mise à l'échelle temporelle), ce qui déforme souvent le chemin de l'effecteur jugé critique pour la tâche, par exemple lors d'un versement, d'une insertion de pièce ou du suivi d'un contour précis. En couplant génération de trajectoire et régulation dynamique dès la conception, dans le domaine fréquentiel, SPECTRA évite cette distorsion a posteriori : les résultats rapportés montrent une réduction substantielle des violations dynamiques et du jerk, tout en préservant le chemin voulu pendant la régulation de phase. Pour la robotique industrielle, où les cycles de préhension et d'insertion tolèrent mal les à-coups mécaniques, cela offre une alternative aux primitives de mouvement dynamiques (DMP) classiques et aux méthodes de lissage a posteriori. Les primitives de mouvement existent depuis les Dynamic Movement Primitives (DMP), introduites il y a une vingtaine d'années et largement utilisées en apprentissage par imitation pour encoder des trajectoires robustes et reproductibles. SPECTRA s'en démarque en travaillant dans le domaine fréquentiel plutôt que temporel, et en couplant explicitement génération de tâche et contraintes d'exécution articulaire plutôt que de les traiter séparément. Le choix du Franka Panda comme plateforme de validation, un bras collaboratif conçu par l'allemand Franka Robotics (ex Franka Emika) très utilisé en recherche académique, ancre les travaux dans l'écosystème européen de manipulation robotique. L'article ne mentionne ni calendrier de transfert industriel ni partenariat commercial : il s'agit à ce stade d'une contribution de recherche évaluée en laboratoire, dont la suite logique serait une validation sur des tâches de manipulation plus complexes et une comparaison directe avec les approches DMP existantes.

UEImpact indirect: la validation s'appuie sur un bras Franka Panda, plateforme concue par l'allemand Franka Robotics, mais aucun partenariat, financement ou deploiement commercial en France/UE n'est mentionne.

RecherchePaper
1 source
SIEVE : sélection de données tenant compte de la structure pour l'apprentissage par imitation avec des modèles VLA
361arXiv cs.RO 

SIEVE : sélection de données tenant compte de la structure pour l'apprentissage par imitation avec des modèles VLA

Des chercheurs proposent SIEVE, une méthode de sélection de données pour l'apprentissage par imitation des modèles Vision-Language-Action (VLA), publiée sur arXiv en juillet 2026. Contrairement aux approches existantes qui évaluent les démonstrations au niveau de la trajectoire complète ou de la paire état-action, SIEVE découpe les démonstrations en primitives visuo-motrices réutilisables et en interfaces de transition entre ces primitives. La méthode alloue ensuite un budget de sélection aux motifs de composition en maximisant l'exposition structurelle sous rendement décroissant, puis retient dans chaque groupe les trajectoires médianes, jugées les plus centrales, stables et propices à l'imitation. Testée sur plusieurs jeux de données, bancs d'essai et modèles VLA, SIEVE dépasse systématiquement les méthodes de sélection concurrentes. Résultat le plus marquant : la méthode surpasse un entraînement sur l'intégralité des données tout en n'utilisant que 50% des démonstrations et 50% des étapes d'entraînement. Pour les équipes qui entraînent des modèles VLA de type Pi-0, GR00T N2 ou Helix, ce travail s'attaque à un goulot d'étranglement concret : la collecte de démonstrations robotiques coûte cher, en téléopération humaine comme en génération synthétique, et empiler toujours plus de données ne garantit pas de meilleures politiques en raison de la redondance et du bruit. En démontrant qu'un entraînement sur moitié moins de données peut surpasser l'usage du jeu complet, SIEVE remet en question l'hypothèse du « plus de données égale de meilleures performances » dans l'apprentissage par imitation, et ouvre une piste d'optimisation des coûts pour les laboratoires et startups qui n'ont pas les ressources de calcul des géants du secteur. C'est un signal direct pour les décideurs B2B qui doivent arbitrer entre volume de collecte et qualité de curation avant de déployer des politiques VLA en production. L'apprentissage par imitation sur de larges jeux de démonstrations est devenu le paradigme dominant pour entraîner les modèles VLA, dans la lignée de travaux comme RT-2, OpenVLA ou les politiques génératives de Physical Intelligence et NVIDIA. La curation des données reste toutefois un problème ouvert : les méthodes précédentes se limitaient à des critères de diversité ou de qualité au niveau de la trajectoire entière, sans capturer les structures réutilisables qui composent les comportements à long horizon, comme saisir puis orienter un objet avant de le placer. SIEVE s'inscrit dans cette lignée de recherche sur l'efficacité des données et ouvre la voie à des travaux futurs sur la généralisation de cette approche structurelle à d'autres familles de modèles VLA et à des tâches de manipulation plus complexes.

RecherchePaper
1 source
Rapport technique RhinoVLA
362arXiv cs.RO 

Rapport technique RhinoVLA

HuixiAI a publié un rapport technique sur RhinoVLA, un modèle vision-langage-action (VLA) conçu spécifiquement pour tourner en temps réel sur du matériel embarqué, en co-conception avec le SoC edge Huixi R1. Le modèle s'appuie sur un backbone Qwen3-VL optimisé pour limiter le nombre de tokens visuels et contextuels traités, identifiés par les auteurs comme le principal goulot d'étranglement en latence des VLA sur puce embarquée : dans les opérateurs de projection dominés par le calcul matriciel (GEMM), le coût croît linéairement avec le nombre de tokens en entrée. RhinoVLA associe ce backbone allégé à un Action Expert à sortie continue, ainsi qu'à une interface unifiée combinant un registre de vues (View Registry), un espace d'état-action physique à 72 dimensions et des adaptateurs LoRA propres à chaque instance de robot, pour aligner des observations et schémas d'action hétérogènes sous une politique commune. Résultat annoncé : des performances comparables à π0.5 à taille de paramètres équivalente, avec une inférence de bout en bout à 11,69 Hz sur le Huixi R1, au-dessus du seuil de 10 Hz jugé nécessaire pour un contrôle en boucle fermée temps réel. L'enjeu dépasse la simple performance brute : la plupart des VLA démontrés en laboratoire (π0, GR00T N2, Helix) tournent sur GPU serveur ou desktop, loin des contraintes de puissance et de latence d'un robot mobile ou d'un bras industriel autonome. En optimisant simultanément l'architecture du modèle et la compilation matérielle (précision mixte, encodage visuel parallélisé), RhinoVLA s'attaque directement au fossé entre démonstration et déploiement réel, un point sensible pour les intégrateurs qui évaluent la viabilité commerciale des VLA en usine ou en logistique plutôt qu'en simple preuve de concept. Le projet doit être publié en open source sur GitHub (HuixiAI/RhinoVLA), une démarche qui s'inscrit dans la compétition croissante autour des architectures VLA généralistes multi-robots, aux côtés des travaux de Physical Intelligence (π0, π0.5) et NVIDIA (GR00T). Le document constitue une version révisée (v2) d'un rapport déjà déposé sur arXiv, sans calendrier de déploiement industriel précisé à ce stade.

IA physiqueActu
1 source
GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité
363arXiv cs.RO 

GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité

Des chercheurs ont publié sur arXiv (référence 2511.13216v2) GaRLILEO, un framework d'odométrie à temps continu fusionnant radar Doppler embarqué (radar SoC), cinématique des jambes et centrale inertielle (IMU) pour les robots à pattes évoluant sur terrains complexes, escaliers, pentes, environnements non structurés. Le système introduit deux contributions principales : une spline de vitesse ego-motion construite en continu à partir des mesures Doppler du radar et des données proprioceptives des jambes, découplant ainsi l'estimation de vitesse de l'intégration IMU ; et un facteur de gravité à contrainte douce sur la sphère S2, permettant d'estimer le vecteur gravité avec précision sans recourir à LiDAR ni caméra. L'algorithme a été évalué sur un dataset réel multimodalités collecté par l'équipe, couvrant des trajectoires intérieures et extérieures variées. Les auteurs revendiquent des performances état de l'art en odométrie verticale sur escaliers et pentes. Le code et le dataset sont publiés en open source. La dérive verticale est le talon d'Achille des systèmes d'odométrie proprioceptive pour robots bipèdes ou quadrupèdes : les impacts de contact répétés, le glissement des pieds et les vibrations accumulent des erreurs sur les angles de roulis et tangage, rendant la localisation peu fiable dès que le terrain n'est plus plan. Les approches existantes compensent avec du LiDAR ou des caméras, mais ces capteurs extéroceptifs se dégradent dans les scènes pauvres en features ou répétitives (couloirs, tunnels, zones enneigées). GaRLILEO propose une alternative robuste : le radar Doppler, peu sensible aux conditions d'éclairage et aux surfaces texturées, fournit une mesure directe de vitesse sans double intégration, ce qui élimine la source principale d'erreur IMU. Pour les intégrateurs déployant des robots d'inspection ou de logistique en environnement industriel réel, cette combinaison radar-pattes-IMU représente un profil de robustesse différent des stacks LiDAR-SLAM dominants. L'odométrie pour robots à pattes s'est structurée autour de quelques frameworks proprioceptifs de référence, TSIF, Pronto, DRIFT, et de pipelines LiDAR-inertiel comme LIO-SAM ou FAST-LIO. L'ajout du radar comme modalité principale reste marginal dans la littérature legged robotics, contrairement au domaine automobile où les radars 4D SoC (Texas Instruments, Vayyar, Arbe) ont connu une forte adoption. GaRLILEO s'inscrit dans une tendance récente visant à exploiter ces puces radar embarquées bas coût pour la navigation en intérieur dégradé. Les prochaines étapes naturelles incluent la validation sur des plateformes commerciales (Spot de Boston Dynamics, ANYmal de ANYbotics, Unitree B2) et l'intégration dans des pipelines SLAM complets. La mise en open source du dataset multimodale constitue en soi une contribution pour le benchmarking communautaire.

UELe code et le dataset open-source pourraient être exploités par des équipes de recherche européennes travaillant sur la navigation de robots à pattes (ex. ANYbotics en Suisse, labos SLAM EU), mais aucun acteur français ou européen n'est directement impliqué dans les travaux.

RecherchePaper
1 source
Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste
364arXiv cs.RO 

Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste

Des chercheurs ont publié sur arXiv (référence 2606.29384) Event-VLA, un framework combinant des caméras événementielles avec des modèles Vision-Language-Action (VLA) pour rendre la manipulation robotique robuste dans des conditions d'éclairage dégradées. L'approche repose sur l'intégration de flux d'événements, une modalité de capteur neuromorphique qui encode les variations de luminosité pixel par pixel avec une résolution temporelle de l'ordre de la microseconde, contrairement aux caméras RGB classiques qui acquièrent des images complètes à fréquence fixe. L'architecture introduit un mécanisme de routage par requêtes d'action : des requêtes apprenantes extraient la sémantique pertinente à la tâche depuis le raisonnement VLA, puis agrègent sélectivement les tokens événementiels via une cross-attention à portes (gated cross-attention), produisant des représentations d'action sensibles aux conditions lumineuses. Les expériences couvrent des scénarios de simulation et de déploiement réel en faible luminosité, voire en quasi-obscurité. Ce travail s'attaque à une faille structurelle des VLA actuels, Pi-0, OpenVLA, GR00T N2 ou Helix inclus, qui sont entraînés et évalués quasi-exclusivement dans des environnements d'intérieur bien éclairés et stables. Le sim-to-real gap se double ici d'un lighting-to-real gap rarement quantifié dans les benchmarks publiés. Event-VLA démontre qu'on peut greffer une modalité événementielle sans détruire les priors sémantiques RGB-langage préentraînés, ce qui est non trivial : la plupart des fusions multimodales naïves dégradent la performance en conditions normales pour gagner en robustesse marginale. Le fait que le gain soit mesuré sans régression sur éclairage standard constitue le résultat le plus solide à retenir pour les intégrateurs industriels envisageant des déploiements en entrepôt, en extérieur ou en environnement à éclairage variable. Les caméras événementielles (Prophesee, inivation, Sony IMX636) restent onéreuses et peu présentes dans les pipelines robotiques commerciaux, ce qui limite la portée immédiate du framework. Le travail s'inscrit dans un mouvement plus large d'hybridation sensorielle pour les VLA, en parallèle d'approches tactiles (GelSight) ou proprioceptives. Côté concurrent, Boston Dynamics, Figure et Agility travaillent sur la robustesse des politiques en conditions réelles mais publient peu sur la gestion de l'éclairage. Aucun acteur européen n'est mentionné dans ce papier. Les auteurs ne précisent pas de pipeline de déploiement à l'échelle ni de timeline industrielle : il s'agit d'un résultat de recherche, pas d'un produit shipé.

UEProphesee, fabricant français de caméras événementielles, est explicitement cité comme fournisseur matériel clé, ce qui positionne l'écosystème européen du capteur neuromorphique comme brique potentielle des futurs pipelines VLA industriels robustes.

IA physiqueActu
1 source
Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence
365arXiv cs.RO 

Behavior Uncloning : distiller la redirection de mode dans les poids de politique sans guidage à l'inférence

Des chercheurs ont publié fin juin 2026 sur arXiv une méthode appelée MoRE (Mode Redirection) pour corriger un défaut structurel de l'apprentissage par imitation robotique (behavior cloning) : les politiques entraînées sur des jeux de démonstrations hétérogènes capturent simultanément des comportements désirés et indésirables, y compris dangereux. L'exemple retenu par les auteurs est parlant : un robot entraîné à des transferts d'objets peut apprendre à passer un couteau lame en premier. MoRE introduit une courte étape d'«uncloning» qui distille un signal de redirection, généré par un classificateur de modes temporaire, directement dans les poids de la politique. Une loss de rétention préserve la compétence sur les modes corrects. Sur huit tâches simulées et réelles, MoRE améliore le taux de succès moyen de 44 points de pourcentage par rapport à la politique multi-modes initiale, et approche les performances du réentraînement sur données filtrées, considéré comme la référence. La méthode est compatible avec Diffusion Policy et Pi0.5, le modèle VLA (Vision-Language-Action) de Physical Intelligence. L'intérêt industriel de MoRE tient à deux absences : pas d'accès requis aux démonstrations originales, et aucun surcoût à l'inférence. Les solutions existantes butaient sur l'une ou l'autre contrainte : la curation de données impose un réentraînement complet depuis les données sources ; le steering à l'inférence (guidage externe durant l'exécution) ajoute une latence incompatible avec les cycles robotiques en temps réel. MoRE contourne les deux en modifiant les poids une seule fois, en aval de l'entraînement initial. Pour un intégrateur ou un COO industriel, c'est une piste crédible pour corriger une politique déjà déployée sans repartir de zéro. La compatibilité confirmée avec Pi0.5 est un signal fort : si la méthode tient sur un VLA large-scale, elle couvre un spectre large de déploiements réels. L'apprentissage par imitation reste l'une des méthodes d'entraînement les plus accessibles, mais sa sensibilité aux données hétérogènes est un problème structurel documenté depuis des années. Les VLA récents comme Pi0 et Pi0.5 (Physical Intelligence), OpenVLA (Berkeley) ou GR00T N2 (NVIDIA) ont étendu les capacités générales des politiques sans régler ce problème de modes indésirables. MoRE s'inscrit dans un courant émergent de post-training alignment appliqué à la robotique, analogue aux techniques DPO/RLHF utilisées pour aligner les LLM après préentraînement. Les approches concurrentes incluent le filtrage par classificateur externe et la curation de données assistée par modèle. Ce travail est à ce stade un preprint de recherche, sans partenariat industriel annoncé ni timeline de commercialisation ; aucun acteur européen n'est impliqué parmi les auteurs identifiés.

💬 Le robot qui apprend à passer un couteau lame en premier, c'est pas un bug de code, c'est un bug de données, et les meilleures politiques multi-modes n'y échappent pas. MoRE fait pour la robotique ce que DPO a fait pour les LLM : corriger les modes indésirables directement dans les poids, après coup, sans données sources et sans latence ajoutée. Bon, c'est un preprint pour l'instant, mais la compatibilité confirmée avec Pi0.5 dit quelque chose de sérieux sur la portée de la méthode.

IA physiqueOpinion
1 source
Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique
366arXiv cs.RO 

Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique

Une équipe de chercheurs présente RoboTracer, un modèle de vision-langage (VLM) 3D permettant aux robots de tracer des trajectoires dans l'espace physique en raisonnant sur des mesures métriques concrètes. Publié en version 3 sur arXiv (2512.13660, décembre 2025), le système combine référencement spatial 3D et mesure de distance via un encodeur universel et un décodeur à supervision par régression, affiné d'abord en apprentissage supervisé (SFT) puis par renforcement (RFT) avec des récompenses intermédiaires sensibles aux métriques. Le dataset d'entraînement TraceSpatial regroupe 30 millions de paires question-réponse sur scènes intérieures, extérieures et de manipulation, avec des chaînes de raisonnement atteignant 9 étapes. Sur le benchmark TraceSpatial-Bench introduit par les auteurs, RoboTracer atteint 79,1 % de taux de succès moyen et dépasse Gemini-2.5-Pro de 36 points de précision. Le système a été validé sur bras UR5 (Universal Robots) et humanoïde G1 (Unitree) dans des scènes réelles encombrées. La contribution principale tient dans le raisonnement métrique, une capacité absente des VLM classiques : décrire une scène en langage naturel ne suffit pas pour estimer qu'un obstacle se trouve à 0,47 m à gauche, information nécessaire à toute trajectoire exécutable. L'approche RFT avec récompenses de processus supervise les étapes perceptuelles intermédiaires et non uniquement le résultat final, ce qui réduit concrètement l'écart entre compréhension sémantique et exécution physique (le demo-to-reality gap). Pour un intégrateur ou un COO industriel, cela signifie un robot capable d'opérer dans des espaces non cartographiés à l'avance. L'avance de 36 % sur Gemini-2.5-Pro est notable, même si ce modèle n'est pas conçu pour la robotique embarquée. RoboTracer s'inscrit dans la compétition autour des modèles VLA (Vision-Language-Action), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA, qui cherchent tous à unifier perception, raisonnement et action dans un modèle unique. Sa spécificité est l'accent sur la conscience métrique plutôt que sur le contrôle moteur fin, niche où Pi-0 reste dominant. Le choix des plateformes UR5 (bras industriel 6 axes, référence en intégration industrielle) et G1 (humanoïde Unitree, 43 degrés de liberté, environ 35 000 $) renforce la crédibilité de la généralisation multi-robots. À ce stade, il s'agit d'un résultat de recherche sans déploiement commercial annoncé ; la publication du dataset TraceSpatial et du benchmark ouvert constitue en revanche une infrastructure réutilisable directement par la communauté robotique.

UELe dataset TraceSpatial et le benchmark ouvert sont librement accessibles aux laboratoires européens de robotique, mais aucun acteur ou déploiement européen n'est impliqué dans cette contribution.

IA physiqueOpinion
1 source
CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle
367arXiv cs.RO 

CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle

Une équipe de chercheurs a publié sur arXiv (réf. 2606.29222) un planificateur de navigation autonome baptisé CORE (Contextual-memory Oriented Reinforcement-learning), conçu pour guider un robot dans des environnements inconnus sans carte préalable. L'architecture combine un graphe de visibilité sparse pour la représentation structurée de l'espace, un réseau Transformer pour la compréhension globale de l'environnement, et un mécanisme de mémoire contextuelle pour éviter les optima locaux dans les grandes scènes. Testé face au planificateur traditionnel FAR Planner et à plusieurs baselines d'apprentissage par renforcement, CORE réduit la distance de déplacement de 13 % par rapport à FAR Planner et jusqu'à 48 % face aux meilleures méthodes d'apprentissage, avec des gains qui s'accentuent dans les environnements complexes. Fait notable : le modèle réalise un transfert sim-to-real en zéro-shot, sans fine-tuning sur données réelles, après entraînement exclusif sur des environnements simulés basés sur l'image. Le code est disponible en accès libre sur GitHub. Ce résultat s'attaque à un verrou persistant de la navigation mobile : la dégradation des performances lors du passage du simulateur au monde réel. La plupart des méthodes d'apprentissage par renforcement nécessitent soit une domain randomization poussée, soit un fine-tuning coûteux sur données terrain. Ici, le zéro-shot sim-to-real est démontré en environnement physique sans intervention humaine, résultat significatif si les conditions expérimentales sont généralisables. Pour les intégrateurs et équipes R&D, l'enjeu concret est double : réduction de la distance parcourue (efficacité énergétique, temps de cycle) et capacité à opérer dans des espaces non cartographiés, scénario courant en logistique, BTP ou exploration. La navigation en environnements inconnus s'appuie historiquement sur le SLAM, avec des contributions majeures d'ETH Zurich, Carnegie Mellon ou l'INRIA côté européen. FAR Planner (CMU), utilisé ici comme référence de comparaison, reste une baseline solide mais à règles fixes. Sur le plan industriel, Boston Dynamics, ANYbotics ou Exotec intègrent des planificateurs propriétaires dans leurs flottes de robots mobiles. CORE se positionne comme une alternative légère, entraînable sur image seule, mais reste à ce stade une contribution académique sans déploiement industriel annoncé. La robustesse face aux obstacles dynamiques, non testée dans cette version, constituera l'étape critique pour une éventuelle industrialisation.

UELe code open-source pourrait être évalué par des équipes R&D françaises (Exotec, intégrateurs logistiques) pour la navigation en espaces non cartographiés, mais il n'y a pas de lien institutionnel direct avec la France ou l'UE.

RecherchePaper
1 source
Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond
368arXiv cs.RO 

Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond

Une étude publiée sur arXiv (référence 2510.11103, troisième révision) analyse systématiquement comment les différentes représentations mathématiques du groupe SO(3), l'espace des rotations 3D, influencent l'apprentissage par renforcement appliqué au contrôle robotique. Les chercheurs ont comparé quatre familles de représentations courantes : angles d'Euler, quaternions, matrices de rotation et coordonnées d'algèbre de Lie, en les évaluant sur trois algorithmes d'RL continus de référence (PPO, SAC et TD3), sous deux régimes de récompenses (dense et sparse), et sur une suite de benchmarks robotiques standardisés. Le résultat central : représenter les actions comme des vecteurs tangents dans le repère local donne les résultats les plus fiables et les plus stables, quel que soit l'algorithme utilisé. Le code et la page projet sont disponibles à amacati.github.io/so3_primer. Ce résultat a une portée directe pour les ingénieurs qui développent des politiques de contrôle pour la manipulation ou la locomotion humanoïde. Le choix de représentation n'est pas neutre : la géométrie induite par chaque paramétrisation conditionne la manière dont l'agent explore l'espace des actions, interagit avec la régularisation entropique (notamment dans SAC), et converge, ou échoue à converger, lors de l'entraînement. Les angles d'Euler souffrent de singularités connues (gimbal lock), les quaternions imposent une contrainte de norme unitaire difficile à respecter en sortie de réseau neuronal, et les matrices de rotation introduisent des redondances qui compliquent la projection sur SO(3) valide. L'étude fournit des recommandations directement applicables, ce qui est rare dans la littérature RL sur la rotation. La problématique SO(3) est bien documentée pour l'apprentissage supervisé, notamment dans les pipelines d'estimation de pose, mais ses implications pour les actions en RL restaient peu explorées. Ce travail comble ce manque à un moment où les politiques d'entrée-sortie continues (VLA, diffusion policies, flux-matching) deviennent centrales dans les robots manipulateurs commerciaux. Les équipes qui développent des politiques pour des plateformes comme Figure 03, Unitree H1 ou des manipulateurs industriels s'appuient de plus en plus sur SAC et TD3 ; savoir que la représentation en vecteur tangent surpasse systématiquement les alternatives simplifie un choix d'architecture souvent fait de manière empirique. Les auteurs publient le code en open source, ce qui permettra à la communauté de valider ces résultats sur d'autres benchmarks et accélérera potentiellement l'adoption de cette convention dans les frameworks d'RL robotique.

RecherchePaper
1 source
LocalNav : distillation de VLMs frontière et RL incarné pour la navigation embarquée vers un objet cible
369arXiv cs.RO 

LocalNav : distillation de VLMs frontière et RL incarné pour la navigation embarquée vers un objet cible

Une équipe de chercheurs a publié LocalNav (arXiv 2506.27871), une méthode de distillation permettant d'exécuter des modèles de vision-langage (VLM) directement sur robots embarqués, sans recourir au cloud. Le pipeline de référence s'appuie sur Claude Sonnet 4.6 couplé à un graphe de scène et atteint un taux de succès (SR) de 39,7% sur le benchmark HM3D OVON, qui évalue la navigation vers des objets désignés en langage naturel dans des environnements intérieurs simulés (tâche ObjectNav). Qwen3.5-4B, un modèle de 4 milliards de paramètres, est ensuite fine-tuné sur seulement 500 traces de raisonnement issues de ce pipeline frontier : il obtient un SR de 34,5%, réduisant significativement l'écart avec le modèle cloud de référence. Pour le déploiement physique sur Jetson Orin (NVIDIA), les auteurs introduisent E-RLVR avec régularisation Token Generation (TG), qui comprime les séquences de sortie. Combinée à la quantification, cette optimisation réduit la latence globale d'inférence de 82,8% (71,8% sur la latence brute, 72,1% sur la génération de tokens), sans perte de performance jugée significative par les auteurs. L'enjeu industriel est direct : la dépendance au cloud représente un frein opérationnel réel pour les robots mobiles déployés en entrepôt, en usine ou en extérieur, où la connectivité est intermittente et où chaque dizaine de millisecondes pèse sur les décisions de navigation. Le fait que 500 traces de distillation suffisent à approcher les performances d'un grand modèle frontier valide une hypothèse clé du domaine : la supervision synthétique depuis des LLMs propriétaires peut compenser l'absence de larges jeux de données annotés manuellement. La réduction de 82,8% de latence franchit un seuil opérationnel critique pour un déploiement synchrone avec le mouvement physique du robot, ce que les architectures cloud ne peuvent pas garantir en conditions réelles. Ce travail s'inscrit dans une tendance de compression des VLMs pour la robotique edge, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui cherchent tous à réduire leur empreinte computationnelle pour le déploiement à grande échelle. La distillation depuis Claude vers Qwen positionne ce pipeline à l'intersection de deux écosystèmes : modèles frontier propriétaires comme source de supervision, modèles open-weights comme cible d'optimisation. À noter que l'ensemble des résultats présentés reste pour l'instant simulé sur HM3D ; les prochaines étapes naturelles incluent une validation sur déploiement physique réel et un passage à l'échelle des traces de distillation au-delà des 500 exemples actuels, pour cartographier la courbe d'amélioration.

💬 500 traces de distillation. C'est le chiffre qui devrait retenir l'attention : en partant des raisonnements de Claude, un modèle de 4 milliards de paramètres tourne sur Jetson Orin et atteint 87% des performances cloud. Ce pipeline frontier→edge valide que la supervision synthétique depuis des LLMs propriétaires peut remplacer des milliers d'annotations humaines, bon, sur des benchmarks simulés pour l'instant, mais la réduction de latence de 82% donne enfin un argument solide aux équipes qui veulent déployer ça en entrepôt sans réseau.

IA physiqueOpinion
1 source
FailSafe : raisonnement et récupération face aux défaillances dans les modèles VLA
370arXiv cs.RO 

FailSafe : raisonnement et récupération face aux défaillances dans les modèles VLA

Une équipe de chercheurs a publié FailSafe, un système de génération automatique de scénarios d'échec et d'actions de récupération pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. Présenté dans un preprint arXiv (v3, 2026), le système s'appuie sur LLaVA-OneVision-7B, un modèle de 7 milliards de paramètres affiné pour détecter des pannes en cours de tâche et produire des actions correctives exécutables, donnant naissance à FailSafe-VLM. Les évaluations conduites dans le simulateur ManiSkill montrent que cette couche de récupération améliore en moyenne jusqu'à 22,6% les performances de trois architectures VLA de référence : Pi-0-FAST (Physical Intelligence), OpenVLA et OpenVLA-OFT. Le système se généralise à différentes configurations spatiales, angles de caméra, objets manipulés et morphologies de bras robotiques. L'enjeu est structurel : les datasets de manipulation robotique existants, simulés ou réels, se limitent presque exclusivement à des trajectoires correctes. Un robot entraîné sur ces données ne dispose d'aucun mécanisme pour se remettre d'une prise ratée, d'un objet déplacé ou d'une perturbation imprévue. FailSafe comble ce vide en générant automatiquement, à partir de tâches existantes et d'un planificateur de mouvement, des paires (échec, action de récupération) annotées et directement exploitables en fine-tuning. Pour les équipes R&D et les intégrateurs, c'est une brique scalable sans collecte de données humaines supplémentaire. Le gain de 22,6% reste toutefois un delta relatif sur plusieurs tâches en simulation, et les auteurs ne rapportent aucun test en conditions physiques réelles : le sim-to-real gap pour les scénarios d'échec eux-mêmes reste une question ouverte. Les VLA représentent la convergence des grands modèles de vision-langage avec la commande motrice basse-fréquence, un axe de recherche en forte croissance depuis 2023. Pi-0 de Physical Intelligence, OpenVLA développé par Berkeley et Stanford, et leurs variantes constituent aujourd'hui le benchmark dominant dans ce domaine. FailSafe se positionne non comme un nouveau modèle de base, mais comme une surcouche de robustesse greffable sur ces architectures existantes, une approche pragmatique qui évite de repartir de zéro. Les quelques datasets existants traitant de la détection d'échec se limitaient à des explications textuelles difficilement exploitables directement par un VLA, ce que FailSafe résout en produisant des actions exécutables. La prochaine étape logique sera une validation hors simulateur, notamment sur des manipulateurs industriels réels, pour confirmer si les scénarios synthétiques d'échec transfèrent effectivement au monde physique.

💬 Entraîner les VLA uniquement sur des trajectoires réussies crée un angle mort structurel : le modèle n'a jamais appris à se planter ni à se rattraper. FailSafe résout ça sans collecte humaine supplémentaire, et c'est là la vraie valeur ajoutée. Le +22,6% en simulateur, c'est encourageant, mais le sim-to-real sur des scénarios d'échec reste entier.

IA physiqueOpinion
1 source
Lâcher-puis-récupérer : quelle est la redondance des modèles vision-langage-action (VLA) ?
371arXiv cs.RO 

Lâcher-puis-récupérer : quelle est la redondance des modèles vision-langage-action (VLA) ?

Une équipe de chercheurs a publié fin juin 2026 une étude (arXiv:2606.27755) examinant la redondance architecturale des modèles Vision-Language-Action (VLA), ces modèles de contrôle robotique qui combinent un backbone de langage préentraîné avec des modules vision et action. Le protocole, baptisé Drop-Then-Recovery (DTR), consiste à supprimer des blocs transformer sélectionnés d'un VLA préentraîné, puis à le fine-tuner pour mesurer si la capacité retirée était réellement nécessaire au contrôle en boucle fermée. Pour prioriser quels blocs supprimer, les auteurs introduisent GateProbe, une métrique de sensibilité en un seul passage (one-shot) qui classe les blocs selon leur contribution à la perte d'action en aval. Les expériences couvrent plusieurs architectures VLA, des benchmarks de manipulation standard (dont LIBERO) et des scénarios industriels sur robot réel. Résultat chiffré marquant : supprimer la moitié des blocs LLM d'OpenVLA-OFT fait passer le score LIBERO de 95,0 % à 98,3 %, et ne conserver que deux blocs de langage suffit à retrouver les performances de référence. Ce résultat remet en question un postulat implicite du domaine : que la profondeur des backbones de langage hérités des grands modèles (LLM) est nécessaire à la compréhension d'instructions robotiques. Les instructions typiques en manipulation sont courtes et peu compositionnelles ; le surcapacité linguistique ne sert pas le contrôle et peut même nuire via du bruit de gradient ou une compétition de capacité. En revanche, les voies vision et action se révèlent nettement moins tolérantes à la suppression, ce qui oriente clairement les priorités d'allocation pour les futures architectures VLA. Pour les intégrateurs industriels, cela ouvre la voie à des modèles plus légers, moins coûteux à inférer et à fine-tuner, sans dégradation de performance sur les tâches réelles. Les VLA ont émergé comme paradigme dominant du contrôle robotique généraliste depuis les travaux fondateurs sur RT-2 (Google DeepMind, 2023) et OpenVLA (Berkeley, 2024), qui ont montré qu'un backbone VLM préentraîné pouvait être réutilisé pour la manipulation. OpenVLA-OFT, utilisé comme modèle de référence dans cette étude, est une variante fine-tunable publiée par l'Université de Stanford. Parmi les concurrents directs sur ce terrain architectural : Physical Intelligence avec pi0 (basé sur un flow matching), qui a déjà opté pour une architecture plus légère côté langage, et les travaux de pruning de transformers en NLP (SparseGPT, Sheared LLaMA) dont DTR s'inspire méthodologiquement. Le code est disponible sur GitHub (s1ghhh/VLADrop). Les prochaines étapes logiques seraient de tester DTR sur des modèles plus récents (GR00T N2 de NVIDIA, Helix de Figure) et sur des tâches à instructions longues ou hiérarchiques, où la profondeur linguistique pourrait enfin devenir un facteur limitant.

RechercheOpinion
1 source
Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
372arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source
Libérer des mouvements expressifs infinis chez les quadrupèdes via des priors vidéo génératifs
373arXiv cs.RO 

Libérer des mouvements expressifs infinis chez les quadrupèdes via des priors vidéo génératifs

Des chercheurs ont publié le 29 juin 2026 sur arXiv (2606.28237) un pipeline nommé Uni-Mo, capable de générer automatiquement des mouvements expressifs pour robots quadrupèdes sans recourir à des animaux réels comme source de données. Le système enchaîne trois étapes : un LLM produit des descriptions textuelles de mouvements, un modèle de diffusion vidéo synthétise les comportements correspondants sous forme de séquences visuelles, puis ces vidéos sont converties en trajectoires 3D servant à entraîner des politiques de suivi déployées sur un Unitree Go2. Pour stabiliser les générations vidéo naturellement instables sur la durée, les auteurs introduisent une "Identity Consistency Loss" qui impose une cohérence d'apparence du robot entre les frames. Le jeu de données résultant, Quad-Imaginarium (disponible en open source sur GitHub), regroupe 7 488 séquences de mouvements annotées en langage naturel, couvrant 18,5 heures de comportements acrobatiques et expressifs. Sur 392 mouvements tirés aléatoirement et testés physiquement sur un Go2 réel, le taux de succès de déploiement atteint 96,7 %, contre 97,6 % en simulation sur l'ensemble du dataset. Ce résultat est notable parce qu'il contourne une hypothèse tacite qui plombait les approches précédentes : faire passer les données de mouvement par un corps animal réel, ce qui rendait la collecte dépendante d'animaux coopératifs, la reconstruction fragile selon les espèces, et le retargeting mal posé face aux incompatibilités morphologiques. En traitant la rareté des données comme un problème de génération plutôt que de capture, Uni-Mo démontre qu'un pipeline entièrement synthétique peut atteindre un taux sim-to-real supérieur à 96 %, ce qui valide empiriquement l'hypothèse que la diffusion vidéo peut servir de simulateur comportemental crédible pour la robotique quadrupède. Pour les intégrateurs et décideurs B2B, cela signifie potentiellement une voie vers des robots compagnons ou d'inspection aux comportements riches, sans infrastructure de motion capture animale. Le champ du mouvement quadrupède expressif est dominé par des approches d'imitation sur données réelles (Boston Dynamics, ANYbotics, Unitree lui-même) ou de retargeting depuis des séquences canines capturées en laboratoire. Uni-Mo s'inscrit dans une tendance émergente qui mobilise les générateurs vidéo comme oracles de physique approximative, après des travaux similaires dans le domaine humanoïde (notamment autour de Pi-0 de Physical Intelligence et des pipelines VLA). L'Unitree Go2, robot grand public à moins de 3 000 dollars, est ici utilisé comme plateforme de validation, ce qui renforce la reproductibilité de l'approche. Les prochaines étapes probables incluent l'extension à des morphologies différentes et l'intégration de retours proprioceptifs pour fermer la boucle en temps réel.

💬 Le gros truc ici, c'est qu'ils ont retourné le problème : au lieu de capturer des mouvements sur de vrais animaux, ils les génèrent entièrement par diffusion vidéo. 96,7% de succès sur robot physique, c'est pas de la simulation flatteuse, ça valide empiriquement qu'un modèle vidéo peut servir d'oracle comportemental crédible pour la robotique quadrupède. Si tu vois ça se confirmer sur d'autres morphologies, la capture motion animale commence sérieusement à sentir la dette technique.

IA physiqueOpinion
1 source
Optimisation non linéaire à grande échelle : de nombreux problèmes, un seul GPU
374arXiv cs.RO 

Optimisation non linéaire à grande échelle : de nombreux problèmes, un seul GPU

Des chercheurs ont publié fin juin 2026 sur arXiv jaxipm, présenté comme le premier solveur de programmes non linéaires (NLP) capable de traiter des lots de problèmes simultanément sur GPU. Construit sur la base algorithmique d'IPOPT, le solveur de référence dans les pipelines de planification en robotique, et implémenté en JAX, jaxipm atteint jusqu'à 32,85 fois le débit d'IPOPT classique sur des benchmarks de contrôle prédictif non linéaire (NMPC) pour drones quadrotors. Les scénarios testés couvrent le suivi de trajectoire en présence d'obstacles, la navigation multi-drones sans collision, et l'évitement en environnement encombré. Le code est disponible en open source sur GitHub (johnviljoen/jaxipm). L'enjeu est structurel : les solveurs NLP matures comme IPOPT offrent des garanties de satisfaction de contraintes et d'optimalité locale introuvables dans les méthodes par apprentissage par renforcement (RL) ou MPPI, mais ils sont mono-thread et CPU-bound, incompatibles avec les pipelines GPU-batched qui dominent la recherche robotique moderne. Cette incompatibilité a creusé un fossé entre deux familles d'approches : les solveurs à gradients, précis mais séquentiels, et les méthodes d'échantillonnage, parallélisables mais sans garanties formelles. jaxipm comble ce fossé via deux innovations : la "heterogeneous iteration fusion", qui supprime le branchement conditionnel dans la boucle interne d'IPOPT, et l'"iteration level batching", qui minimise les temps morts du GPU lors du traitement simultané de N instances indépendantes. Pour les équipes de motion planning souhaitant coupler planification contrainte et apprentissage dans une boucle unifiée, ce type de solveur change le régime de ce qui est calculable en temps quasi-réel. IPOPT, développé à partir des années 2000 à Argonne National Laboratory, est le standard de facto en robotique pour la planification de trajectoires, la cinématique inverse, et la gestion de contacts. Son intégration dans des frameworks modernes comme MuJoCo MPC ou les pipelines Pinocchio reste cependant bridée par sa nature séquentielle. Face à l'essor des simulateurs GPU-batched comme IsaacLab (NVIDIA) ou MJX (Google DeepMind), capables de générer des millions de rollouts par seconde, l'absence d'un solveur NLP au même format représentait un goulot d'étranglement pour les approches hybrides. jaxipm est pour l'instant validé uniquement sur des benchmarks drones quadrotors, ce qui appelle une évaluation sur configurations manipulateurs ou robots humanoïdes avant de pouvoir généraliser les gains annoncés à l'ensemble du spectre robotique.

RecherchePaper
1 source
Comment allouer un budget de transfert simulation-réel ?
375arXiv cs.RO 

Comment allouer un budget de transfert simulation-réel ?

Une étude publiée sur arXiv (réf. 2606.22062, juin 2026) s'attaque à une question pratique restée sans réponse claire dans la robotique par apprentissage : comment répartir un budget de temps de mesure sur robot réel entre l'identification de système (mesurer précisément les paramètres physiques du robot) et la randomisation de domaine (entraîner sur une large plage de dynamiques simulées) ? Les chercheurs ont conduit une expérience contrôlée sim-à-sim sur un pendule, en substituant un modèle à paramètres cachés au robot physique pour pouvoir varier proprement les gaps de réalité et les niveaux de bruit. Résultat : un faible nombre de rollouts d'identification suffisait à combler l'essentiel de l'écart de transfert. Une fois des données réelles disponibles, les politiques entraînées aux paramètres estimés surpassaient systématiquement celles entraînées sur une bande de randomisation élargie, même lorsque cette bande contenait les vrais paramètres du système. Ce résultat contredit une intuition répandue dans le secteur : celle que "plus de randomisation = plus de robustesse au sim-to-real gap". Les pipelines sim-to-real actuels (notamment pour les mains, les bras, et les humanoïdes) consacrent souvent une fraction importante de l'ingénierie à construire des distributions de randomisation larges via DR (Domain Randomization), parfois au détriment d'une identification soignée. Cette étude suggère que cette stratégie est sous-optimale dans le régime "bénin" où les dynamiques sont identifiables. Pour les intégrateurs robotiques et les équipes de déploiement, la leçon opérationnelle est directe : mesurer d'abord ce qu'il est possible de mesurer, et réserver la randomisation à l'incertitude résiduelle non modélisable, pas l'inverse. Le sim-to-real reste l'un des goulots d'étranglement centraux du robot learning depuis les travaux fondateurs d'OpenAI Robotics sur Dactyl (2019) et les benchmarks de transfert de Meta AI et Google DeepMind. La communauté a largement misé sur des variantes de Domain Randomization (DR) et sur les Visual-Language-Action models (VLA) pour contourner le gap sans nécessiter d'identification fine. Cette étude s'inscrit dans un contre-courant : celui d'une meilleure caractérisation du robot physique via la sysid, une approche défendue également par des travaux récents de Unitree, Boston Dynamics, et par des labos académiques proches du contrôle optimal. La limite explicitement posée par les auteurs est importante : leurs conclusions tiennent dans un régime à deux paramètres inconnus et sans mismatch structurel de modèle ; dans des systèmes plus complexes (contact, déformation, friction multipoint), la randomisation large pourrait reprendre l'avantage. Prochaines étapes naturelles : valider sur des systèmes à plus haute dimensionnalité, des robots articulés réels, et en présence de mismatch structurel explicite.

RecherchePaper
1 source
Un corps, deux esprits : approche à autonomie variable pour une main robotique à contrôle partagé
376arXiv cs.RO 

Un corps, deux esprits : approche à autonomie variable pour une main robotique à contrôle partagé

Des chercheurs ont publié le 25 juin 2026 sur arXiv (2606.25575) une étude portant sur une main robotique portable à autonomie variable, conçue selon un paradigme qu'ils appellent "co-embodiment" : humain et robot partagent un seul corps physique et alternent les niveaux de contrôle selon la phase de la tâche. Le système intègre une politique visuomotrice de diffusion apprise par démonstration (learning-from-demonstration), qui prend en charge la saisie autonome d'objets connus dès que l'utilisateur positionne sa main à proximité. Une fois l'objet saisi, un signal indique à l'utilisateur de reprendre la main ; il commande alors l'outil (perceuse, spray, thermomètre infrarouge, briquet ou cuillère à glace) via des gestes de la tête sans contact physique. L'utilisateur conserve à tout moment un droit de veto par un geste de relâchement. Une étude avec 44 participants effectuant cinq tâches bimanuelles a donné des résultats mesurés : réduction du temps d'exécution de 23,3 % entre le premier et le dernier essai (p inférieur à 0,001, Cohen d = 0,94), taux de succès atteignant 93,6 % pour la meilleure variante de politique, et scores d'acceptabilité de 5,70/7 pour l'impression globale et 5,52/7 pour la volonté d'usage quotidien. Ce travail répond à un problème structurel des systèmes d'assistance robotique : les solutions entièrement autonomes retirent à l'utilisateur son agentivité, tandis que les systèmes entièrement pilotés à la main imposent une charge cognitive permanente. L'approche proposée tranche différemment des architectures de "shared autonomy" classiques, où le contrôle est continuellement négocié entre humain et robot dans des corps séparés : ici, le passage entre autonomie totale du robot et contrôle total de l'humain est discret et lié à la phase de la tâche, ce qui simplifie l'interface mentale pour l'utilisateur. La rapidité d'adaptation des participants (amélioration significative dès les premières répétitions) et les scores d'acceptabilité élevés plaident pour une viabilité clinique réelle, notamment dans des contextes de rééducation ou d'assistance aux personnes avec déficiences motrices unilatérales. L'intégration d'une politique de diffusion visuomotrice performante dans un dispositif portable constitue également un signal fort sur la maturité des politiques d'imitation pour des applications embarquées hors lab. Sur le plan académique, ce travail s'inscrit dans un courant actif de recherche sur les prothèses et orthèses à contrôle partagé, aux côtés de travaux comme ceux des équipes Imperial College London sur les mains myoélectriques intelligentes ou des approches "supernumerary robotic limbs" du MIT. La différence revendiquée ici est l'alternance franche d'autonomie plutôt que la fusion continue des commandes. Les concurrents industriels dans l'espace des exosquelettes de main (Bioservo, Hocoma, ou côté français Wandercraft sur les membres inférieurs) n'adressent pas encore cette logique de délégation contextuelle. L'étude reste pour l'instant un prototype de laboratoire validé en conditions contrôlées ; les prochaines étapes naturelles seraient des essais sur des populations cibles (AVC, lésions médullaires partielles) et une miniaturisation du système de détection pour réduire l'encombrement du dispositif porté.

UECe travail fournit une référence méthodologique directement applicable aux acteurs européens de l'exosquelette (Bioservo en Suède, Wandercraft en France sur les membres inférieurs) qui n'ont pas encore intégré cette logique de délégation contextuelle dans leurs dispositifs médicaux.

ExosquelettesPaper
1 source
DSP-SLAM++ : un cadre unifié pour le SLAM d'objets multi-classes haute fidélité en conditions réelles
377arXiv cs.RO 

DSP-SLAM++ : un cadre unifié pour le SLAM d'objets multi-classes haute fidélité en conditions réelles

Des chercheurs du laboratoire AUBVRL ont publié sur arXiv le 25 juin 2026 DSP-SLAM++, une extension du système DSP-SLAM conçue pour cartographier simultanément plusieurs classes d'objets en temps réel avec une fidélité géométrique élevée. Le système repose sur un pipeline de cartographie asynchrone, où le thread de mapping tourne indépendamment du thread de suivi, ce qui permet de traiter des séquences multi-classes à 25 Hz sans bloquer l'ensemble du pipeline. Couplé à une suite sensorielle fisheye monoculaire et LiDAR, DSP-SLAM++ réduit la latence maximale de traitement des objets jusqu'à 70 % par rapport à la baseline DSP-SLAM d'origine, tout en produisant des reconstructions 3D géométriquement complètes pour chaque objet détecté. Le code est disponible en open source sur GitHub (AUBVRL/DSP-SLAMpp). Ce résultat compte parce que le trilemme classique du SLAM orienté objets, choisir entre temps réel, support multi-classes et fidélité des modèles 3D, restait non résolu dans les systèmes existants. Un gain de 70 % sur la latence maximale (et non sur une latence moyenne, détail important) signifie que les cas extrêmes, ceux qui gelaient le thread de cartographie sur des scènes denses, sont maîtrisés. Pour un intégrateur qui équipe un véhicule autonome ou un bras de manipulation, c'est la différence entre un système testé en labo et un système opérationnel sur plateforme embarquée réelle. L'adaptation fisheye-LiDAR est également stratégique : ce binôme est devenu la configuration standard en robotique terrain et en conduite autonome niveau 2-3, là où les caméras rectilignes coûtent en champ de vue. DSP-SLAM, le prédécesseur direct, était lui-même une extension de SuperPoint SLAM publiée autour de 2021-2022 et avait démontré la viabilité des représentations implicites par réseaux de formes (DeepSDF-style) pour le SLAM objet, mais butait sur les performances en environnements multi-classes et multi-capteurs. Dans l'espace concurrent, on trouve EAO-SLAM, OrcVIO ou encore les approches NeRF-SLAM (iMAP, NICE-SLAM), qui privilégient la reconstruction de scènes complètes au détriment de la sémantique par objet. DSP-SLAM++ se positionne donc sur le créneau précis de la granularité objet à haute fidélité en temps réel, créneau directement utile pour la manipulation robotique (pick-and-place avec modèle 3D précis) et la détection d'obstacles typés en conduite autonome. Les prochaines étapes logiques incluent l'extension à des classes ouvertes via des fondations visuelles (SAM, DINO) et les tests sur plateformes embarquées contraintes comme Jetson Orin.

UELe code open source disponible sur GitHub est directement exploitable par les intégrateurs européens en robotique terrain et conduite autonome, sans dépendance commerciale envers un fournisseur tiers.

RecherchePaper
1 source
Commerge : fusion de cartes LiDAR économe, robuste et rapide pour la coordination multi-robots sous contraintes
378arXiv cs.RO 

Commerge : fusion de cartes LiDAR économe, robuste et rapide pour la coordination multi-robots sous contraintes

Une équipe du SPARO Lab publie Commerge (arXiv:2606.25386), un framework de fusion de cartes LiDAR conçu pour des essaims de robots opérant dans des environnements à bande passante limitée, capable de réduire le volume de données échangées entre robots jusqu'à 5 000 fois sans dégradation notable de la précision d'alignement. Sur le jeu de données HeLiPR, le volume transmis passe de 7 000 Mo à 1,3 Mo, soit une réduction de 99,98%. L'architecture repose sur une optimisation cascadée en trois étapes appliquée à un graphe d'échange, où les sommets représentent les keyframes de chaque robot et les arêtes les boucles inter-robots candidates. Ce pipeline identifie le sous-ensemble minimal de scans LiDAR, séquentiellement chevauchants et géométriquement pertinents, qui préserve la cohérence globale de la carte tout en minimisant le coût de transmission. L'évaluation porte sur neuf jeux de données (cinq publics, quatre propriétaires) couvrant des environnements de grotte, d'analogues planétaires, intérieurs et de campus extérieurs, sur des plateformes allant de l'embarqué au poste de travail. Le goulot d'étranglement communicationnel est l'obstacle central au déploiement de flottes de robots mobiles en environnement dégradé : sous-sol minier, tunnels, exploration spatiale ou entrepôts à couverture WiFi partielle. Les approches existantes imposaient un choix binaire entre transmettre l'intégralité des scans (échelle GB, infaisable sur lien bas débit) et un sous-échantillonnage naïf qui détériore la précision d'alignement. Commerge invalide ce compromis en montrant qu'un sous-ensemble sélectionné par théorie des graphes suffit à maintenir la qualité de fusion. Pour un intégrateur ou un COO industriel, cela ouvre la voie à des flottes d'AMR LiDAR capables de construire une carte globale cohérente sur des réseaux contraints (4G dégradé, radio maillée, liaison satellitaire) sans surcharge d'infrastructure. La fusion de cartes LiDAR multi-robots s'inscrit dans le champ du SLAM collaboratif, domaine actif depuis une décennie mais historiquement conditionné à des hypothèses de connectivité peu réalistes, que des travaux comme COVINS, DiSCo-SLAM et Swarm-SLAM ont progressivement atténuées sans résoudre la contrainte de bande passante. Commerge comble directement cet angle mort, avec du code et des matériaux disponibles sur sparolab.github.io/research/commerge. Les prochaines étapes naturelles incluront la validation dans des déploiements réels souterrains ou extraterrestres, contextes où Boston Dynamics, Clearpath Robotics et le programme DARPA SubT ont identifié la communication comme verrou systémique.

RecherchePaper
1 source
Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique
379arXiv cs.RO 

Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique

Des chercheurs ont publié le 24 juin 2026 sur arXiv (référence 2606.24208) une méthode visant à corriger un angle mort des politiques robotiques génératives : les sorties produites par les modèles de diffusion peuvent être statistiquement valides mais physiquement infaisables. En pratique, un modèle génératif de haute qualité peut planifier une saisie (grasp), un waypoint ou une trajectoire qui viole des contraintes d'atteignabilité (reachability), d'évitement de collision ou d'exécutabilité en boucle fermée, rendant le déploiement direct sur robot impossible. Les auteurs proposent un cadre d'optimisation à l'inférence qui formule le guidage diffusionnel comme un problème d'optimisation sous contraintes. La clé : remplacer la perturbation d'échantillonnage dans le processus de débruitage (backward process) par une correction optimisée, ce qui permet d'imposer des contraintes dures ou souples lors du sampling sans ré-entraîner le modèle. Évalué sur la synthèse de saisies dextères avec contraintes de reachability et d'évitement de collision, et sur la manipulation dynamique avec contraintes de suivi au niveau contrôleur, la méthode améliore le taux de succès jusqu'à 20 points de pourcentage sur la saisie dextère et 23 points de pourcentage sur la manipulation visuomotrice par rapport à la meilleure baseline testée. L'enjeu est ce que les auteurs nomment l'"embodiment gap" : une politique entraînée dans un espace de tâches générique peut produire des comportements conceptuellement transférables, mais leur exécution sur un corps physique spécifique échoue faute de contraintes cinématiques ou dynamiques respectées. Pour les intégrateurs et les OEM robotiques, cela signifie que les modèles généralistes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ne peuvent pas être déployés tels quels sur n'importe quel bras ou manipulateur sans couche d'adaptation. L'approche proposée ici opère uniquement en temps d'inférence, sans modification des poids du modèle, ce qui réduit drastiquement le coût d'adaptation à un nouvel embodiment et la rend potentiellement intégrable dans des pipelines existants sans refonte de l'architecture. Le travail s'inscrit dans la dynamique des politiques de diffusion en robotique, initiée notamment par Diffusion Policy (Chi et al., 2023) et prolongée par les architectures VLA de nouvelle génération. Les méthodes concurrentes de guidage par gradient (gradient guidance) et de projection constituent les baselines, et la méthode proposée les surpasse en préservant mieux la qualité des saisies tout en augmentant l'exécutabilité au niveau contrôleur. Dans un secteur où Physical Intelligence, Covariant ou 1X Technologies misent sur des politiques génératives à grande échelle pour atteindre la généralisation inter-robots, cette approche d'optimisation à l'inférence offre un levier d'adaptation pragmatique sans nécessiter de nouvelles données d'entraînement ni de fine-tuning coûteux.

RechercheActu
1 source
G³VLA : biais inductif géométrique pour les modèles vision-langage-action (VLA)
380arXiv cs.RO 

G³VLA : biais inductif géométrique pour les modèles vision-langage-action (VLA)

Un preprint arXiv déposé fin juin 2026 présente G³VLA, un module géométrique plug-in pour les modèles VLA (Vision-Language-Action), conçu pour corriger un angle mort structurel de ces architectures : leurs tokens visuels sont encodés en coordonnées image 2D, sans exploiter la géométrie calibrée des caméras du robot. Dans les configurations multi-caméras, où intrinsèques et extrinsèques sont pourtant parfaitement connus, les vues sont traitées comme des images indépendantes, effaçant toute information de profondeur et de position relative. G³VLA injecte cette géométrie calibrée via trois composantes : des ray embeddings conditionnés sur les paramètres intrinsèques, un encodage positionnel projectif baptisé PRoPE, et une fusion cross-view bidirectionnelle. Aucun capteur de profondeur n'est requis : la supervision géométrique s'appuie soit sur des point maps ground-truth, soit sur des prédictions du modèle π³X filtrées par seuil de confiance. Le module a été instancié sur π₀ (Physical Intelligence) puis validé sur π₀.₅ et GR00T 1.5 de NVIDIA, avec des évaluations sur les suites LIBERO, RoboCasa24, RoboTwin2.0 et sur robot réel. Les gains obtenus sont réguliers sur l'ensemble des benchmarks, les améliorations les plus prononcées concernant les tâches dites spatialement sensibles : manipulation d'objets proches, désambiguïsation de positions relatives, réponse à des instructions impliquant des relations 3D précises. Pour un intégrateur ou un décideur industriel, le point central est la compatibilité : G³VLA s'ajoute sans modifier l'espace d'action ni l'objectif d'imitation du VLA hôte, le rendant portable vers des systèmes existants sans réentraînement complet. L'analyse comparative sur GR00T 1.5 livre un enseignement architectural : le transfert de géométrie est maximal quand les tokens géométriques ont accès direct au pathway de génération d'actions, et non positionnés en périphérie du flux. G³VLA s'inscrit dans la recherche post-RT-2 autour des VLA généralistes, portée par Physical Intelligence avec π₀ (2024) et NVIDIA avec la famille GR00T (N1, N2, 1.5). Ces modèles ont prouvé une généralisation hors distribution convaincante, mais leur faiblesse reconnue reste la précision spatiale fine, là où les réseaux end-to-end apprennent des heuristiques visuelles sans véritable compréhension 3D. Des travaux concurrents comme SpatialVLA (2025) explorent des voies similaires d'injection de géométrie. Du côté européen, des acteurs spécialisés dans la manipulation de précision, comme Enchanted Tools ou Wandercraft, pourraient tirer parti de ce type de module si intégré dans des VLAs open-source. Le code source n'est pas encore disponible, mais une page projet en ligne laisse anticiper une publication prochaine.

UEDes équipes françaises spécialisées en manipulation de précision, comme Enchanted Tools ou Wandercraft, pourraient intégrer ce module géométrique dans leurs pipelines VLA open-source pour améliorer la précision spatiale fine de leurs robots, dès la publication du code source.

💬 Les VLA passent à côté d'informations géométriques que les caméras calibrées donnent pourtant gratuitement, et ça se paie en précision spatiale. G³VLA corrige ça en plug-in, sans modifier l'espace d'action ni forcer un réentraînement, ce qui le rend applicable à des systèmes déjà en production. Reste à voir si Enchanted Tools ou Wandercraft suivent dès que le code sort.

IA physiqueOpinion
1 source
TEXEDO : mise à l'échelle à l'inférence pour la génération de mouvements humanoïdes guidée par le langage et le contrôleur
381arXiv cs.RO 

TEXEDO : mise à l'échelle à l'inférence pour la génération de mouvements humanoïdes guidée par le langage et le contrôleur

Des chercheurs ont publié TEXEDO, un cadre d'inférence pour améliorer la génération de mouvements de robots humanoïdes guidée par texte, sans réentraîner le modèle sous-jacent. Présenté sur arXiv (2606.22998) et validé en déploiement réel sur un Unitree G1, le système génère plusieurs mouvements candidats à partir d'un prompt textuel, puis sélectionne le meilleur via un modèle de récompense à deux composantes : un vérificateur de faisabilité dynamique, distillé depuis des simulations de contrôleurs whole-body pour prédire l'exécutabilité physique, et un vérificateur d'alignement sémantique dans un espace d'embedding partagé texte-mouvement. La faisabilité physique est imposée comme contrainte dure ; l'alignement sémantique sert d'objectif de sélection parmi les candidats valides. Les résultats montrent des améliorations en fidélité de tracking et en cohérence textuelle, en simulation comme sur le G1 en conditions réelles. Ce travail adresse une limite structurelle des générateurs actuels : entraînés sur des données de mouvements humains re-ciblés vers des morphologies robotiques, ils ignorent les contraintes propres aux contrôleurs physiques réels, équilibre, dynamiques de contact, limites d'actuation, modes de défaillance spécifiques à chaque plateforme. Des mouvements "sémantiquement plausibles" s'avèrent ainsi souvent inexécutables sur le matériel, un écart bien documenté dans la communauté robotique. TEXEDO applique à la génération de mouvements le principe de "test-time compute scaling" popularisé par les LLMs de type o1 ou o3 : allouer du calcul supplémentaire à l'inférence plutôt qu'au réentraînement. Pour un intégrateur ou un ingénieur robotique, cela signifie qu'un générateur existant peut être amélioré en déploiement sans pipeline de fine-tuning coûteux, ce qui est un argument pratique solide. TEXEDO s'inscrit dans la compétition autour de la programmation des robots par langage naturel, face à des approches VLA (Vision-Language-Action) end-to-end comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La distinction clé est que TEXEDO cible exclusivement la couche de génération de mouvements, en amont du contrôleur, sans chercher à unifier perception, langage et action dans un seul modèle. Le Unitree G1, humanoïde commercial répandu dans les labos de recherche autour de 16 000 dollars, sert ici de banc de test réel, ce qui renforce la portée des résultats par rapport à des évaluations purement simulées. La suite logique serait d'étendre le cadre à d'autres plateformes humanoïdes et d'autres familles de générateurs préentraînés.

💬 Le test-time compute scaling arrive en robotique physique, et c'est une direction que j'attendais : tu peux améliorer un générateur de mouvements existant à l'inférence, sans pipeline de fine-tuning, ce que les approches VLA end-to-end comme pi-0 ne proposent pas. Validé sur un vrai G1, pas en sim. Reste à voir si ça généralise à d'autres plateformes.

IA physiqueOpinion
1 source
Le coût d'évaluation de la spécialisation des tâches dans les systèmes multi-robots évolutionnaires
382arXiv cs.RO 

Le coût d'évaluation de la spécialisation des tâches dans les systèmes multi-robots évolutionnaires

Une équipe de chercheurs publie sur arXiv (réf. 2606.24191, juin 2026) une analyse coût-bénéfice de l'optimisation évolutionnaire appliquée aux systèmes multi-robots (MRS). Le scénario de référence est le "foraging", une tâche de collecte distribuée simulée dans un environnement physique numérique. Le problème central tient à la répartition du budget d'évaluation : faire émerger des contrôleurs spécialisés par sous-tâche oblige à fragmenter les itérations de simulation, tandis qu'un contrôleur généraliste bénéficie de la totalité du budget pour s'optimiser. Les chercheurs mesurent à partir de quelle taille de flotte les spécialistes finissent par surpasser les généralistes malgré ce handicap budgétaire. Résultat principal : plus la flotte est grande, plus le budget total nécessaire pour que la spécialisation devienne avantageuse diminue, ce qui plaide pour des architectures différenciées dans les grands déploiements. Cette conclusion a une portée concrète pour les intégrateurs de solutions multi-robots en logistique, agriculture ou industrie manufacturière, où les flottes comptent couramment plusieurs dizaines voire centaines d'unités. Elle quantifie formellement un arbitrage jusqu'ici guidé par l'intuition : la division du travail robotique devient économiquement justifiée à l'échelle, et les coûts de simulation pour concevoir des agents spécialisés se réduisent à mesure que la flotte grandit. Le résultat nuance aussi un dogme dominant du swarm robotics, qui favorise l'homogénéité pour des raisons de résilience et de maintenabilité. À noter que la publication ne fournit pas encore de seuil de taille de flotte chiffré précis ni de comparaison quantitative entre architectures, réserves habituelles d'un preprint arXiv en attente de peer review. La spécialisation par évolution computationnelle dans les MRS s'appuie sur deux décennies de recherche en systèmes bio-inspirés, des travaux fondateurs de Marco Dorigo sur les essaims jusqu'aux approches modernes couplant algorithmes génétiques et apprentissage par renforcement. En parallèle, les acteurs industriels comme Exotec (AMR d'entrepôt, France) ou 6 River Systems allouent des rôles différenciés à leurs flottes par règles expertes ou RL centralisé, sans recourir à l'évolution simulée. Ce travail renforce la légitimité de l'approche évolutionnaire pour les grandes flottes hétérogènes et apporte un cadre analytique là où les ingénieurs arbitrent aujourd'hui à l'intuition. Les suites attendues incluent une validation sur robots physiques, l'extension à des architectures de tâches plus complexes que le foraging binaire, et une évaluation sur des flottes de taille industrielle réelle.

UELes intégrateurs européens de flottes multi-robots (logistique, industrie manufacturière) disposent d'un cadre analytique formel pour justifier une architecture spécialisée à grande échelle, Exotec, acteur français des AMR d'entrepôt, étant cité comme exemple industriel directement concerné.

RecherchePaper
1 source
Tri-Info : prédiction d'échec généralisable et interprétable pour les modèles VLA par la théorie de l'information
383arXiv cs.RO 

Tri-Info : prédiction d'échec généralisable et interprétable pour les modèles VLA par la théorie de l'information

Une équipe de chercheurs a publié en juin 2026, via arXiv (arXiv:2606.19998), une méthode appelée Tri-Info (Triple Information-theoretic signals) pour détecter automatiquement les défaillances des modèles VLA (Vision-Language-Action) avant qu'ils ne causent des dommages irréversibles dans des environnements physiques. Testée sur six modèles VLA distincts et trois environnements de benchmark, Tri-Info atteint 83 % de précision sur des tâches en conditions réelles, là où les détecteurs existants s'effondrent au niveau du hasard. La méthode repose sur trois signaux dérivés de la théorie de l'information : la diversité des actions générées par le modèle, leur cohérence temporelle, et leur couplage aux transitions d'état observées dans l'environnement. Cruciale pour les déploiements industriels, Tri-Info ne nécessite aucun réentraînement pour fonctionner sur de nouvelles architectures ou dans de nouveaux environnements, y compris lors du passage simulation-vers-réel (sim-to-real). Ce résultat est directement pertinent pour les intégrateurs qui déploient des robots manipulateurs ou humanoïdes pilotés par des VLA comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). L'opacité de ces modèles constitue un risque opérationnel concret : un VLA peut échouer silencieusement, entraînant une collision, une chute d'objet ou l'interruption d'un cycle de production. Tri-Info ajoute une couche de supervision interprétable capable de distinguer trois classes de défaillances (manque de diversité, incohérence temporelle, découplage état-action), ce qui facilite le diagnostic post-incident. Sa transférabilité sans réentraînement est stratégiquement importante : elle permet d'intégrer la détection sur des systèmes déjà déployés sans modifier le pipeline existant. Ce travail s'inscrit dans une course à l'industrialisation des VLA accélérée depuis fin 2024 avec les sorties de Pi-0 et d'OpenVLA, et les travaux de Google DeepMind sur RT-2 et ses successeurs. Le sim-to-real gap reste l'un des principaux freins à leur généralisation, la plupart des systèmes de détection entraînés en simulation perdant leur efficacité en conditions réelles. Tri-Info est à ce stade un preprint non encore revu par les pairs, et ses performances n'ont pas été reproduites de manière indépendante. Si elles se confirment, la méthode pourrait s'imposer comme une brique de sécurité standard dans les pipelines de déploiement robotique fondés sur des VLA.

RechercheOpinion
1 source
Simuler la locomotion robotique dans le sable : la théorie des forces résistives dans un moteur physique open source
384arXiv cs.RO 

Simuler la locomotion robotique dans le sable : la théorie des forces résistives dans un moteur physique open source

Des chercheurs ont intégré la théorie de la force résistive tridimensionnelle (3D RFT) dans le moteur de simulation physique MuJoCo, comblant un angle mort persistant des outils de robotique open-source. La 3D RFT permet d'approximer les forces de réaction du sol lors de la locomotion en milieu granulaire (sable, gravier fin) sans simuler l'interaction avec chaque grain individuellement, ce qui constitue l'approche classique par éléments discrets (DEM), prohibitive en temps de calcul. Les auteurs ont validé leur implémentation sur un robot hexapode à 12 degrés de liberté évoluant en bac à sable : la simulation prédit la distance parcourue et l'enfoncement des pattes à moins de 20 % des valeurs mesurées expérimentalement, avec des tendances cohérentes selon la forme de l'effecteur, la vitesse de déplacement et la charge appliquée. Les travaux sont publiés sur arXiv (2606.19504) et le code est rendu disponible en open source. L'impact pratique est significatif pour les équipes qui développent des robots mobiles destinés à évoluer hors piste. Jusqu'ici, simuler fiablement la locomotion sur sol meuble imposait soit des moteurs DEM spécialisés (CHRONO, LIGGGHTS) avec des temps de calcul rédhibitoires pour l'apprentissage par renforcement, soit des approximations ad hoc peu transférables. Intégrer la RFT directement dans MuJoCo, l'environnement de référence pour l'entraînement de politiques de locomotion, ouvre une voie crédible vers le sim-to-real sur substrats granulaires. La précision de 20 % est honnête pour une approximation analytique et constitue une base exploitable pour l'optimisation de design ou le pré-entraînement de contrôleurs, même si elle reste insuffisante pour garantir un transfert direct sans recalibration. La RFT granulaire a été initialement développée dans les laboratoires de Daniel Goldman (Georgia Tech) pour étudier la locomotion animale dans le sable, avant d'être étendue aux systèmes robotiques. MuJoCo, racheté par DeepMind en 2021 et passé open-source la même année, est aujourd'hui le moteur dominant pour l'entraînement de politiques de locomotion humanoïde et quadrupède chez Figure, Boston Dynamics ou Unitree. Les débouchés concrets de ce travail concernent les rovers planétaires (JPL, ESA), les robots agricoles évoluant en sol labouré, et les plateformes de recherche et sauvetage en milieu sableux. La prochaine étape logique sera l'extension aux substrats hétérogènes et l'intégration dans des pipelines d'apprentissage par renforcement standard pour valider le gain sim-to-real à l'échelle.

RecherchePaper
1 source
Mouvement primitif en robotique : une étude approfondie
385arXiv cs.RO 

Mouvement primitif en robotique : une étude approfondie

Publiée sur arXiv sous l'identifiant 2601.02379v2, une revue encyclopédique sur les movement primitives en robotique recense et compare l'ensemble des cadres théoriques développés ces trente dernières années pour représenter les trajectoires de contrôle de robots à partir de démonstrations humaines. Ces primitives de mouvement, blocs élémentaires de motion analogues aux phonèmes du langage, permettent à un système autonome de décomposer un geste complexe en segments réutilisables et recombinables. Les approches couvertes incluent les Dynamic Movement Primitives (DMP), formulés comme des systèmes dynamiques de type amortisseur-ressort, les Probabilistic Movement Primitives (ProMP) couplant statistiquement plusieurs démonstrations, et les extensions neuronales adaptées aux espaces d'état de haute dimension. La revue présente ces frameworks en ordre chronologique, évalue leurs forces et faiblesses, et identifie des applications concrètes : saisie d'objets, mouvements balistiques, enchaînements de tâches en manipulation robotique. Pour les praticiens (intégrateurs, équipes R&D en manipulation, COO industriels), cette synthèse positionne les primitives de mouvement comme une couche intermédiaire critique entre démonstration brute et politique généraliste de bout en bout. Elles permettent le transfert de compétences motrices sans rejeu complet des données d'entraînement et restent interprétables, contrairement aux architectures VLA (Vision-Language-Action) comme π0 de Physical Intelligence ou OpenVLA. La revue souligne en particulier des défis non résolus que ces dernières n'ont pas encore surmontés à l'échelle industrielle : segmentation automatique des démonstrations, passage à l'échelle en environnements non structurés, et couplage de contraintes en temps réel. Les primitives de mouvement ont émergé au début des années 2000 avec les travaux d'Auke Ijspeert, Jun Nakanishi et Stefan Schaal sur les DMP, puis étendues par Paraschos et al. avec les ProMP en 2013. Le champ s'est depuis fragmenté en nombreuses variantes sans synthèse unifiée. Face aux approches purement neuronales (ACT, Diffusion Policy) popularisées par les groupes de Sergey Levine et Chelsea Finn, les primitives se repositionnent comme solution modulaire et interprétable. Les auteurs identifient leur intégration dans des architectures de type foundation model pour la robotique comme prochaine étape structurante, un axe qui mobilise des acteurs aux États-Unis (Boston Dynamics AI Institute, CMU) comme en Europe (DLR, LAAS-CNRS).

UELAAS-CNRS est explicitement identifié comme un acteur européen clé sur l'intégration des primitives de mouvement dans les architectures foundation model pour la robotique, ce qui positionne la recherche française au cœur d'un axe stratégique face aux approches VLA purement neuronales.

RecherchePaper
1 source
Bien partir pour bien arriver : exécution asynchrone par sélection du bruit initial
386arXiv cs.RO 

Bien partir pour bien arriver : exécution asynchrone par sélection du bruit initial

Des chercheurs ont publié sur arXiv (2606.19774) une méthode baptisée PAINT, destinée à éliminer les discontinuités de mouvement dans les robots contrôlés par des politiques basées sur le flow matching. Le problème ciblé est l'exécution asynchrone dans le cadre de l'action chunking : pendant qu'un robot exécute une séquence d'actions prédéfinie (le "chunk" courant), la politique génère le chunk suivant ; si cette génération prend trop de temps, les deux séquences se raccordent mal, créant des à-coups visibles. PAINT résout ce problème non pas en corrigeant la trajectoire de génération en cours, mais en sélectionnant le bruit initial optimal avant que la génération commence, requalifiant ainsi le problème de guidage de trajectoire en problème de sélection de bruit. La méthode utilise une inversion d'Euler backward pour identifier ce bruit de départ, puis applique une règle de "repainting" pour construire le chunk final cohérent avec le préfixe déjà exécuté. Aucun gradient, aucun réentraînement ni modification de la politique existante ne sont requis. Les auteurs rapportent des améliorations sur 12 benchmarks simulés et 6 tâches de manipulation réelles, couvrant des bras simples, des systèmes bimanaux et des robots humanoïdes. L'enjeu pour les équipes robotique est concret : une méthode training-free s'applique directement à n'importe quelle politique flow-based déjà entraînée, sans coût de réentraînement. Pour les déploiements industriels, où l'action chunking est prisé précisément parce qu'il améliore la cohérence temporelle des mouvements, les discontinuités aux frontières de chunks sont un frein réel à la cadence de production. PAINT adresse ce goulot sans toucher à l'architecture ni aux poids du modèle. La validation sur des embodiments variés, du bras simple à l'humanoïde, renforce la généralité revendiquée, même si les 12 benchmarks simulés restent des conditions contrôlées dont la portée terrain reste à confirmer sur des lignes de production réelles. L'action chunking a été popularisé par ACT (Zhao et al., 2023) et le Diffusion Policy (Chi et al., 2023), avant d'être adopté dans des modèles VLA plus récents comme π0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les méthodes concurrentes pour gérer la latence asynchrone s'appuient sur un guidage ou recadrage de la trajectoire de génération, approches qui nécessitent des gradients ou des modifications du modèle. PAINT se positionne comme une alternative légère dans cet espace. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé ; la publication reste au stade de la recherche académique, avec un site de démonstration accessible.

RecherchePaper
1 source
Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs
387arXiv cs.RO 

Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs

Des chercheurs ont publié en juin 2026 (arXiv:2606.18747) un système permettant au robot humanoïde Pepper de générer des gestes co-verbaux naturels à l'exécution, sans recours à des animations préprogrammées. L'architecture combine ChatGPT pour la génération de code gestuel en langage naturel, couplée à un pipeline d'apprentissage par renforcement à partir de retours humains (RLHF) appliqué de manière itérative. Des utilisateurs évaluent les gestes produits par Pepper lors d'une étude comparative, ces préférences servant de signal de récompense pour affiner le modèle de langage. Résultat annoncé : des mouvements jugés plus expressifs, pertinents et fluides qu'avec le seul pipeline LLM de base. L'enjeu est significatif pour les intégrateurs de robots sociaux. Aujourd'hui, la quasi-totalité des comportements gestuels déployés en production repose sur des bibliothèques d'animations conçues à la main par des experts, ce qui rend les robots rigides face à des contextes conversationnels imprévus. Les approches par apprentissage automatique peinent à capturer la naturalité perçue, un critère subjectif qui se dégrade à mesure que le nombre de degrés de liberté augmente. Ce travail propose une alternative concrète : utiliser un LLM comme générateur de comportements moteurs au runtime, puis le corriger via RLHF pour coller aux préférences réelles des utilisateurs. C'est une transposition directe de la méthode qui a rendu ChatGPT lui-même plus utile, appliquée ici au domaine de la communication non verbale humain-robot. Les résultats restent néanmoins issus d'une étude utilisateur contrôlée, pas d'un déploiement à grande échelle. Pepper est le robot social d'Aldebaran Robotics, société française rachetée par SoftBank en 2012, aujourd'hui commercialisé dans les secteurs retail, accueil et éducation. Après une phase de déception commerciale liée précisément à la rigidité comportementale du robot, plusieurs équipes académiques cherchent à relancer son potentiel via des couches IA génératives. Sur ce terrain, Pepper fait face à une concurrence croissante des agents conversationnels incarnés (avatars AR/VR) et de nouvelles plateformes comme Enchanted Tools (France) avec son robot Miroki, conçu dès l'origine pour une expressivité naturelle. La prochaine étape logique serait un déploiement en contexte réel pour mesurer le gap entre l'évaluation en laboratoire et l'acceptation en environnement ouvert, une question que les auteurs n'adressent pas encore.

UEDes travaux académiques sur Pepper (Aldebaran, origine française rachetée par SoftBank) appliquant l'RLHF à la gestualité co-verbale ouvrent une voie concrète pour réhabiliter cette plateforme en production, dans un contexte où Enchanted Tools (France) cherche à s'imposer sur le segment des robots sociaux expressifs avec Miroki.

FR/EU ecosystemePaper
1 source
Les modèles VLA maîtrisent-ils les bases ? Évaluation de la rétention du sens commun et des connaissances du monde
388arXiv cs.RO 

Les modèles VLA maîtrisent-ils les bases ? Évaluation de la rétention du sens commun et des connaissances du monde

Une équipe de recherche a publié sur arXiv (arXiv:2606.19297) un protocole d'évaluation baptisé Act2Answer, conçu pour mesurer objectivement combien de connaissances de sens commun et de savoirs factuels les modèles Vision-Language-Action (VLA) conservent après leur fine-tuning sur des données robotiques. Le protocole transforme les benchmarks classiques d'évaluation de modèles de langage visuels (VLM) en épisodes tabulaires courts : l'agent doit répondre à une question en plaçant physiquement un objet parmi plusieurs candidats sur une surface, ce qui ancre l'évaluation dans une action réelle plutôt que dans un output textuel. L'étude couvre 7 modèles VLA et 9 modèles VLM de référence, testés sur une suite de scénarios couvrant plusieurs catégories de connaissances. À cela s'ajoute une technique de sondage couche par couche (layerwise intent probing) pour localiser où l'information pertinente à la réponse est encodée dans le backbone VLM et la tête d'action. Les résultats révèlent une dégradation systématique, mais inégale, des connaissances après adaptation robotique. Les VLA maintiennent des performances solides sur les concepts simples, mais accusent des écarts significatifs sur les catégories sémantiquement plus riches par rapport à leurs VLM d'origine. Autrement dit, le fine-tuning robotique érode préférentiellement les représentations de haut niveau, celles qui portent le raisonnement nuancé. Le probing couche par couche montre que les signaux pertinents culminent dans les couches intermédiaires du réseau, puis s'atténuent dans les couches supérieures, ce qui suggère que la tête d'action interfère avec la propagation des connaissances sémantiques. Fait notable : l'entraînement conjoint avec des données VQA (Visual Question Answering) est associé à une meilleure rétention des connaissances, ouvrant une piste concrète pour les architectures futures. L'outil résout aussi un problème méthodologique persistant : il devient difficile de distinguer un échec dû à une connaissance absente d'un échec de contrôle moteur de bas niveau. Act2Answer s'inscrit dans un débat plus large sur le sim-to-real gap et la robustesse des VLA en déploiement industriel. Les modèles VLA actuels, comme Pi-0 (Physical Intelligence), OpenVLA, ou les architectures dérivées de modèles comme LLaVA et Qwen-VL, héritent de VLMs préentraînés sur des corpus massifs, puis sont spécialisés sur des datasets robotiques relativement restreints. La question de la rétention des connaissances est directement pertinente pour les intégrateurs qui misent sur ces modèles pour des tâches impliquant une compréhension contextuelle du monde réel, au-delà du simple pick-and-place. Aucun acteur européen n'est mentionné dans l'étude. Le code et les environnements Act2Answer sont disponibles publiquement, ce qui permettra à d'autres équipes de compléter les comparaisons avec d'autres architectures et de tester l'impact de stratégies d'entraînement alternatives.

UELes équipes de recherche et les intégrateurs européens travaillant sur les VLA peuvent exploiter le benchmark Act2Answer (code public) pour évaluer la rétention de connaissances de leurs modèles et tester la stratégie d'entraînement conjoint VQA.

RechercheOpinion
1 source
HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique
389arXiv cs.RO 

HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique

Une équipe de chercheurs a publié HT-Bench, un benchmark à grande échelle destiné à évaluer les représentations tactiles main entière dans la manipulation robotique dextre, avec un dataset de 10 millions de trames RGB et 7,8 millions de trames tactiles collectées sur 226 tâches distinctes. La publication (arXiv:2606.19161, juin 2026) propose une approche centrée sur la vision égocentrique couplée à des capteurs tactiles couvrant l'intégralité de la main robotique. Le benchmark structure l'évaluation autour de quatre tâches : récupération de similarité tactile fine, inpainting de trames masquées, synthèse vision-vers-tactile, et prédiction multimodale de trames tactiles. En parallèle, les auteurs introduisent HandTouch, un encodeur vision-tactile à quantification vectorielle (VQ), entraîné selon trois phases progressives : spatiale, cross-modale et temporelle. Les gains quantitatifs de HandTouch sur HT-Bench sont nets : le Recall@5 en récupération de similarité tactile passe de 74,65 % à 85,23 %, l'erreur quadratique moyenne (RMSE) en inpainting chute de 0,022 à 0,010, et le score cIoU hors-distribution (OOD) en synthèse vision-tactile progresse de 0,628 à 0,705. Pour l'industrie robotique, cela valide une hypothèse structurante : coupler vision égocentrique et retour tactile main entière constitue une base d'apprentissage généralisable, sans exiger des capteurs ou des embodiments standardisés. C'est un signal concret pour les intégrateurs et équipes R&D travaillant sur la manipulation dextre en environnements non structurés, où percevoir l'état d'une prise sans vision directe reste un verrou majeur. Le domaine du tactile en robotique souffre depuis longtemps d'une fragmentation des formats de capteurs et des protocoles, rendant les comparaisons entre travaux difficiles. HT-Bench s'inscrit dans une dynamique de benchmarking qui émerge en 2025-2026, aux côtés d'initiatives comme RoboSet, DROID ou LIBERO pour la manipulation généraliste. Des laboratoires comme le CMU Robotics Institute et le MIT CSAIL, ainsi que des entreprises comme Sanctuary AI, explorent des approches similaires de fusion tactile-visuelle. Aucun acteur européen n'est directement cité dans ce travail, mais des startups comme Enchanted Tools ou Wandercraft, actives sur la manipulation avancée, pourraient tirer parti d'un tel benchmark pour standardiser leurs évaluations internes. L'étape suivante logique serait l'intégration de HandTouch dans des pipelines VLA (Vision-Language-Action), où le retour tactile reste aujourd'hui largement absent.

RecherchePaper
1 source
DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent
390arXiv cs.RO 

DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent

DREAM-Chunk (arXiv:2606.18589, juin 2026) est une méthode d'inférence conçue pour corriger une fragilité structurelle des modèles vision-language-action (VLA) : l'exécution en boucle ouverte lors de l'action chunking. Ce paradigme, devenu standard dans les VLA actuels, consiste à inférer à basse fréquence un bloc d'actions (un "chunk") que le robot exécute séquentiellement à haute fréquence, sans rétroaction intermédiaire. Dès qu'un chunk est lancé, le robot le suit à l'aveugle, vulnérable aux perturbations dynamiques, aux erreurs matérielles et à l'observabilité partielle. DREAM-Chunk adresse ce problème sans modifier ni réentraîner la politique sous-jacente : à l'inférence, il génère plusieurs chunks candidats, simule leurs trajectoires dans un espace latent via un world model léger, et sélectionne celui dont l'état prédit correspond le mieux à l'observation réelle. La méthode est validée sur le benchmark Kinetix et sur quatre tâches de manipulation couvrant deux plateformes robotiques et deux architectures VLA distinctes. L'intérêt pratique est direct pour les intégrateurs industriels qui déploient des VLA pré-entraînés sans accès au pipeline d'entraînement : DREAM-Chunk s'insère comme une couche plug-and-play, sans fine-tuning requis. La méthode s'inscrit dans la tendance du test-time compute scaling, bien établie côté LLM mais encore naissante en robotique physique, où dépenser davantage de calcul à l'inférence peut compenser les limites d'un modèle sans passer par un nouveau cycle d'entraînement coûteux. Les résultats montrent que les gains augmentent avec le nombre de chunks candidats échantillonnés, et que l'avantage est particulièrement marqué lorsque les démonstrations contiennent des comportements correctifs, ce qui soulève une question pratique sur la composition des datasets de démo. Les world models latents en robotique ont une longue tradition (DREAMER, TD-MPC2, DreamerV3), mais leur couplage avec des VLA basés sur le chunking reste récent. Physical Intelligence avec pi-0, Figure AI et des équipes de Stanford, CMU et Berkeley explorent simultanément comment améliorer la robustesse en déploiement sans réentraînement complet. DREAM-Chunk se distingue par son caractère agnostique au modèle sous-jacent, ce qui facilite son adoption sur des architectures hétérogènes. La prochaine étape logique serait une validation sur des plateformes commerciales à manipulation dextre (Fourier GR1, Unitree G1) et des tâches à dynamiques hautement stochastiques comme l'assemblage de précision. Le papier ne mentionne ni partenaires industriels ni pilotes commerciaux annoncés.

💬 Le test-time compute scaling arrive enfin en robotique physique, et DREAM-Chunk en est un premier signal propre : générer des trajectoires candidates, simuler dans un espace latent, choisir la meilleure, sans toucher au modèle sous-jacent. Le chunking en boucle ouverte, c'est le point faible silencieux de tous les VLA actuels (ça marche dans 80% des cas, alors on n'en parle pas trop). Pour les intégrateurs qui déploient sans accès au pipeline d'entraînement, une couche qui corrige à l'inférence sans réentraîner, c'est la pièce manquante.

IA physiqueOpinion
1 source
RSLCPP : simulations déterministes avec ROS 2
391arXiv cs.RO 

RSLCPP : simulations déterministes avec ROS 2

Une équipe de l'Université Technique de Munich (TUM) publie RSLCPP, une bibliothèque open-source en C++ conçue pour rendre les simulations robotiques sous ROS 2 entièrement déterministes. La contribution, présentée dans un article révisé sur arXiv (arXiv:2601.07052v2), s'attaque à un problème structurel de ROS : son architecture asynchrone et multi-processus rend les résultats de simulation non reproductibles d'une machine à l'autre, voire d'une exécution à l'autre sur le même matériel. L'équipe démontre que RSLCPP produit des résultats bit-à-bit identiques sur plusieurs architectures CPU, validés sur un benchmark synthétique et sur un système robotique réel. La bibliothèque est disponible en open-source sur GitHub (TUMFTM/rslcpp). Le problème que résout RSLCPP est fondamental pour quiconque utilise ROS 2 en simulation : lorsque les temps de calcul et les latences de communication varient, l'ordre d'exécution des callbacks n'est pas garanti, ce qui compromet la reproductibilité des résultats. Pour le benchmarking scientifique et l'intégration continue (CI/CD), où la répétabilité est essentielle, cela constitue un frein réel. RSLCPP impose un ordonnancement déterministe des callbacks en combinant les nœuds ROS existants dans une routine de simulation séquentielle, sans nécessiter de modification du code source. Ce dernier point est décisif : les équipes peuvent instrumenter leurs stacks ROS existantes sans refactoring, ce qui abaisse significativement le coût d'adoption. ROS 2, maintenu par Open Robotics, est devenu le standard de facto en robotique académique et industrielle. La non-reproductibilité des simulations est un problème connu depuis des années dans la communauté, que des simulateurs comme Gazebo ou Isaac Sim de NVIDIA ont partiellement adressé via leurs propres mécanismes internes. RSLCPP se distingue en opérant directement au niveau de l'exécuteur ROS 2, rendant l'approche indépendante du simulateur physique sous-jacent et donc plus portable. La prochaine étape logique serait l'intégration dans des pipelines CI robotiques pour valider des comportements algorithmiques sans variabilité matérielle, un besoin croissant à mesure que les équipes industrielles adoptent des pratiques DevOps pour le développement robotique.

UELes équipes de R&D robotique européennes utilisant ROS 2 bénéficient d'un outil open-source issu de TUM (Allemagne) pour fiabiliser leurs pipelines CI/CD de simulation sans refactoring de code existant.

InfrastructureOpinion
1 source
HumanoidArena : évaluation de l'apprentissage corporel hiérarchique en vue égocentrique
392arXiv cs.RO 

HumanoidArena : évaluation de l'apprentissage corporel hiérarchique en vue égocentrique

Une équipe de chercheurs a déposé en juin 2026 sur arXiv (réf. 2606.17833) HumanoidArena, un environnement de simulation destiné à évaluer l'apprentissage hiérarchique du contrôle de corps entier pour robots humanoïdes. L'architecture repose sur deux niveaux : une politique haut niveau convertit la vision égocentrique embarquée, la proprioception et des instructions textuelles en une action compacte de corps entier, puis un tracker de mouvement généraliste (GMT, General Motion Tracker) exécute cette action en mouvement physiquement stable. Le benchmark propose sept tâches dites "leg-critical", des scénarios d'interaction humain-objet (HOI) ou humain-scène (HSI) où la coordination des membres inférieurs est structurellement indispensable : placement précis du pied, maintien de l'équilibre, ajustement postural et réorientation complète du corps. Les évaluations couvrent deux axes complémentaires : robustesse face aux perturbations externes et transférabilité des politiques entre différents backends GMT. Ce travail adresse un angle mort méthodologique réel : les benchmarks existants évaluent rarement l'interface entre politique haut niveau et tracker bas niveau, laissant sans réponse la question de l'exécutabilité et de la robustesse des actions intermédiaires produites sous des distributions de tâches variées. Les résultats montrent que le contrôle hiérarchique permet aux politiques d'apprendre à résoudre des interactions complexes impliquant les jambes, mais que les performances sont fortement conditionnées par le GMT utilisé. Surtout, la transférabilité inter-GMT reste fragile, ce qui nuance les hypothèses optimistes sur la modularité des systèmes humanoïdes et pose des questions concrètes aux intégrateurs souhaitant interchanger des modules de locomotion bas niveau sans réentraîner la politique haut niveau. Le benchmark s'inscrit dans un contexte de forte activité industrielle et académique : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Agility Robotics ont tous publié des démonstrations ou des déploiements pilotes entre 2024 et 2026, alimentant la course à l'apprentissage de politiques généralisables. La majorité des benchmarks du secteur privilégient la manipulation bras-main et traitent la locomotion comme un sous-problème résolu ; HumanoidArena repositionne les membres inférieurs comme acteurs à part entière dans la boucle de décision. Les prochaines étapes annoncées comprennent des expériences de transfert sim-to-real et l'intégration de modèles VLA (Vision-Language-Action) comme politiques haut niveau, deux points où l'écart entre simulation et déploiement industriel reste précisément à quantifier.

RecherchePaper
1 source
Quel point de départ pour générer des actions ? Un prior source apprenable pour les politiques robotiques génératives
393arXiv cs.RO 

Quel point de départ pour générer des actions ? Un prior source apprenable pour les politiques robotiques génératives

Une équipe de chercheurs publie sur arXiv (2606.17408) LeaP, un Learnable source Prior qui modifie le point de départ de la génération d'actions dans les politiques robotiques génératives. Là où les approches classiques comme les diffusion policies ou le flow-matching initialisent la génération depuis un bruit gaussien standard indépendant de l'état du robot, LeaP le remplace par une gaussienne diagonale conditionnée sur la proprioception, paramétrée par un MLP léger qui prédit conjointement moyenne et variance adaptative sur des action chunks. Évalué sur 15 tâches de manipulation du benchmark RoboTwin, LeaP atteint 81,6 % de taux de succès moyen, surpassant quatre baselines de référence de 6,5 à 25,5 points de pourcentage. La méthode s'applique indifféremment aux générateurs flow-matching et diffusion-bridge, avec moins de paramètres, une convergence plus rapide, et des gains confirmés en déploiement réel. L'intérêt industriel de LeaP tient à sa nature modulaire : il s'agit d'un composant drop-in qui améliore toute politique générative existante sans modifier l'architecture du générateur ni le solveur d'inférence. Pour les équipes R&D travaillant sur la manipulation robotique en contexte industriel, qu'il s'agisse d'assemblage, de tri ou de logistique, cela signifie qu'un prior appris sur l'état interne du robot réduit la charge computationnelle à l'inférence tout en améliorant la précision des gestes. La publication valide une hypothèse jusque-là sous-explorée : la distribution source est un axe de conception indépendant, au même titre que le choix du type de générateur. Initialiser la génération depuis un bruit "informé" réduit la distance que le modèle doit parcourir dans l'espace des actions, ce qui se traduit directement en précision sur des tâches millimétriques. Les politiques génératives pour la manipulation ont émergé avec les diffusion policies (Chi et al., 2023) et le flow-matching appliqué à la robotique, popularisé notamment par Pi-0 de Physical Intelligence et les architectures VLA (Vision-Language-Action). Ces approches héritent toutes du même point aveugle : une initialisation gaussienne standard issue des modèles génératifs d'image, sans justification propre à la robotique. Dans l'espace des politiques génératives pour la manipulation, les concurrents directs incluent Diffusion Policy de Columbia et MIT, les variantes flow-matching de Physical Intelligence, ainsi que les architectures embarquées dans les humanoïdes de Figure AI et Agility Robotics. Les suites attendues portent sur l'intégration de ce prior dans des architectures VLA multimodales et son évaluation sur des benchmarks industriels de plus grande diversité.

RechercheOpinion
1 source
AnnotateAnything : annotation automatique d'objets 3D pour la manipulation robotique
394arXiv cs.RO 

AnnotateAnything : annotation automatique d'objets 3D pour la manipulation robotique

Des chercheurs ont publié sur arXiv le 17 juin 2026 un framework baptisé AnnotateAnything (arXiv:2606.17446) pour annoter automatiquement des assets 3D bruts et les rendre exploitables dans des pipelines d'entraînement robotique. Le système convertit des modèles 3D passifs en assets "manipulation-ready" enrichis de labels sémantiques, physiques et interactifs sans intervention humaine, en s'appuyant sur deux pipelines complémentaires : un module de raisonnement visio-linguistique (VLM) infère les sémantiques d'objet et les contraintes d'interaction ; un second pipeline de physique, massivement parallèle, ancre ces priors dans la géométrie de chaque asset pour générer automatiquement poses de préhension, contacts dextres, waypoints d'articulation, directions d'insertion, affordances de suspension et cibles de navigation. Un système de collecte de données de simulation asynchrone s'appuie ensuite sur ces annotations pour couvrir objets, tâches et morphologies robotiques variés. L'enjeu est central : les assets 3D bruts ne contenant que de la géométrie, annoter manuellement des bibliothèques à l'échelle reste coûteux et non scalable. AnnotateAnything automatise cette étape en combinant priors sémantiques VLM et optimisation géométrique pour produire des labels physiques exécutables. Les auteurs rapportent des gains en efficacité d'annotation, en efficacité de collecte et en taux de réussite de tâches face aux pipelines existants, des résultats à prendre avec précaution puisque les benchmarks comparatifs sont ceux des auteurs eux-mêmes. Le support natif du VQA robotique et du fine-tuning d'instructions visuelles ouvre une intégration directe dans des pipelines VLA (Vision-Language-Action), paradigme dominant pour l'apprentissage de politiques généralisables à l'échelle. Ce travail s'inscrit dans une vague de recherche sur la scalabilité des données synthétiques, aux côtés de MimicGen (NVIDIA), RoboGen ou UniSim, tous ciblant la réduction du sim-to-real gap par voie simulée. La pénurie d'annotations structurées dans les assets 3D existants est un problème documenté depuis plusieurs années, faute d'alternative viable aux approches manuelles. AnnotateAnything se positionne comme infrastructure de données en amont de tout pipeline de simulation, sans cibler un robot ou un déploiement industriel précis. Les auteurs annoncent la publication du code complet, des annotations et d'un benchmark, un engagement qui, s'il est tenu, pourrait en faire une ressource partagée par la communauté ; aucun partenaire industriel ni déploiement terrain n'est mentionné à ce stade.

RechercheActu
1 source
La démonstration parfaite est un mauvais professeur : alignement robuste par segments de mouvement critiques
395arXiv cs.RO 

La démonstration parfaite est un mauvais professeur : alignement robuste par segments de mouvement critiques

Une étude publiée sur arXiv le 16 juin 2026 (réf. 2606.15587) remet en cause un postulat fondamental de l'apprentissage par imitation en robotique : les démonstrations expertes fluides ne sont pas nécessairement les meilleures données d'entraînement. Pour des tâches de manipulation fine (insertion, empilement, alignement), les chercheurs montrent qu'un opérateur habile compresse précisément les instants décisifs de correction dans une fenêtre temporelle très courte, noyant la politique apprise sous des mouvements de transit redondants et lui fournissant trop peu de supervision aux moments où la précision est déterminante. Expérimentalement, une politique entraînée sur des démonstrations fluides standard plafonne à 50,0 % de taux de succès sur ces tâches. Ce résultat a des implications directes pour les équipes qui constituent des datasets pour entraîner des modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2. Deux axes de correction sont testés. Au niveau des données, ralentir la capture autour des moments d'alignement et rééchantillonner les segments critiques améliore les performances, mais l'essentiel du gain vient de l'élargissement de la couverture des états de récupération, pas d'un simple rééquilibrage des frames existantes. Au niveau de la représentation, les auteurs introduisent STAIR (Spatio-Temporal feature As an Interface for Robot learning), un module compact qui s'intercale entre le backbone vision-langage et le réseau d'action, en distillant les dynamiques de mouvement à court horizon déjà enregistrées dans chaque trajectoire. Entraîné uniquement sur des données fluides, STAIR atteint 62,2 % de succès, contre 64,4 % pour les démonstrations délibérément ralenties. Ces travaux s'inscrivent dans une vague de recherche qui remet en question la stratégie de collecte de données pour l'imitation learning, notamment dans le sillage des politiques de diffusion (Diffusion Policy, ACT) et des architectures VLA à grande échelle. L'idée que "plus de données expertes = meilleure politique" est directement challengée : la learnability machine peut diverger de l'efficacité humaine. La prochaine étape logique est de valider STAIR sur des tâches de contact plus complexes (vis, connecteurs électroniques) et sur des robots physiques déployés en dehors de l'environnement de laboratoire, ce que le papier ne montre pas encore. À surveiller lors des soumissions de conférences de fin 2026 (CoRL, ICRA).

UELes équipes R&D européennes développant des modèles VLA pour la manipulation fine pourraient adapter leurs protocoles de collecte de données en ralentissant la capture sur les segments critiques d'alignement.

RechercheOpinion
1 source
X-Tokenizer : tokenizer d'actions multimodal pour le pré-entraînement VLA
396arXiv cs.RO 

X-Tokenizer : tokenizer d'actions multimodal pour le pré-entraînement VLA

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.14752) les résultats de X-Tokenizer, une architecture légère de type encodeur-SRQ-décodeur conçue pour améliorer la couche d'interface entre le raisonnement visio-linguistique et le contrôle moteur continu des bras robotiques. Le système introduit une technique appelée Semantic Residual Quantization (SRQ), une variante asymétrique de la quantification vectorielle résiduelle classique : le premier niveau est entraîné via un mécanisme de Masked Action Modeling (MAM) pour former un "langage d'actions" discret capturant l'intention de mouvement à gros grain, tandis que les niveaux suivants restent orientés reconstruction pour préserver les détails fins. X-Tokenizer a été pré-entraîné sur 2,4 millions de trajectoires, soit 2,0 milliards de frames d'actions, couvrant des bras robotiques d'embodiments variés. Une fois gelé, il se branche comme signal de supervision dans un VLA hybride discret-continu. Les résultats rapportés sur RoboTwin 2.0 et sur des benchmarks réels montrent des performances de premier rang en agrégat, avec +13,5 % de grounding multimodal et +8,25 points sur les tâches long-horizon par rapport au tokenizer FAST, référence actuelle du domaine. L'enjeu central est ce qu'on appelle le "demo-to-deployment gap" dans les modèles Vision-Language-Action : des VLA comme pi-0, GR00T N2 ou OpenVLA apprennent à raisonner en langage naturel mais peinent à traduire ce raisonnement en commandes motrices précises et stables. Les tokenizers d'action existants se contentent de comprimer les trajectoires pour les reconstruire fidèlement, sans ancrer les codes discrets dans la sémantique du backbone visio-linguistique. Ce que démontre X-Tokenizer, c'est qu'il est possible de faire des tokens d'action des objets sémantiquement cohérents avec le reste du modèle, en ajoutant un alignement contrastif vers l'espace de représentation d'un modèle fondationnel et une prédiction de features visio-linguistiques sur la frame suivante. L'impact pour les intégrateurs et les chercheurs est direct : un tokenizer partagé, gelé et interchangeable entre embodiments réduit le coût de fine-tuning par robot tout en améliorant la robustesse sur les tâches multi-étapes. Du côté du contexte compétitif, la tokenisation d'actions est devenue un verrou clé dans la course aux VLA généralistes depuis 2024. FAST (Fourier Action Sequence Tokenizer, DeepMind) s'est imposé comme baseline de référence en représentation fréquentielle des trajectoires. Des approches comme ACT (Action Chunking with Transformers) ou GROOT ont montré des gains sur des tâches courtes, mais les tâches longues restent difficiles faute de supervision sémantique cohérente. X-Tokenizer se positionne explicitement comme une alternative à FAST sur ce point précis. À noter que les gains annoncés (+13,5 %, +8,25) sont mesurés sur des benchmarks spécifiques et sur une sélection de tâches ; la généralisation à des environnements industriels non structurés reste à démontrer. Aucune timeline de déploiement ni partenaire industriel n'est mentionné dans le papier, ce qui situe ce travail clairement dans la phase recherche, non dans celle du produit expédié.

IA physiqueOpinion
1 source
Pilotage de politique d'inférence par vision et toucher
397arXiv cs.RO 

Pilotage de politique d'inférence par vision et toucher

Des chercheurs ont publié sur arXiv (réf. 2606.14981, juin 2026) ViTaL, un framework de pilotage à l'inférence combinant vision et toucher pour affiner les politiques de manipulation robotique. Le principe : plutôt que de ré-entraîner un modèle génératif pré-entraîné, ViTaL intervient au moment de l'exécution en vérifiant et corrigeant les séquences d'actions candidates avant qu'elles ne soient jouées. Le système repose sur une optimisation bi-niveaux, un niveau haut visuel qui sélectionne le comportement global à longue portée, et un niveau bas tactile qui édite en diffusion la séquence retenue pour satisfaire les contraintes de contact locales. Un monde latent visuo-tactile appris permet d'évaluer des récompenses tactiles futures via un verifieur conditionné en texte, sans avoir besoin de capteur physique au moment de la prédiction. Sur trois tâches réelles de manipulation à contact riche (assemblage, insertion, dépose sous contrainte), ViTaL améliore le taux de succès global de 51 % par rapport à la politique de base, dépasse les approches unimodales (vision seule) d'au moins 33 %, et surpasse la fusion multimodale naïve d'au moins 20 %. Ces résultats pèsent dans un débat central de la robotique de manipulation : la vision seule suffit-elle à piloter des robots en environnement de contact ? ViTaL répond non, et quantifie l'écart. Pour les intégrateurs et les équipes R&D travaillant sur l'assemblage industriel ou la manipulation d'objets déformables, la démonstration que l'information tactile peut être injectée à l'inférence sans retraining complet est directement exploitable, elle ouvre une voie vers des politiques génériques adaptables à de nouveaux contextes de contact via du "steering" léger. L'édition par diffusion guidée par le toucher est particulièrement notable : elle permet de préserver le comportement global appris tout en rectifiant les micro-interactions, ce qui réduit le risque de régression comportementale souvent observé lors du fine-tuning. ViTaL s'inscrit dans la vague des approches "inference-time compute" appliquées à la robotique, popularisées par les travaux sur les VLA (Vision-Language-Action models) et les politiques de diffusion de type π0 (Physical Intelligence) ou GR00T N2 (NVIDIA). L'idée de vérifier les actions à l'exécution plutôt qu'au train-time est également explorée par des équipes comme Covariant et Figure AI, mais sans capteurs tactiles intégrés dans la boucle de correction. La spécificité de ViTaL est de traiter le retour tactile comme une source de supervision temporelle courte portée, complémentaire à la vision longue portée. L'article reste un preprint et les tâches testées sont de complexité modérée ; une validation sur des scénarios industriels réels (tolérance sub-millimétrique, variabilité de pièces) sera nécessaire pour confirmer la généralisation.

IA physiqueOpinion
1 source
ADAPT : entraînement de politique analytique intégrant les perturbations pour la locomotion humanoïde
398arXiv cs.RO 

ADAPT : entraînement de politique analytique intégrant les perturbations pour la locomotion humanoïde

Une équipe de chercheurs a publié le 16 juin 2026 sur arXiv (2606.16542) une méthode baptisée ADAPT (Analytical Disturbance-Aware Policy Training), destinée à améliorer la robustesse locomotrice des robots humanoïdes soumis à des perturbations externes. Le système a été validé sur un Unitree G1 dans trois scénarios représentatifs : poussées au niveau du torse, perturbations en posture statique, et charges asymétriques appliquées aux mains. Dans chaque cas, ADAPT surpasse une politique de référence basée uniquement sur la proprioception (capteurs internes articulaires), avec un meilleur suivi de vitesse et une meilleure stabilité, y compris face à des perturbations hors distribution, c'est-à-dire non rencontrées lors de l'entraînement. La méthode n'exige aucun capteur de force/couple externe : elle s'appuie uniquement sur la dynamique interne du robot pour estimer en ligne les résidus de force et de couple appliqués au corps entier. L'intérêt technique d'ADAPT tient à son observateur de perturbations analytique, fondé sur la physique du corps rigide plutôt que sur un réseau de neurones ou une large randomisation de domaine. Les approches existantes présentent chacune un défaut structurel : la randomisation de domaine dégrade la précision, les objectifs de force spécifiques à une tâche limitent la transférabilité, et les estimateurs appris depuis l'historique de mouvement peinent hors distribution. ADAPT contourne ces compromis en fournissant à la politique un signal d'entrée explicite et physiquement fondé sur les forces et couples perturbateurs estimés, ce qui lui permet de se généraliser à des scénarios jamais vus. Un bénéfice secondaire notable : en pénalisant les perturbations inférées au niveau des articulations inférieures, le système favorise une locomotion plus légère, réduisant les impacts au sol, ce qui peut prolonger la durée de vie mécanique et améliorer la discrétion sonore en milieu de travail. Le Unitree G1 est une plateforme humanoïde commerciale abordable, largement utilisée dans la recherche sur la locomotion apprise, ce qui confère à ces résultats une portée pratique directe. Ce travail s'inscrit dans une tendance plus large où les laboratoires cherchent à combler le fossé sim-to-real sans ajouter de capteurs coûteux, une contrainte forte pour les déploiements industriels à grande échelle. Côté concurrence, des approches similaires ont été explorées par des équipes travaillant sur Boston Dynamics Atlas, Agility Robotics Digit et les humanoïdes Figure et 1X, mais souvent avec des capteurs de force dédiés. ADAPT représente une direction sensorless qui, si elle se confirme sur d'autres plateformes, pourrait simplifier l'intégration matérielle. L'article étant un preprint arXiv non encore évalué par les pairs, la reproductibilité reste à confirmer indépendamment, et les conditions exactes des expériences (vitesses testées, amplitude des poussées) ne sont pas précisées dans le résumé disponible.

IA physiquePaper
1 source
QPILOTS : pilotage efficace par fonction Q à l'inférence pour les politiques de flux
399arXiv cs.RO 

QPILOTS : pilotage efficace par fonction Q à l'inférence pour les politiques de flux

Des chercheurs publient QPILOTS (arXiv:2606.14801, juin 2026), une méthode permettant d'optimiser à l'inférence les politiques de diffusion et de flow-matching sans modifier leurs poids. Le problème central : appliquer l'apprentissage par renforcement basé sur la différence temporelle (TD-RL) à ces générateurs d'actions multi-étapes provoque des instabilités numériques lors du backpropagation à travers la chaîne de débruitage. QPILOTS laisse la politique originale intacte et l'oriente à chaque étape de débruitage via le gradient d'un critique de valeur Q. L'astuce clé : plutôt que d'évaluer le critique sur l'action intermédiaire bruitée (où ses prédictions sont peu fiables), la méthode projette cet état vers une estimation de l'action finale propre, puis calcule le gradient à ce point stable. Deux variantes sont proposées : QPILOTS-U utilise une approximation rapide en point unique, QPILOTS-M tire des échantillons postérieurs différentiables via un réseau auxiliaire appris. Sur un benchmark standard offline-to-online RL couvrant 50 tâches, QPILOTS atteint 90 % de taux de succès moyen, meilleure performance agrégée du comparatif. Appliquée à un modèle fondation Vision-Language-Action (VLA) pré-entraîné et gelé, la méthode surpasse ou égale les approches concurrentes sur six tâches de manipulation en simulation. L'enjeu est concret pour quiconque développe des politiques de manipulation basées sur la diffusion. Les solutions actuelles face au problème de gradient imposent chacune un compromis lourd : abandonner l'information de gradient, distiller la politique en un acteur one-step moins expressif, ou relancer un cycle de fine-tuning à chaque amélioration du critique. QPILOTS propose une quatrième voie compatible avec les modèles fondation gelés, ce qui le rend particulièrement pertinent dans un secteur où Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA) sont déployés comme bases pré-entraînées. Pouvoir piloter ces modèles via RL sans re-entraînement réduit drastiquement le coût d'adaptation à de nouvelles tâches, et apporte un argument concret au débat sur le "sim-to-real gap" des VLAs : le steering à l'inférence pourrait suffire là où le fine-tuning est prohibitif. QPILOTS s'inscrit dans la lignée des travaux sur les Diffusion Policies (Chi et al., 2023, Columbia) et des méthodes comme DDPO qui cherchent à coupler RL et processus de débruitage. Le terrain concurrent inclut les approches de distillation (simplifiantes) et les méthodes de reward-guided sampling déjà appliquées aux VLAs. À noter : cet article reste un preprint en simulation uniquement, sans validation sur hardware réel ni annonce de déploiement industriel. La robustesse des résultats à 90 % sur 50 tâches est encourageante, mais l'évaluation se limite à des environnements simulés, et les performances en conditions réelles, notamment la latence induite par l'étape de projection à chaque débruitage, restent à démontrer.

IA physiqueOpinion
1 source
IVRA : améliorer les relations entre tokens visuels pour la politique d'action des robots grâce à un guidage sans entraînement
400arXiv cs.RO 

IVRA : améliorer les relations entre tokens visuels pour la politique d'action des robots grâce à un guidage sans entraînement

Les modèles Vision-Language-Action (VLA) souffrent d'un défaut structurel bien documenté : en aplatissant les patches d'image en une séquence 1D de tokens, ils perdent les repères spatiaux 2D nécessaires à la manipulation précise d'objets. Des chercheurs ont publié sur arXiv (référence 2601.16207v2) IVRA, une méthode d'inférence légère et sans réentraînement qui corrige ce problème en exploitant des signaux d'affinité déjà présents dans l'encodeur visuel natif du modèle. Ces signaux sont injectés sélectivement dans une couche du modèle de langage où résident les caractéristiques au niveau des instances, réalignant les interactions entre tokens visuels et préservant mieux la structure géométrique sans modifier aucun paramètre. Appliqué à trois architectures distinctes, LLaRA, OpenVLA et FLOWER, IVRA a été évalué sur les benchmarks VIMA (manipulation 2D) et LIBERO (manipulation 3D), ainsi que sur des tâches en environnement physique réel. Sur VIMA en régime de faibles données, il améliore le taux de succès moyen de +4,2 % par rapport à la baseline LLaRA. Sur LIBERO 3D, les gains restent cohérents même proches de la saturation (96,3 % vers 97,1 %). L'intérêt industriel est direct : un intégrateur qui a déjà déployé un VLA peut appliquer IVRA à l'inférence sans réentraînement, sans capteur supplémentaire, sans encodeur externe. C'est un avantage immédiat en time-to-value pour des systèmes en production. Le fait que la méthode fonctionne même à 96,3 % de baseline suggère qu'elle améliore la précision géométrique locale plutôt que la compréhension globale de scène, précisément le point de défaillance des VLA sur des tâches de manipulation fine (saisie d'objets proches, tri par forme, assemblage). Pour la recherche, IVRA valide l'hypothèse que les encodeurs visuels embarqués contiennent des informations spatiales latentes exploitables sans supervision supplémentaire, une direction "training-free adapter" qui mérite davantage d'exploration. La perte de structure spatiale dans les VLA est connue depuis les premières publications sur RT-2 (Google DeepMind, 2023) et OpenVLA (Berkeley/Stanford, 2024). Les réponses habituelles consistent à modifier l'architecture ou à ajouter des flux de données supplémentaires (depth, point clouds), augmentant la complexité de déploiement. Physical Intelligence avec pi-0 et NVIDIA avec GR00T N2 misent sur des architectures propriétaires plus lourdes ; IVRA propose une correction orthogonale applicable sur des modèles ouverts, en compétition directe avec les méthodes de spatial token resampling et d'attention guidée comme RoboFlamingo. L'étape suivante logique serait une validation sur des benchmarks plus exigeants (RLBench, BridgeData v2) et sur des manipulateurs industriels à 6 DOF ou plus en conditions réelles, là où la précision spatiale est critique.

IA physiqueOpinion
1 source