Aller au contenu principal

Dossier arXiv cs.RO — page 31

2706 articles · page 31 sur 55

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

ActiveFly-Bench : aligner la réponse à des questions incarnée avec un modèle vision-langage-action pour la perception aérienne incarnée
1501arXiv cs.RO RecherchePaper

ActiveFly-Bench : aligner la réponse à des questions incarnée avec un modèle vision-langage-action pour la perception aérienne incarnée

Une équipe de recherche publie ActiveFly-Bench, un nouveau benchmark visant à combler le fossé entre le raisonnement en environnement virtuel et l'interaction physique pour la perception active des drones. Décrit dans un article déposé sur arXiv (2607.10180v1), ce benchmark décompose la perception active en trois tâches hiérarchiques: le question-réponse incarné aérien (Air-EQA), la planification du comportement d'observation (OBP) et le contrôle fin du drone guidé par le langage (FLUC), reliant explicitement la compréhension de tâches de haut niveau, la planification comportementale et le contrôle bas niveau. Les jeux de données combinent des environnements extérieurs réels et simulés, utilisés à la fois pour l'entraînement et l'évaluation. Les auteurs ont aussi développé ActiveFly, un agent en boucle fermée qui associe raisonnement vision-langage et contrôle fin, effectivement déployé sur une plateforme UAV physique, et non testé uniquement en simulation. L'enjeu dépasse le simple exercice académique: les tests menés avec des modèles vision-langage (VLM) et des modèles vision-langage-action (VLA) représentatifs montrent que les agents actuels peinent encore sur la planification comportementale, l'ajustement de point de vue et l'accomplissement robuste de tâches en perception active. Autrement dit, la promesse des architectures VLA généralistes, popularisées au sol par des systèmes comme GR00T N2 ou Helix, ne se transpose pas automatiquement au domaine aérien: piloter un drone qui doit décider où regarder, comment se repositionner et quand agir reste un problème ouvert. Pour les intégrateurs de drones d'inspection, d'agriculture ou de surveillance, ce constat tempère l'enthousiasme autour des copilotes autonomes tout-en-un et souligne que le sim-to-real n'est pas résolu pour l'aérien comme il commence à l'être pour la manipulation au sol. Ce travail s'inscrit dans la lignée des benchmarks d'IA incarnée (embodied QA) déjà développés pour les robots terrestres et les bras manipulateurs, mais transposés pour la première fois de façon systématique au domaine UAV, où les contraintes de vol, de vent et de champ de vision changent la donne. Face à des acteurs commerciaux comme DJI ou Skydio qui vendent déjà de l'autonomie de vol assistée, ActiveFly-Bench propose un cadre d'évaluation académique standardisé plutôt qu'un produit, avec l'ambition de devenir une référence pour mesurer les progrès futurs des agents aériens embarquant du raisonnement multimodal.

1 source
PIER-Flow : un flux rectifié efficace et informé par la physique pour la navigation en temps réel des robots mobiles
1502arXiv cs.RO 

PIER-Flow : un flux rectifié efficace et informé par la physique pour la navigation en temps réel des robots mobiles

Des chercheurs présentent PIER-Flow (Physics-Informed Efficient Rectified Flow), une politique de navigation légère pour robots mobiles, décrite dans un preprint arXiv publié le 14 juillet 2026 (arXiv:2607.10288v1). La méthode distille un expert MPC (Model Predictive Control) dans une équation différentielle ordinaire à temps continu, ce qui permet de générer une action en une seule étape grâce à un échantillonnage latent parallèle et une sélection de faisabilité allégée. Un objectif d'entraînement intégrant la physique impose la cohérence cinématique du robot, couplé à une architecture de "chunking" d'actions asynchrone pensée pour le transfert simulation vers réel. En simulation, PIER-Flow atteint un taux de réussite de 98,85% sans aucune collision, avec un temps d'inférence moyen d'environ 1,29 ms, soit une planification 37,2 fois plus rapide que le MPC classique et plus de 800 fois plus rapide que les modèles de diffusion standards. Déployé sur un calculateur embarqué à ressources limitées, le système conserve une latence d'inférence stable d'environ 5,3 ms. Ces chiffres, s'ils se confirment au-delà du cadre expérimental, répondent à une tension centrale de la navigation robotique autonome: les méthodes d'optimisation comme le MPC gèrent explicitement les contraintes de sécurité et de cinématique mais souffrent d'une optimisation non linéaire répétée coûteuse en temps réel, tandis que les politiques de clonage comportemental déterministes sont rapides mais peinent à représenter des comportements d'évitement multimodaux, et les politiques de diffusion capturent cette multimodalité au prix d'un débruitage itératif lent. En combinant la rapidité d'inférence d'un modèle distillé avec la robustesse théorique d'un expert MPC, PIER-Flow illustre une piste concrète pour rapprocher performance temps réel et sécurité formelle chez les robots mobiles évoluant en environnements denses et dynamiques, un enjeu direct pour les intégrateurs d'AMR (robots mobiles autonomes) en entrepôt ou en usine où les pics de latence et les gels de planification restent un point de friction opérationnel majeur. L'approche s'inscrit dans une lignée de travaux cherchant à accélérer les politiques génératives pour la robotique, où les modèles de diffusion classiques, malgré leur expressivité, imposent un coût d'inférence incompatible avec le contrôle temps réel embarqué. Le recours au "rectified flow" comme alternative plus rapide au débruitage itératif fait écho à des développements récents dans la littérature sur les modèles génératifs accélérés. Aucun acteur industriel n'est nommé dans ce travail, qui reste à ce stade une contribution académique validée uniquement en simulation et sur un déploiement limité en conditions réelles sur matériel edge; les auteurs ne précisent pas de calendrier de transfert vers des plateformes robotiques commerciales ni de comparaison directe avec des politiques VLA (Vision-Language-Action) comme Pi-0 ou GR00T N2, ce qui invite à la prudence sur la portée exacte des gains annoncés hors du cadre testé.

RecherchePaper
1 source
SUREFlow : appariement de flux résiduel adapté à l'incertitude dans l'espace d'états pour une manipulation robotique robuste
1503arXiv cs.RO 

SUREFlow : appariement de flux résiduel adapté à l'incertitude dans l'espace d'états pour une manipulation robotique robuste

Des chercheurs publient sur arXiv (2607.10504v1) SUREFlow, une nouvelle politique de manipulation robotique fondée sur le state-space model Mamba plutôt que sur les architectures Transformer habituelles. Le nom complet, State-space Uncertainty-aware REsidual Flow matching, résume l'idée centrale: le modèle prédit conjointement les vitesses d'action et une incertitude résiduelle dépendant de l'entrée, ce qui lui permet de raffiner sélectivement les dimensions d'action jugées peu fiables, sans retour de l'environnement, tout en gardant un coût de calcul contenu. Sur le benchmark de simulation LIBERO, SUREFlow atteint un taux de réussite moyen de 92,5%, contre un score inférieur de 34,2 points pour MaIL, l'autre politique bâtie sur Mamba. Sur la variante plus difficile LIBERO-PRO, il obtient environ 49% de réussite avec seulement 179 millions de paramètres, un résultat que les auteurs présentent comme comparable à celui de grands modèles VLA (vision-langage-action) pesant entre 3 et 7 milliards de paramètres. Le code source est publié sur GitHub. L'enjeu dépassé le simple gain de score: les politiques génératives par diffusion ou flow matching, aujourd'hui dominantes pour piloter des bras robotiques à partir d'images et de langage, souffrent d'instabilité lors de rollouts longs, où de petites erreurs de vitesse s'accumulent et dégradent l'exécution. La plupart des approches existantes supposent une incertitude homogène et ne la modélisent pas explicitement pendant la génération d'action. En ciblant ce point précis, SUREFlow s'attaque directement au fossé entre démonstration en simulation et fiabilité en conditions réelles, un problème central pour les intégrateurs qui cherchent des politiques VLA robustes sans devoir recourir à des modèles massifs coûteux à faire tourner en embarqué. Le travail s'inscrit dans la lignée des politiques de manipulation compactes inspirées de Mamba, alternative aux Transformers pour réduire la complexité de calcul sur des séquences longues, après des tentatives comme MaIL. Il se positionne aussi face aux grands VLA généralistes tels que Pi-0 ou GR00T N2, en misant sur l'efficacité paramétrique plutôt que sur l'échelle. À ce stade, il s'agit d'une publication de recherche évaluée uniquement en simulation sur LIBERO et LIBERO-PRO, sans validation annoncée sur robot physique ni partenariat industriel identifié.

RechercheActu
1 source
TactiDex : un référentiel tactile réel pour la manipulation dextre proche de l'humain
1504arXiv cs.RO 

TactiDex : un référentiel tactile réel pour la manipulation dextre proche de l'humain

La recherche en manipulation robotique dextre franchit une nouvelle étape avec TactiDex, un benchmark et un jeu de données publiés sur arXiv (référence 2607.09190v1) et dédiés à la manipulation guidée par le toucher. Le projet part d'un constat technique précis: la plupart des méthodes actuelles de transfert humain-robot pour les mains dextres reposent uniquement sur des trajectoires cinématiques, ce qui produit une imitation du mouvement sans véritable ancrage physique dans le contact. TactiDex propose à la place un jeu de données réel qui aligne des signaux tactiles couvrant l'ensemble de la main avec des états cinématiques et des états d'objets à plusieurs niveaux de granularité, accompagné de métriques d'évaluation standardisées. Sur cette base, les auteurs introduisent TactiSkill, un framework de transfert reposant sur une récompense tactile à trois composantes, conçue pour unifier dans un seul objectif le guidage du geste, la ressemblance avec le comportement humain et le respect des contraintes de contact. Les expériences couvrent à la fois des tâches à une main et des tâches bimanuelles, avec une page projet dédiée (tactidex.github.io) pour consulter les données et résultats. Pour l'industrie robotique, ce travail s'attaque directement à un angle mort connu des pipelines d'apprentissage par démonstration: la plupart des systèmes actuels, y compris les architectures VLA les plus médiatisées, valident surtout la trajectoire du geste et non la qualité physique du contact, ce qui laisse un écart entre démonstration réussie en vidéo et manipulation réellement stable en conditions réelles. En intégrant le retour tactile comme signal de supervision structuré plutôt que comme donnée accessoire, TactiDex offre aux équipes de recherche et aux intégrateurs travaillant sur des mains robotiques un cadre d'évaluation plus rigoureux pour juger si un geste appris est simplement copié ou physiquement plausible, ce qui pèse directement sur la fiabilité des déploiements en préhension fine. Le travail s'inscrit dans la lignée des efforts récents visant à dépasser la simple imitation cinématique dans le transfert humain-robot, un problème identifié de longue date dans la littérature sur la téléopération et l'apprentissage par démonstration. Aucune date de publication de code ni de partenariat industriel n'est mentionnée à ce stade; le projet reste au niveau d'un benchmark de recherche, dont l'adoption dépendra de sa reprise par d'autres laboratoires travaillant sur des mains dextres et l'apprentissage tactile.

RecherchePaper
1 source
Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
1505arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
Coordination de comportements implicites à partir de démonstrations de sous-tâches non étiquetées pour des tâches de réarrangement
1506arXiv cs.RO 

Coordination de comportements implicites à partir de démonstrations de sous-tâches non étiquetées pour des tâches de réarrangement

Une nouvelle publication arXiv (2607.09234v1, soumise en juillet 2026) propose une approche alternative pour les tâches de réarrangement robotique à long horizon, ces missions où un robot doit déplacer plusieurs objets pour réorganiser un environnement. Plutôt que de découper la tâche en compétences prédéfinies avec des étiquettes, des frontières et une logique de commutation propre à chaque scénario, les auteurs formulent le problème comme une coordination implicite de comportements appris directement depuis des démonstrations de sous-tâches non étiquetées. Le système apprend des comportements de type "compétences" à partir de données comportementales mixtes, puis les coordonne via une sélection d'actions guidée par une fonction de valeur (un critique). La méthode est testée sur les tâches de réarrangement de Habitat, la plateforme de simulation d'IA incarnée. Sans plan de tâche oracle ni démonstrations complètes étiquetées par compétence, elle dépasse des méthodes d'imitation spécifiques à la tâche sur les scénarios les plus complexes et s'approche des performances d'un système oracle combiné à des compétences apprises par clonage comportemental. L'enjeu dépasse le cadre académique. Les pipelines robotiques actuels reposent largement sur des architectures de planification explicite, coûteuses à concevoir et difficiles à faire évoluer dès que le nombre de comportements ou l'horizon temporel augmente, un frein connu pour les intégrateurs qui veulent déployer des robots polyvalents en entrepôt ou en usine. En montrant qu'une coordination apprise, sans étiquetage de compétences ni planificateur oracle, peut tenir la comparaison, ces travaux appuient l'hypothèse qu'une abstraction explicite des compétences n'est pas indispensable, un argument qui rejoint la tendance actuelle vers des modèles vision-langage-action génériques plutôt que des pipelines modulaires rigides. Ce travail s'inscrit dans la lignée des recherches en apprentissage par imitation à partir de données comportementales hétérogènes, un axe où Habitat (développé par Meta AI) sert de banc d'essai standard pour l'IA incarnée. Les auteurs montrent aussi, via des études d'ablation, que la sélection de candidats guidée par le critique est déterminante pour gérer des comportements multimodaux, et que la méthode continue de bien se comporter quand le répertoire de comportements et l'horizon de la tâche s'agrandissent, contrairement aux approches d'imitation spécifiques à la tâche. Aucun déploiement matériel réel n'est mentionné à ce stade, l'évaluation restant purement en simulation.

RecherchePaper
1 source
SpikeATac : un doigt tactile multimodal à détection dynamique taxélisée pour la manipulation dextérique
1507arXiv cs.RO 

SpikeATac : un doigt tactile multimodal à détection dynamique taxélisée pour la manipulation dextérique

Le ROAM Lab présente SpikeATac, un doigt tactile multimodal pour la manipulation robotique dextre, dans une révision (v3) d'un article initialement publié sur arXiv en octobre 2025. Le capteur combine un film PVDF taxelisé, découpé en 16 zones de détection et échantillonné à 4 kHz, qui capte les signaux dynamiques dès l'amorce et la rupture du contact, avec une couche capacitive assurant la mesure statique de la pression, d'où sa réponse en "pics" qui lui donne son nom. Les chercheurs ont caractérisé la sensibilité de chaque modalité et montré que SpikeATac permet d'arrêter une préhension rapidement et délicatement sur des objets fragiles ou déformables. Au-delà de la pince parallèle, l'équipe a intégré le capteur à une main robotique multidoigts dextre, pilotée par une politique affinée via apprentissage par renforcement à partir de retour humain (RLHF) pour moduler la force appliquée. Résultat revendiqué: une manipulation en main d'objets fragiles jamais démontrée jusque-là sur ce type de plateforme. Des vidéos sont disponibles sur roamlab.github.io/spikeatac. Ce travail cible un angle mort connu des mains robotiques: la plupart des capteurs tactiles privilégient soit la résolution statique, soit la réactivité dynamique, rarement les deux, ce qui limite la détection de l'instant où un objet commence à glisser ou se déformer sous la pince. Un retour tactile à 4 kHz couplé à une lecture statique fiable vise directement les cas d'usage où les pinces industrielles classiques échouent ou abîment la charge (fruits, verre, colis, composants électroniques). Le choix du RLHF plutôt qu'une simple fonction de récompense simulée suggère que le réglage fin de la force reste difficile à spécifier automatiquement, un signal utile pour les intégrateurs évaluant des politiques apprises en conditions réelles. SpikeATac se distingue des capteurs à caméra interne comme GelSight ou DIGIT, plus coûteux en calcul et moins réactifs aux événements de contact rapides. L'article, purement académique, ne mentionne ni partenariat industriel ni déploiement hors laboratoire: c'est une preuve de faisabilité, pas un produit commercialisé. Aucun acteur français ou européen n'y figure. Les auteurs évoquent comme suites possibles la miniaturisation du capteur pour des mains commerciales et l'extension du pipeline RLHF à d'autres tâches de manipulation en contact riche.

RecherchePaper
1 source
SplatCtrl : couplage perception-action via représentations de scène gaussiennes et contrôle robotique réactif
1508arXiv cs.RO 

SplatCtrl : couplage perception-action via représentations de scène gaussiennes et contrôle robotique réactif

Des chercheurs présentent SplatCtrl, un système qui combine reconstruction 3D en temps réel et contrôle réactif de bras robotique pour éviter les collisions dans des environnements inconnus et changeants. Le framework s'appuie sur le 3D Gaussian Splatting, une technique de représentation de scène par nuages de gaussiennes 3D, et introduit une méthode hybride de filtrage voxel combinée à une relocalisation dynamique des gaussiennes, permettant de reconstruire la scène à partir de flux RGB-D tout en s'adaptant aux changements de l'environnement en continu. Pour le contrôle, les auteurs dérivent des fonctions de distance signée continues directement depuis les gaussiennes isotropes, ce qui fournit des estimations de probabilité de collision stables et différentiables, faisant le pont entre les champs de distance classiques et les représentations implicites modernes. Ces métriques sont ensuite injectées dans des fonctions de barrière de contrôle (control barrier functions), aboutissant à un couplage perception-action unifié capable de générer des mouvements fluides en réaction aux changements de scène. Le système a été validé en simulation, sur un robot physique réel, et dans un espace de travail partagé humain-robot. L'intérêt pour l'industrie tient à la promesse centrale du papier: rendre les bras manipulateurs, aujourd'hui performants surtout en environnement structuré et statique, capables d'opérer en sécurité dans des contextes dynamiques et partagés avec des humains, sans reprogrammation manuelle des trajectoires. Si les résultats se confirment à plus grande échelle, cela toucherait directement les intégrateurs industriels et logistiques confrontés à des cellules de travail non figées, ainsi que les applications de cobotique où la coexistence humain-robot impose une réactivité aux obstacles imprévus. C'est aussi un signal supplémentaire que le 3D Gaussian Splatting, initialement pensé pour le rendu photoréaliste, s'impose progressivement comme brique de perception robotique. Le travail s'inscrit dans une lignée de recherches récentes cherchant à exploiter le 3D-GS pour la robotique, au-delà de son usage d'origine en vision par ordinateur et rendu de scènes. L'article ne précise pas d'affiliation industrielle ni de partenaire de déploiement identifié: il s'agit d'une contribution de recherche académique publiée sur arXiv, sans indication de commercialisation ni de calendrier de transfert vers un produit. Les prochaines étapes attendues concernent le passage à l'échelle sur des scènes plus complexes et des tests prolongés en conditions réelles d'usine ou d'entrepôt.

RecherchePaper
1 source
Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines
1509arXiv cs.RO 

Main d'AnyDexRT : retargeting dextérique sans calibration guidé par peu de démonstrations humaines

Des chercheurs viennent de publier sur arXiv (arXiv:2607.08341, 10 juillet 2026) une nouvelle méthode baptisée AnyDexRT, conçue pour le retargeting cinématique des mains robotiques dextres en téléopération. Le retargeting consiste à traduire les mouvements de la main d'un opérateur humain en mouvements réalisables par une main robotique, une étape cruciale pour la téléopération et pour la collecte de démonstrations utilisées en apprentissage par imitation. Contrairement aux approches existantes, qui reposent souvent sur des objectifs conçus manuellement, un calibrage précis ou un appariement global des formes entre la main humaine et la main robotique, AnyDexRT ne nécessite aucune calibration préalable. La méthode combine un apprentissage auto-supervisé des correspondances entre le bout des doigts humains et robotiques avec un guidage humain en few-shot, c'est-à-dire à partir de très peu d'exemples, pour ancrer la correspondance dans les zones pertinentes pour la tâche. Un classificateur de contact affine ensuite spécifiquement les poses de préhension en pince. Cette approche répond à un problème concret et sous-estimé du secteur : la fragilité des pipelines de téléopération dès qu'on change de main robotique ou d'opérateur, ce qui limite la scalabilité de la collecte de données pour l'apprentissage par imitation, un goulot d'étranglement identifié dans le développement des modèles VLA (vision-langage-action) comme Pi-0 ou GR00T N2. En supprimant la calibration manuelle, AnyDexRT pourrait accélérer la production de démonstrations de qualité pour l'entraînement de politiques robotiques, un enjeu central pour les intégrateurs et laboratoires qui cherchent à faire passer leurs mains dextres de la démonstration en laboratoire à des déploiements plus robustes. Les auteurs rapportent des gains en qualité de retargeting et une réduction du réglage manuel sur des mains dextres variées et des tâches de téléopération réelles, sans toutefois préciser de métriques chiffrées vérifiables dans le résumé. Le travail s'inscrit dans la lignée des recherches sur le retargeting cross-embodiment, un axe actif face à la multiplication des mains robotiques commerciales aux morphologies différentes. Un site de projet accompagne la publication, mais aucun code, benchmark comparatif détaillé ni partenariat industriel n'est mentionné à ce stade : il s'agit d'une contribution académique, pas d'un produit prêt à déployer.

RecherchePaper
1 source
SeFA-Policy : apprentissage rapide et précis de politiques visuomotrices par alignement de flux sélectif
1510arXiv cs.RO 

SeFA-Policy : apprentissage rapide et précis de politiques visuomotrices par alignement de flux sélectif

Une équipe de recherche a publié SeFA-Policy (Selective Flow Alignment), une nouvelle méthode d'apprentissage de politiques visuomotrices par imitation pour la robotique, décrite dans une version révisée sur arXiv (2511.08583v2) et accompagnée d'un code source disponible sur GitHub (RongXueZoe/SeFA). Le problème ciblé concerne les approches récentes de "rectified flow", qui accélèrent la génération d'actions robotiques mais souffrent d'un défaut connu : après distillation itérative, les actions générées finissent par dévier des actions réelles associées à l'observation visuelle en cours, ce qui accumule l'erreur au fil des cycles de reflow et déstabilise l'exécution des tâches. SeFA introduit un mécanisme de correction de cohérence qui réaligne sélectivement les actions générées sur les démonstrations expertes, tout en conservant la capacité du modèle à représenter plusieurs solutions possibles (multimodalité). Sur des tâches de manipulation simulées et réelles, les auteurs annoncent une précision et une robustesse supérieures aux politiques de référence basées sur la diffusion ou sur le flow, avec une latence d'inférence réduite de plus de 98%. Pour l'industrie robotique, l'enjeu dépasse la performance académique brute : le goulot d'étranglement des politiques par diffusion a toujours été le nombre d'étapes de débruitage nécessaires à chaque décision, incompatible avec du contrôle temps réel sur bras manipulateurs ou robots mobiles. Les méthodes à un seul pas d'inférence promettent de lever ce verrou, mais au prix, jusqu'ici, d'une fidélité dégradée aux observations réelles. En traitant explicitement ce compromis précision/vitesse plutôt qu'en l'ignorant, SeFA apporte un signal utile aux intégrateurs qui évaluent si les politiques de type flow sont mûres pour un déploiement embarqué, au-delà des démonstrations en laboratoire. Ce travail s'inscrit dans la lignée des Diffusion Policy puis des politiques par rectified flow, apparues ces deux dernières années comme alternative aux architectures de type transformer pour l'apprentissage par imitation en robotique. Il se positionne explicitement contre les méthodes de diffusion et de flow "state of the art" existantes, sans toutefois nommer d'acteur industriel ni annoncer de déploiement commercial : il s'agit d'une contribution de recherche, publiée en v2 après une première soumission, avec code ouvert pour reproduction par la communauté.

RechercheActu
1 source
Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels
1511arXiv cs.RO 

Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels

Une équipe de recherche propose une nouvelle architecture pour piloter des robots de morphologies très différentes avec un seul contrôleur, dans un article intitulé "Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control" (arXiv:2506.08630, version 3, republiée en cross-listing début juillet 2026). Le système repose sur une architecture transformer combinée à une récurrence modulaire partagée entre les composants du robot (bras, jambes, articulations), conçue pour reconstruire des informations contextuelles sur les propriétés physiques d'un robot même quand ces données ne sont que partiellement disponibles au départ. Les chercheurs l'ont testé sur un large ensemble de robots simulés dans MuJoCo, le moteur physique open source largement utilisé en apprentissage par renforcement, à travers quatre environnements distincts. Résultat clé: le modèle affiche un gain net en généralisation zero-shot, c'est-à-dire sa capacité à piloter correctement des robots aux dynamiques, cinématiques et topologies jamais rencontrées pendant l'entraînement, sans réglage additionnel. Cette avancée s'inscrit dans un enjeu central pour l'industrie robotique: réduire le coût d'entraînement et de déploiement de contrôleurs spécifiques à chaque morphologie de robot. Un contrôleur universel capable de généraliser à de nouveaux designs mécaniques réduirait drastiquement les besoins en données et en calcul pour chaque nouveau modèle de robot, un problème que rencontrent aujourd'hui les fabricants de robots humanoïdes et de bras manipulateurs multiples. C'est aussi une contribution au débat sur la viabilité des architectures de type VLA (vision-language-action) et des politiques génériques à grande échelle: ici, la généralisation ne vient pas d'un volume massif de données mais d'une architecture qui exploite explicitement la structure modulaire du robot. L'approche s'inscrit dans une lignée de travaux en RL contextuel et en contrôle multi-robots qui exploitent déjà des informations sur la morphologie pour entraîner des agents partagés, mais qui peinaient jusqu'ici à généraliser à des morphologies fortement dissimilaires. Le fait que cet article soit republié en tant que "replace-cross" sur arXiv suggère une révision après retours de la communauté, un signe que le sujet suscite un intérêt actif en apprentissage par renforcement appliqué à la robotique. Les prochaines étapes attendues concernent une validation sur robots physiques réels, au-delà des simulations MuJoCo, pour confirmer le transfert sim-to-real.

RecherchePaper
1 source
VOTE : optimisation vision-langage-action par vote d'ensemble de trajectoires
1512arXiv cs.RO 

VOTE : optimisation vision-langage-action par vote d'ensemble de trajectoires

Le papier VOTE ("Vision-Language-Action Optimization with Trajectory Ensemble Voting"), publié sur arXiv sous la référence 2507.05116, propose une nouvelle méthode d'entraînement pour les modèles Vision-Language-Action (VLA) utilisés en robotique manipulatrice. Les auteurs, dont le code est disponible sur GitHub (LukeLIN-web/VOTE), s'attaquent à deux limites des VLA actuels : la génération de tokens d'action très nombreux, qui alourdit la latence d'inférence et le coût d'entraînement, et une exploitation insuffisante des actions déjà générées, qui dégrade les performances. Leur framework finetune les modèles pour produire beaucoup moins de tokens d'action, en parallélisant fortement le décodage, puis combine les prédictions courantes et passées via une stratégie de vote d'ensemble au moment de l'inférence. Résultat annoncé : des taux de réussite supérieurs à l'état de l'art, avec une inférence 39 fois plus rapide qu'OpenVLA et un débit de 46 Hz sur plateformes embarquées. Ce gain de vitesse cible directement le principal frein au déploiement réel des VLA : leur latence, souvent incompatible avec un contrôle robotique en temps réel sur du matériel embarqué à ressources limitées. Si les chiffres se confirment en dehors des benchmarks propriétaires des auteurs, cela renforcerait l'idée qu'on peut réduire drastiquement la latence sans changer d'architecture ni ajouter de puissance de calcul, simplement en repensant le nombre de tokens générés et leur exploitation post-inférence. C'est un argument concret pour les intégrateurs qui cherchent à faire tourner des politiques VLA sur des bras robotiques ou plateformes mobiles sans GPU serveur. Le travail s'inscrit dans une course plus large à l'efficacité des VLA, où OpenVLA sert de référence open source largement citée, aux côtés d'approches comme Pi-0 (Physical Intelligence), GR00T (NVIDIA) ou Helix (Figure), toutes confrontées au même compromis entre richesse de représentation et vitesse d'exécution. VOTE se positionne comme une optimisation d'inférence complémentaire à ces modèles plutôt qu'un concurrent direct, avec pour prochaine étape l'adoption par la communauté via son code publié.

IA physiqueActu
1 source
SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche
1513arXiv cs.RO 

SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche

Voici l'article en français, sans titres ni séparateurs : Une équipe de recherche présente SPEAR (Simulator for Photorealistic Embodied AI Research), un nouveau simulateur conçu pour entraîner des agents incarnés (embodied agents) et générer des données visuelles synthétiques photoréalistes. Publié sur arXiv début juillet 2026, SPEAR se présente comme une bibliothèque Python capable de se connecter à n'importe quelle application Unreal Engine (UE) et de la piloter via une architecture de plugins modulaires. Elle expose plus de 14 000 fonctions UE uniques à Python, soit un gain d'un ordre de grandeur en fonctionnalités programmables par rapport aux simulateurs UE existants. Côté performance, une seule instance de SPEAR peut rendre des images photoréalistes en 1920x1080 directement dans un tableau NumPy à 73 images par seconde, également dix fois plus rapide que les plugins UE existants, tout en fournissant des modalités de vérité terrain inédites, comme la décomposition intrinsèque non diffuse, les IDs de matériaux ou les paramètres de shading physiquement basé (PBR). Pour un ingénieur en robotique ou en IA incarnée, l'enjeu dépasse la simple prouesse technique : la plupart des simulateurs photoréalistes actuels souffrent d'un compromis entre réalisme visuel et vitesse de rendu, ou entre flexibilité de programmation et généralité. En combinant vitesse élevée, richesse des modalités de sortie et contrôle programmatique fin de scènes UE complexes, SPEAR vise à réduire l'écart entre simulation et réalité (sim-to-real) pour l'entraînement d'agents visuels, un point critique pour la robotique mobile, les véhicules autonomes et les modèles vision-langage-action (VLA). Les chercheurs démontrent l'outil sur des cas variés : contrôle de multiples agents aux espaces d'action distincts (humains, voitures, robots) dans des projets UE existants, rendu d'environnements urbains à grande échelle, manipulation des systèmes de génération procédurale de contenu d'UE, rendu multi-vues synchronisé de visages humains détaillés, co-simulation avec le moteur physique MuJoCo, et édition de scènes en langage naturel via un assistant de code IA. SPEAR s'inscrit dans la lignée des simulateurs bâtis sur Unreal Engine comme AirSim ou CARLA, mais cherche à en dépasser les limites de généralité et de vitesse.

RecherchePaper
1 source
IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains
1514arXiv cs.RO 

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains

Des chercheurs présentent HumAIN (Human-Aware Implicit Social Robot Navigation), un nouveau framework publié sur arXiv (arXiv:2607.07357v1) qui vise à rendre la navigation des robots sociaux plus sensible aux comportements humains. Le système repose sur un modèle enseignant de type transformer qui fusionne plusieurs sources de données : images historiques, points clés du squelette humain (keypoints), état du robot et objectif de destination, afin d'apprendre des représentations robustes pour planifier la trajectoire future du robot. Cette connaissance est ensuite distillée dans un modèle élève beaucoup plus léger, optimisé conjointement pour reconstruire la trajectoire et aligner ses caractéristiques latentes sur celles de l'enseignant, ce qui permet un déploiement en temps réel. Lors des tests, HumAIN améliore les métriques de prédiction de trajectoire de 29,8% en moyenne sur l'ensemble des métriques évaluées, par rapport aux meilleures méthodes existantes. L'enjeu principal de ces travaux est de combler l'écart entre prédiction et planification, un problème récurrent dans la navigation robotique en environnement humain : beaucoup de systèmes prédisent bien le mouvement des piétons mais peinent à traduire cette prédiction en trajectoire exploitable en temps réel, surtout sur du matériel aux ressources limitées. En s'appuyant sur des indices sociaux implicites, comme la démarche ou l'orientation du corps, plutôt que sur des règles explicites ou des modèles de forces sociales classiques, cette approche pourrait rendre les robots mobiles (AMR, robots de service, plateformes embarquées) plus fluides et prévisibles dans des espaces partagés avec des humains, un facteur clé pour l'acceptabilité et la sécurité de ces systèmes en usage réel, notamment en logistique ou en environnement industriel où humains et robots cohabitent. Ce travail s'inscrit dans la lignée des recherches sur la navigation sociale des robots, un domaine qui cherche depuis plusieurs années à dépasser les modèles purement géométriques d'évitement d'obstacles pour intégrer une compréhension plus fine du comportement humain. La technique de distillation de connaissances, empruntée à l'apprentissage profond, est ici appliquée pour rendre exploitables sur des plateformes à ressources contraintes des représentations normalement coûteuses à calculer. Les auteurs positionnent HumAIN par rapport à des méthodes de l'état de l'art en prédiction de trajectoire, et les prochaines étapes attendues porteraient sur une validation au-delà de la simulation, sur des robots physiques en conditions réelles.

RecherchePaper
1 source
Robots miniatures modulaires : des graphes de synchronisation programmables pour plus d'adaptabilité et de tolérance aux pannes
1515arXiv cs.RO 

Robots miniatures modulaires : des graphes de synchronisation programmables pour plus d'adaptabilité et de tolérance aux pannes

Des chercheurs publient sur arXiv (arXiv:2607.07281v1) un nouveau cadre appelé "programmable synchronization graphs" pour coordonner des essaims de robots miniatures modulaires, chaque module associant un actionneur et un capteur. Le principe : représenter chaque paire actionneur-capteur comme un nœud de réseau, et encoder la coordination locomotrice via un couplage de graphe plutôt que via un leader central ou un gabarit de démarche fixe. Des liens fixes à l'intérieur de sous-groupes synchronisent des groupes hétérogènes d'actionneurs, tandis qu'un petit nombre de liens signés entre sous-groupes programme les relations de phase. Sur des collectifs physiques allant jusqu'à neuf modules, les chercheurs montrent l'émergence de la synchronisation, un contrôle du déphasage entre mouvement en phase et en opposition de phase, et des allures de type galop ou trot sur un assemblage de cinq modules au sol. Remplacer un couplage dense (tous les modules connectés entre eux) par des topologies creuses "d-régulières" préserve la synchronisation tout en réduisant la charge de communication. Un algorithme d'apprentissage par sélection de liens (upper-confidence-bound) permet en outre au système d'apprendre en ligne les connexions nécessaires pour atteindre un état de phase cible. L'intérêt pratique tient surtout à la tolérance aux pannes : plus le degré du graphe de couplage est élevé, plus le système supporte de désactivations de modules avant de perdre la synchronisation. Sur un test de désactivation, ce contrôleur distribué évite le mode de défaillance typique du contrôle centralisé leader-suiveur, où la perte du module leader fait s'effondrer toute la coordination, et réduit l'erreur de phase dans le pire cas d'un facteur d'environ trois. Pour l'industrie des robots modulaires et essaims miniatures, c'est une piste concrète pour des systèmes robustes sans point de défaillance unique, un enjeu classique en robotique en essaim et en inspection dans des environnements confinés. Ce travail s'inscrit dans une problématique ancienne de la robotique modulaire : comment coordonner de nombreux modules imparfaits, à calcul et communication limités, sans dépendre d'une hiérarchie rigide. Les approches concurrentes reposent typiquement sur des architectures leader-suiveur ou des gabarits de démarche prédéfinis, moins robustes à la perte d'unités. Le papier ne précise pas de calendrier de déploiement industriel ; il s'agit à ce stade d'une démonstration en laboratoire sur des collectifs à petite échelle (jusqu'à neuf modules), dont la généralisation à des essaims plus grands reste à établir.

RecherchePaper
1 source
Multi-agent : contrôle robotique par modèles vision-langage embarqués
1516arXiv cs.RO 

Multi-agent : contrôle robotique par modèles vision-langage embarqués

Une équipe de recherche présente, dans un article publié sur arXiv (arXiv:2607.07403v1), une architecture multi-agents (MAS) pour le contrôle robotique conçue pour fonctionner entièrement en local, sans dépendre d'une infrastructure de calcul externe. Le système pilote un manipulateur mobile autonome polyvalent dans un entrepôt industriel simulé, où il exécute cinq catégories de tâches : inspection de sécurité, maintenance de l'entrepôt, recherche d'objets, vérification de la qualité des colis, et réponse aux demandes humaines. L'architecture s'appuie sur des modèles vision-langage (VLM) compacts, entre 3 et 20 milliards de paramètres, avec un fine-tuning appliqué spécifiquement pour améliorer la précision de l'inspection des colis. Un agent d'orchestration baptisé "Megamind" a été conçu pour limiter les pertes de contexte que subissent les petits modèles sur des tâches de planification à long horizon. Le système a été validé en configuration hardware-in-the-loop, sur un mini PC AMD Ryzen AI, combinant simulation et matériel embarqué réel. Ce travail s'attaque à trois limites récurrentes des VLM et des modèles vision-langage-action (VLA) appliqués à la robotique : l'explicabilité, la généralisation et les besoins en calcul. En s'appuyant sur des modèles compacts exécutés localement plutôt que sur des VLA massifs hébergés dans le cloud, l'approche promet une réduction des coûts d'infrastructure et une latence moindre, deux critères déterminants pour les intégrateurs industriels qui veulent déployer des robots autonomes sans dépendre d'une connectivité permanente. Les auteurs présentent leurs résultats comme une preuve qu'une architecture multi-agents entièrement embarquée constitue une alternative viable et économique aux déploiements dépendants du cloud, avec un potentiel de transfert vers le réel. Ces résultats restent toutefois obtenus en environnement simulé ; le passage à un robot physique en conditions réelles d'entrepôt demeure l'étape déterminante pour confirmer la promesse. L'essor de VLA comme Pi-0, GR00T N2 ou Helix a mis en évidence la dépendance de nombreux systèmes robotiques à des clusters de calcul distants, un frein pour les déploiements industriels à grande échelle. En misant sur des modèles plus petits orchestrés collectivement plutôt que sur un modèle monolithique unique, cette recherche se distingue des approches dominantes centrées sur des VLA de grande taille. Les chercheurs ont publié l'environnement de simulation en open source sous licence Apache 2.0, ouvrant la voie à des extensions et comparaisons par la communauté robotique. Les prochaines étapes attendues concernent la validation sur robot physique en entrepôt réel ainsi que l'élargissement des catégories de tâches couvertes par le système.

RecherchePaper
1 source
ThorArena : évaluation de l'interaction physique humanoïde à partir de démonstrations humaines de mouvement et de force
1517arXiv cs.RO 

ThorArena : évaluation de l'interaction physique humanoïde à partir de démonstrations humaines de mouvement et de force

Des chercheurs présentent sur arXiv (2607.06052) ThorArena, un nouveau benchmark pour évaluer l'interaction physique des robots humanoïdes en tenant compte des forces de contact, et non plus seulement du mouvement. L'équipe a constitué un jeu de données réel synchronisant le mouvement corporel complet d'un humain et les forces exercées par ses deux mains, sur six tâches d'interaction physique représentatives. À partir de ces démonstrations, elle propose le Force-Aware Tracking Score (FATS), une métrique qui évalue conjointement la précision du suivi corps entier, la robustesse à différents niveaux de force, l'effort de contrôle et la survie de l'épisode (le robot garde-t-il son équilibre sans échouer). Le protocole rejoue ensuite en simulation les forces d'interaction enregistrées, offrant une interface d'évaluation standardisée pour comparer différentes politiques de contrôle whole-body. Jusqu'ici, les jeux de données et benchmarks d'imitation de mouvement humanoïde se concentraient presque exclusivement sur la cinématique, laissant de côté les forces d'interaction synchronisées. Résultat : les évaluations existantes ne captaient pas comment les forces externes affectent la précision du suivi, la stabilité et la robustesse du contrôle, un angle mort critique dès qu'un robot humanoïde doit manipuler un objet, ouvrir une porte ou interagir physiquement avec un humain. Les expériences menées sur des politiques de contrôle whole-body représentatives montrent que l'évaluation sensible aux forces révèle des écarts de performance substantiels, invisibles dans les évaluations classiques sans force. Autrement dit, des politiques qui paraissent solides sur des métriques purement cinématiques peuvent s'avérer fragiles dès qu'elles rencontrent une résistance physique réelle, ce qui interroge la fiabilité des benchmarks actuels pour juger de la maturité réelle des humanoïdes destinés aux tâches à fort contact. ThorArena s'inscrit dans la lignée des travaux récents sur l'imitation de mouvement humanoïde et le contrôle corps entier, un domaine qui a rapidement progressé sur la précision du tracking mais restait largement évalué hors contexte de contact physique. En proposant un protocole unifié et reproductible, appuyé sur des démonstrations humaines synchronisant mouvement et force sur six tâches, les auteurs visent un standard d'évaluation partagé par la communauté robotique, à l'image de ce que les benchmarks de manipulation ont apporté à l'apprentissage par renforcement. Le travail ouvre la voie à des comparaisons plus rigoureuses entre politiques de contrôle issues de différents laboratoires, et pourrait orienter les prochaines générations de robots humanoïdes vers une robustesse accrue en interaction physique réelle, un prérequis pour des déploiements industriels ou domestiques crédibles.

RecherchePaper
1 source
Apprentissage d'a priori géométriques 4D pour des modèles d'action du monde efficaces en inférence
1518arXiv cs.RO 

Apprentissage d'a priori géométriques 4D pour des modèles d'action du monde efficaces en inférence

Des chercheurs publient MECo-WAM (Multi-Expert Co-Training World Action Model), une nouvelle architecture de "World Action Model" (WAM) concue pour la manipulation robotique, decrite dans un papier reference arXiv:2607.05468v1. L'idee est d'injecter des a priori geometriques 4D dans les representations video-action pendant l'entrainement, sans alourdir le graphe d'inference au moment du deploiement. Le systeme combine trois experts durant l'entrainement : un expert video, un expert action, et un expert 4D leger supervise par des cibles relationnelles issues d'un encodeur VGGT gele. Une visibilite asymetrique entre experts empeche les raccourcis non causaux entre geometrie auxiliaire et generation d'actions. Deux mecanismes assurent le transfert des connaissances geometriques vers le chemin video-action reellement deploye : une attention a masque de lecture 4D a decroissance progressive, qui fournit un guidage geometrique restreint en debut d'entrainement puis le retire par etapes, et une distillation geometrique temporelle orientee action, qui aligne les relations geometriques intra-image et leur evolution en priorisant les zones visuelles pertinentes pour l'action du robot. Au deploiement, tous les composants 4D auxiliaires sont supprimes. Sur les benchmarks LIBERO et RoboTwin 2.0, le modele atteint respectivement 98,2% et 92,6% de reussite, avec des gains confirmes sur des taches de manipulation reelles. Ce travail cible une limite connue des WAMs actuels : l'entrainement conjoint video-action optimise generalement des latents orientes apparence, qui capturent mal la geometrie evolutive necessaire a une manipulation precise. En montrant qu'un gain de precision est possible sans surcout d'inference, MECo-WAM repond a une tension centrale pour les integrateurs et les equipes de recherche appliquee : les modeles VLA (vision-language-action) les plus performants deviennent souvent trop lourds pour un deploiement temps reel embarque. La methode illustre une tendance de fond dans la recherche en manipulation robotique, celle de deporter la complexite geometrique et multimodale vers la phase d'entrainement pour ne conserver au runtime qu'un pipeline leger, une piste directement pertinente pour les fabricants de bras robotiques et de systemes AMR qui cherchent a industrialiser des politiques apprises. MECo-WAM s'inscrit dans la lignee des World Action Models qui cherchent a unifier prediction video future et generation de sequences d'actions executables, une approche deja explorée par des architectures VLA comme Pi-0 ou GR00T N2. La reference a VGGT, encodeur de geometrie 4D reconnu en vision par ordinateur, situe le papier a l'intersection de la reconstruction 3D/4D et de l'apprentissage de politiques robotiques. Les auteurs evaluent leur approche sur deux benchmarks de simulation standards, LIBERO et RoboTwin 2.0, ainsi que sur des taches reelles, mais ne donnent pour l'instant aucun calendrier de deploiement industriel ni de partenariat avec des integrateurs : le travail reste, a ce stade, une contribution de recherche publiee sur arXiv.

RecherchePaper
1 source
Thor : vers des réactions corporelles globales de niveau humain dans des environnements intenses à fort contact
1519arXiv cs.RO 

Thor : vers des réactions corporelles globales de niveau humain dans des environnements intenses à fort contact

Des chercheurs présentent Thor, un framework de contrôle par apprentissage par renforcement permettant aux robots humanoïdes de maintenir leur stabilité corps entier lors d'interactions physiques intenses avec leur environnement. Le système a été déployé sur la plateforme Unitree G1 et repose sur deux innovations : une fonction de récompense dite "force-adaptive torso-tilt" (FAT2), qui incline le buste du robot pour reproduire une réaction humaine naturelle face à un effort de traction, et une architecture qui découple le contrôle du haut du corps, de la taille et du bas du corps tout en partageant les observations globales entre ces trois modules. Les résultats chiffrés sont significatifs : le G1 atteint un pic de force de traction de 167,7 N en reculant, soit environ 48 % de son propre poids, et 145,5 N en avançant, des progressions respectives de 68,9 % et 74,7 % par rapport à la meilleure méthode de référence testée. Le robot est également capable de tirer un chariot chargé de 130 N et d'ouvrir une porte coupe-feu à une main en exerçant 60 N. Ce travail s'attaque à un angle mort persistant de la robotique humanoïde : la plupart des démonstrations publiques montrent de la marche, de l'équilibre ou de la manipulation légère d'objets, rarement des interactions à force soutenue comme tirer un objet lourd ou pousser contre une résistance. Or ces gestes sont précisément ceux attendus dans les usages industriels, logistiques ou de secours visés par les intégrateurs. En démontrant qu'une architecture de contrôle découplée permet de gérer la haute dimensionnalité du corps humanoïde sans perdre la coordination globale, Thor apporte un élément de réponse concret au problème du contrôle force-adaptatif, souvent relégué au second plan derrière la locomotion pure. Il s'agit d'une publication de recherche arXiv (version révisée), sans annonce commerciale ni communiqué d'entreprise associé : aucun calendrier de déploiement produit n'est évoqué. Le choix du Unitree G1, plateforme chinoise à bas coût largement utilisée dans la recherche académique en robotique humanoïde, en fait un banc d'essai représentatif plutôt qu'un produit fini. Les comparaisons sont faites face à des baselines de contrôle RL existantes, sans mention d'acteurs français ou européens dans ce travail.

RecherchePaper
1 source
RoboVAST : validation automatisée de robots par scénarios, à grande échelle
1520arXiv cs.RO 

RoboVAST : validation automatisée de robots par scénarios, à grande échelle

Une équipe de recherche présente RoboVAST, un framework qui automatise la validation des systèmes robotiques à travers des scénarios de test générés et exécutés à grande échelle. Publié sur arXiv début juillet 2026, le papier détaille une méthodologie qui modélise les scénarios de manière compositionnelle, avec une génération par plugins et une exécution conteneurisée intégrant l'analyse des résultats. Pour démontrer l'approche, les chercheurs ont testé un cas de navigation robotique couvrant 5480 configurations de scénarios différentes, exécutées sur cinq cartes d'intérieur variées avec différents niveaux de bruit capteur, réglages logiciels et dispositions d'obstacles. Au total, plus de 100 000 runs ont été lancés, cumulant plus de 1800 heures de fonctionnement simulé et 1873 kilomètres parcourus virtuellement, avec vingt répétitions par configuration pour isoler les échecs systématiques des anomalies purement aléatoires. Cette approche s'attaque à un point faible bien connu mais rarement quantifié de la robotique: la sélection des scénarios de test reste largement manuelle et dépendante de l'expérience des ingénieurs, ce qui limite la reproductibilité des résultats de validation et affaiblit la confiance qu'on peut leur accorder. En systématisant la génération et l'exécution des scénarios, RoboVAST permet de distinguer les défaillances liées à une conception défaillante de celles dues au hasard, un enjeu critique pour tout intégrateur ou décideur qui doit certifier la fiabilité d'un robot avant déploiement industriel. C'est un rappel utile que les démonstrations ponctuelles ne suffisent pas à garantir un comportement robuste face à la diversité réelle des conditions opérationnelles, et que le passage à l'échelle des tests est aussi important que celui des capacités du robot lui-même. Le constat de départ n'est pas nouveau: la communauté robotique reconnaît depuis longtemps que ses méthodes de validation manquent de rigueur statistique comparées à d'autres industries critiques comme l'aéronautique ou l'automobile, où la validation par scénarios simulés à très grande échelle est une pratique établie. RoboVAST cherche à transposer cette culture à la robotique mobile et à la navigation autonome, en s'appuyant sur des specs de campagne déclaratives et une infrastructure d'exécution scalable. Le papier ne mentionne pas de partenariat industriel ni de déploiement en conditions réelles à ce stade: il s'agit d'une contribution méthodologique et open à la communauté de recherche, dont les suites logiques seraient une extension à d'autres classes de robots (manipulation, humanoïdes) et une adoption par des laboratoires ou industriels cherchant à professionnaliser leurs propres pipelines de validation.

RecherchePaper
1 source
RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique
1521arXiv cs.RO 

RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique

Des chercheurs (l'article ne precise pas d'affiliation institutionnelle dans le resume) publient sur arXiv, le 7 juillet 2026, RynnWorld-4D, un modele generatif de monde en 4D pour la manipulation robotique. Le systeme produit simultanement, a partir d'une seule image RGB-D et d'une instruction en langage naturel, des images RGB futures, des cartes de profondeur et des flux optiques, le tout dans un unique processus de diffusion. Son architecture a trois branches combine attention cross-modale et RoPE 3D image par image pour que l'apparence visuelle, la geometrie et le mouvement evoluent de maniere coherente. Pour l'entrainer, les auteurs ont constitue Rynn4DDataset 1.0, un jeu de donnees de plus de 254,4 millions d'images issues de videos de manipulation, a la fois humaines en vue egocentrique et robotiques, avec des pseudo-etiquettes de profondeur et de flux optique. Un module derive, RynnWorld-4D-Policy, exploite directement les representations internes du modele en un seul passage avant, sans les etapes couteuses de debruitage iteratif, pour generer des actions robotiques en boucle fermee. L'interet de cette approche tient a l'hypothese qu'elle teste: en combinant RGB, profondeur et flux optique plutot qu'en travaillant sur de simples pixels 2D, la representation obtenue se rapprocherait davantage des commandes bas niveau de l'effecteur, reduisant l'ecart classique entre prediction du monde et apprentissage de politique. Sur des taches reelles de manipulation bimanuelle dexterite, les auteurs rapportent des resultats a l'etat de l'art, en particulier sur les taches exigeant precision spatiale et coordination temporelle, deux points ou les approches VLA generalistes butent souvent en conditions reelles. Il s'agit pour l'instant d'un travail de recherche publie en preprint, sans deploiement industriel ni produit commercialise. Il s'inscrit dans la lignee des modeles de monde appliques a la robotique, aux cotes d'approches comme GR00T N2 ou Pi-0, mais mise sur une fusion multimodale plus riche et un passage a l'echelle des donnees d'entrainement. Les prochaines etapes attendues concernent la generalisation a d'autres plateformes robotiques et la validation hors des benchmarks controles du laboratoire.

IA physiqueActu
1 source
Planifier puis évaluer : la planification multi-cibles améliore les pipelines de préhension par apprentissage
1522arXiv cs.RO 

Planifier puis évaluer : la planification multi-cibles améliore les pipelines de préhension par apprentissage

La préhension multi-doigts autonome reste un défi central en manipulation robotique. Les approches par optimisation directe donnent de bons résultats mais sont sensibles à l'initialisation et coûteuses en temps de calcul. Le cadre alternatif dit "generator-evaluator-planner" fonctionne en trois étapes : un générateur propose des candidats de prise, un évaluateur les classe par probabilité de succès, puis un planificateur de trajectoire tente d'atteindre la prise la mieux classée. En cas d'échec, le processus recommence avec la prise suivante, multipliant les calculs. Une équipe de recherche propose désormais d'inverser la logique dans un article publié sur arXiv (2509.07162v2, version révisée) : plutôt que d'évaluer les prises avant de planifier, le système planifie d'abord des trajectoires vers plusieurs cibles de préhension générées, puis l'évaluateur estime la probabilité de succès directement à la configuration terminale réellement atteinte par chaque trajectoire. Le robot exécute ensuite celle jugée la plus prometteuse. Les tests montrent une amélioration par rapport au cadre traditionnel, sur différents objets, générateurs et planificateurs de mouvement, avec une généralisation validée en conditions réelles, notamment sur des étagères et hauteurs de table variées. Ce changement d'ordre entre planification et évaluation s'attaque à un compromis structurel qui pénalise les pipelines de préhension actuels : évaluer une prise dans sa configuration idéale, non garantie atteignable, oblige soit à relancer coûteusement l'optimisation de trajectoire sur des candidats moins bons avec une probabilité de succès plus faible, soit à assouplir les seuils de précision du planificateur, ce qui dégrade la fiabilité de l'estimation. Pour les intégrateurs et les équipes travaillant sur le bin-picking, l'automatisation d'entrepôt ou la manipulation industrielle, ce goulot d'étranglement se traduit concrètement par des cycles plus lents ou des taux d'échec plus élevés. En évaluant la prise réellement atteignable plutôt qu'une cible théorique, l'approche vise à rapprocher les métriques de succès en simulation de la performance effective sur le terrain, un enjeu classique de l'écart entre démonstration et réalité en robotique apprenante. Le travail s'inscrit dans la lignée des recherches sur la préhension dextre par apprentissage, où les cadres générateur-évaluateur-planificateur se sont généralisés ces dernières années comme alternative aux méthodes d'optimisation pure. Les auteurs mettent à disposition un site dédié au projet (martinmatak.github.io/fpte) présentant leurs résultats expérimentaux. La validation en environnements réels et non simulés, sur du matériel varié, distingue cette contribution des nombreux travaux restant cantonnés à la simulation, même si l'ampleur du déploiement industriel de cette méthode reste à démontrer au-delà du cadre académique.

RecherchePaper
1 source
MOSAIC : planification de manipulation centrée sur les compétences par simulation physique
1523arXiv cs.RO 

MOSAIC : planification de manipulation centrée sur les compétences par simulation physique

Le fossé entre le nombre potentiellement infini de compétences robotiques disponibles et l'incapacité des robots à les enchaîner de façon fiable sur des tâches longues reste un problème central en robotique. Une équipe de chercheurs présente MOSAIC, une méthode de planification centrée sur les compétences qui s'appuie sur la simulation physique pour estimer, avant exécution, la probabilité de succès de chaque compétence dans un contexte donné. Plutôt que d'explorer pas à pas un espace de séquences quasi infini, comme le font les méthodes incrémentales classiques, ou de raisonner sur des représentations symboliques simplifiées mais fragiles et coûteuses à construire à la main, MOSAIC combine deux familles complémentaires de compétences: les Générateurs, qui identifient des « îlots de compétence », c'est-à-dire des zones où une action donnée réussit de façon démontrable, et les Connecteurs, qui relient ces trajectoires entre elles en résolvant des problèmes aux limites. L'équipe a testé l'approche sur des tâches de manipulation longues et complexes, en simulation comme sur un robot réel, en mobilisant un ensemble hétérogène d'outils: modèles de diffusion génératifs, algorithmes classiques de planification de mouvement et modèles spécialisés en manipulation. Le papier, une version révisée publiée sur arXiv, est accompagné d'un site de démonstrations (skill-mosaic.github.io). L'enjeu dépasse la seule performance algorithmique. Le planning long-horizon par composition de compétences est considéré depuis des années comme un verrou pour des robots véritablement généralistes, capables d'assembler des briques génériques pour résoudre des tâches nouvelles sans reprogrammation dédiée. En concentrant l'effort de recherche sur les régions où chaque compétence est réellement fiable, plutôt que de faire confiance à une couverture uniforme de l'espace des possibles, MOSAIC apporte une réponse concrète à la fragilité chronique des approches symboliques et à l'explosion combinatoire des méthodes purement incrémentales, un sujet sensible à l'heure où l'industrie mise massivement sur les modèles vision-langage-action pour la généralisation. Cette contribution s'inscrit dans la lignée des travaux de planification tâche-et-mouvement (TAMP), où la tension entre robustesse symbolique et flexibilité des méthodes apprises est documentée de longue date. L'essor récent des politiques de diffusion et des modèles génératifs comme briques de bas niveau change la donne: MOSAIC propose justement un cadre capable d'orchestrer ce type d'outils hétérogènes sans passer par une couche symbolique rigide. La publication d'une troisième version sur arXiv suggère un travail encore en cours de révision, avec des démonstrations concrètes disponibles pour les équipes de recherche souhaitant évaluer la méthode sur leurs propres bancs d'essai.

RecherchePaper
1 source
Au-delà de la sémantique liée aux points : champs sémantiques centrés sur l'objet pour une manipulation généralisable
1524arXiv cs.RO 

Au-delà de la sémantique liée aux points : champs sémantiques centrés sur l'objet pour une manipulation généralisable

Un nouvel article publié sur arXiv (référence 2607.03163v1) propose une méthode pour améliorer la manipulation robotique generalisable en dotant les nuages de points 3D d'une compréhension sémantique stable des parties fonctionnelles d'un objet, poignées, têtes d'outils, ouvertures, zones de préhension. Les nuages de points bruts capturent la géométrie mais pas la sémantique, et l'échantillonnage varie selon le point de vue, le capteur ou l'instance d'objet observée. Les auteurs introduisent un champ sémantique continu et centré sur l'objet, entraîné à partir de modèles d'objets annotés par parties, qui associe à toute position 3D interrogée un embedding sémantique conscient de la fonction de la partie concernée. Une fois entraîné, ce champ est figé et sert à générer des nuages de points sémantiques utilisés comme conditionnement au niveau de l'objet pour des politiques de manipulation. Les tests, menés sur les tâches de simulation RoboTwin ainsi que sur de la manipulation bimanuelle réelle, montrent une amélioration des performances par rapport aux approches de référence: nuage de points brut, lifting de features 2D vers la 3D, et features ponctuelles 3D discrètes. L'enjeu dépasse le simple gain de précision. Pour l'industrie de la manipulation robotique et les concepteurs de politiques de type VLA (vision-language-action), le vrai problème n'est pas de reconnaître un objet mais de savoir où et comment le saisir de façon fiable, quel que soit l'angle de vue ou l'exemplaire précis rencontré. En rendant la sémantique indépendante de l'échantillonnage observé, cette approche s'attaque directement à un point faible connu des pipelines actuels: la fragilité des indices sémantiques ponctuels quand la scène ou le capteur changent. C'est un argument de plus dans le débat sur la généralisation réelle des politiques de manipulation, un enjeu central alors que le secteur cherche à dépasser les démonstrations en environnement contrôlé. Ce travail s'inscrit dans la lignée des efforts pour enrichir la perception 3D en robotique, après les méthodes de projection de features 2D issues de modèles de vision-langage et les représentations ponctuelles 3D discrètes, deux approches dont l'article démontre les limites en comparaison directe. RoboTwin, la plateforme de simulation utilisée, sert de banc d'essai standard pour ce type d'évaluation comparative dans la communauté. Les auteurs mettent à disposition une page projet dédiée, laissant présager la publication du code et des modèles pour permettre une réplication et une adoption plus large par la communauté de recherche en manipulation robotique.

RecherchePaper
1 source
DSWAM : un modèle fondation à double système pour la manipulation robotique fine
1525arXiv cs.RO 

DSWAM : un modèle fondation à double système pour la manipulation robotique fine

Des chercheurs publient sur arXiv (référence 2607.04927v1) DSWAM, un nouveau modèle "Dual-System World Action Model" destiné à la manipulation robotique fine. Le système combine deux composants : un exécuteur System 1 basé sur un World Action Model (WAM), qui reste le chemin de contrôle par défaut, et un planificateur System 2 de type vision-langage, activé seulement quand une tâche nécessite une décomposition en sous-tâches. Ce planificateur prédit des sous-tâches exécutables à partir d'un court historique visuel et d'une consigne globale, tandis que l'exécuteur WAM génère les actions en tenant compte du contexte du monde observé. Contrairement aux WAM classiques, DSWAM ne génère pas de vidéo future à l'inférence : il prédit directement des séquences d'actions ("action chunks"), tout en étant entraîné avec une co-supervision vidéo. Pour un déploiement temps réel sur robot physique, les auteurs ajoutent une accélération TensorRT, une exécution asynchrone et un mécanisme de "real-time chunking" (RTC) afin que les requêtes du modèle ne bloquent pas le contrôle moteur. Le système est évalué sur le protocole DeMaVLA, dédié à la manipulation d'objets déformables, avec plateforme robotique, données de pré-entraînement et post-entraînement identiques à celles utilisées pour comparer aux politiques VLA. L'intérêt principal de ce travail est méthodologique autant que technique : jusqu'ici, la comparaison entre approches VLA (Vision-Language-Action) et WAM souffrait d'un manque de protocole équitable, chaque camp utilisant ses propres données, robots et critères d'évaluation. En imposant un cadre contrôlé (DeMaVLA), DSWAM cherche à trancher un débat central du secteur robotique : les modèles WAM, réputés plus ancrés physiquement mais moins doués pour planifier des instructions complexes en langage naturel, peuvent-ils combler cet écart via un module de planification optionnel, sans sacrifier la vitesse d'exécution nécessaire au contrôle temps réel ? Ce travail s'inscrit dans la lignée des VLA génériques comme Pi-0 ou GR00T N2, qui ont démontré la viabilité de politiques apprises à grande échelle mais peinent parfois sur des tâches multi-étapes complexes typiques des environnements domestiques. En positionnant explicitement le System 2 comme optionnel plutôt que systématique, DSWAM propose une architecture hybride que d'autres laboratoires pourraient reprendre pour arbitrer entre réactivité et capacité de planification, un compromis clé pour la manipulation fine à l'approche de déploiements domestiques réels.

RechercheActu
1 source
Arbres de croyance gaussiens en temps continu pour la planification de mouvement
1526arXiv cs.RO 

Arbres de croyance gaussiens en temps continu pour la planification de mouvement

Un article de recherche publié sur arXiv (2607.02884) propose une nouvelle méthode de planification de trajectoire pour robots évoluant sous incertitude, en temps continu plutôt qu'en temps discret. Les auteurs modélisent la dynamique du robot comme une équation différentielle stochastique linéaire à temps continu, tandis que les mesures des capteurs n'arrivent qu'à des instants discrets. Ils construisent un modèle de propagation de croyance ("belief") hybride : entre deux mesures, la croyance évolue selon des équations différentielles ordinaires, puis subit une mise à jour brusque par filtre de Kalman à chaque nouvelle mesure. Pour garantir la sécurité, l'équipe introduit un vérificateur basé sur des fonctions barrières de croyance, capable de certifier la sécurité sur des segments entiers de trajectoire plutôt que seulement aux points d'échantillonnage. La méthode a été intégrée aux planificateurs RRT et SST et testée sur plusieurs environnements de référence, avec des taux de réussite élevés et un respect robuste des contraintes probabilistes, notamment dans des passages étroits. L'enjeu concret est la fiabilité des robots mobiles et manipulateurs en environnement incertain, un point critique pour les intégrateurs qui déploient des AMR ou des bras robotiques en usine. Les approches classiques de planification, qui ne vérifient la sécurité qu'à des nœuds discrets du chemin, peuvent laisser passer des violations de contraintes entre deux points d'échantillonnage, un angle mort particulièrement dangereux dans les couloirs étroits ou les zones à forte densité d'obstacles. En traitant l'incertitude et la vérification de sécurité en temps continu, cette approche comble une lacune connue des méthodes de planification sous incertitude, sans changer la nature probabiliste du problème. Ce travail s'inscrit dans la lignée des méthodes de planification sous incertitude basées sur des arbres de croyance, où les mises à jour par filtre de Kalman servent depuis longtemps à estimer l'état d'un robot à partir de mesures bruitées. En combinant cette estimation continue avec les planificateurs RRT et SST, largement utilisés en robotique mobile, les auteurs proposent une extension directement compatible avec les pipelines de planification existants, plutôt qu'un cadre entièrement nouveau à réimplémenter.

RecherchePaper
1 source
Transition de phase de nuée et réponses aux menaces dans des essaims de drones autonomes bio-inspirés
1527arXiv cs.RO 

Transition de phase de nuée et réponses aux menaces dans des essaims de drones autonomes bio-inspirés

Ce document technique arXiv présente un algorithme de vol en essaim tridimensionnel inspiré du comportement animal, où chaque drone n'interagit qu'avec un nombre minimal de voisins influents, en s'appuyant uniquement sur des règles locales d'alignement et d'attraction, sans coordination centralisée ni partage global de position. En faisant varier systématiquement ces deux paramètres de gain, les chercheurs ont établi un diagramme de phase révélant des transitions nettes entre comportement de type essaim dispersé et banc compact façon poisson, ainsi qu'une zone critique où la susceptibilité du système, les fluctuations de polarisation et la capacité de réorganisation atteignent leur maximum. Des essais en extérieur avec un essaim réel de dix drones, couplés à des simulations reposant sur un modèle calibré de dynamique de vol, montrent que faire fonctionner l'essaim près de cette transition critique améliore sa réactivité aux perturbations externes. Confronté à un intrus, l'essaim exécute des virages collectifs rapides, des expansions transitoires, puis retrouve un alignement élevé en quelques secondes seulement. Ce résultat est significatif car il démontre que des règles d'interaction purement locales et minimales suffisent à générer plusieurs phases collectives distinctes, sans nécessiter d'architecture de contrôle centralisée coûteuse en calcul ou en communication, un frein habituel au passage à l'échelle des essaims de drones. La modulation de deux simples gains offre ainsi un mécanisme efficace pour ajuster stabilité, flexibilité et résilience selon le contexte opérationnel. Pour les intégrateurs de systèmes multi-drones, cela ouvre une voie vers des essaims capables de basculer dynamiquement entre un mode compact et économe en énergie et un mode dispersé et réactif, une propriété recherchée pour la surveillance, l'inspection d'infrastructures ou les applications de sécurité type détection d'intrusion, sans complexifier l'architecture logicielle embarquée. Cette approche s'inscrit dans une longue tradition de modélisation du mouvement collectif animal, des premiers modèles de boids aux travaux sur les bancs de poissons et les nuées d'étourneaux, transposée ici à la robotique aérienne réelle plutôt qu'à la seule simulation, ce qui reste rare dans ce champ de recherche. La validation en extérieur avec dix drones physiques, et non uniquement en environnement contrôlé, constitue une contribution notable face à la littérature dominée par les simulations numériques. Les prochaines étapes attendues concernent le passage à l'échelle vers des essaims plus larges et l'évaluation de la robustesse de ces transitions de phase face à des perturbations environnementales plus variées, notamment pour des usages en défense anti-drones ou en recherche et sauvetage.

RecherchePaper
1 source
SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)
1528arXiv cs.RO 

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)

Une équipe de recherche publie SEAM (Smooth Execution of Action-Chunked Motion), une méthode d'inférence sans entraînement destinée aux politiques Vision-Language-Action (VLA) à appariement de flux (flow matching), décrite dans un article déposé sur arXiv (2607.04609). Testée sur le benchmark de simulation LIBERO-10 avec le modèle pi0.5 de Physical Intelligence, la méthode réduit de 28% les à-coups (jerk) aux frontières entre segments de trajectoire et de 27% la discontinuité de transition entre ces segments, tout en préservant le taux de réussite des tâches et en ajoutant un coût de calcul quasi nul par rapport à la version non guidée. Son mécanisme central, le Velocity-guided Loss Steering (VLS), exploite le fait que la fin non exécutée du segment précédent reste disponible comme référence de cohérence une fois le préfixe consommé par le robot, et applique une correction analytique après chaque étape d'Euler sans rétropropager dans le réseau. Le problème visé, la bifurcation multimodale, touche toutes les architectures VLA qui découpent leurs actions en segments de longueur fixe pour limiter la fréquence d'inférence, une approche partagée par des modèles comme pi0, GR00T N2 ou Helix. Quand deux segments adjacents, générés à partir de latents gaussiens indépendants, convergent vers des modes de trajectoire incompatibles, le robot produit des à-coups brusques aux jonctions, un symptôme visible de l'écart entre démonstration et exécution réelle. Les solutions existantes, rétropropagation à chaque étape de débruitage, échantillonnage par rejet ou réentraînement complet, imposaient toutes un compromis entre coût de calcul et fiabilité des tâches. Une correction déployable à l'inférence, sans toucher aux poids du modèle, intéresse directement les intégrateurs qui opèrent des politiques VLA figées sur du matériel de production. L'évaluation reste toutefois cantonnée à la simulation LIBERO-10, un banc d'essai standard mais éloigné des conditions réelles d'un bras ou d'un humanoïde en usine. La validation sur matériel physique et l'extension à d'autres politiques que pi_0.5 constituent les étapes naturelles avant toute adoption industrielle.

RechercheActu
1 source
IndustryNav : explorer le raisonnement spatial des agents incarnés dans la navigation industrielle dynamique
1529arXiv cs.RO 

IndustryNav : explorer le raisonnement spatial des agents incarnés dans la navigation industrielle dynamique

Des chercheurs ont publié IndustryNav, premier benchmark de navigation industrielle dynamique conçu pour évaluer le raisonnement spatial des agents visuels et langagiers (VLLM) en conditions actives. Le dispositif s'appuie sur douze scénarios d'entrepôt haute fidélité créés sous Unity, intégrant objets mobiles et déplacements humains simulés. Les auteurs proposent un pipeline de navigation PointGoal en zero-shot, combinant vision égocentrique et odométrie globale pour tester la planification à la fois locale et globale. Deux métriques originales, le taux de collision et le taux d'alerte, mesurent spécifiquement les comportements orientés sécurité. Quatorze modèles de pointe ont été testés, dont GPT-5.2, Claude-4.6 et Gemini-3, sur cet ensemble de tâches de navigation dynamique. Les résultats montrent que les modèles propriétaires conservent un avantage constant sur les modèles ouverts, mais qu'aucun agent, quel qu'il soit, ne maîtrise réellement l'évitement d'obstacles, la planification de trajectoire robuste ou l'exploration active. C'est un signal important pour les intégrateurs et décideurs qui envisagent de déployer des agents pilotés par VLLM dans des entrepôts ou des lignes de production: la performance impressionnante de ces modèles sur des benchmarks domestiques statiques ne se transfère pas automatiquement à des environnements industriels dynamiques et peuplés d'humains. Le papier vient ainsi nuancer le discours ambiant sur la maturité des agents incarnés génériques, en montrant que la perception passive ne suffit pas là où la sécurité active est requise. Cette étude comble un vide identifié dans la littérature existante: la quasi-totalité des benchmarks d'agents incarnés se limite à des environnements domestiques passifs et statiques, et évalue des capacités isolées plutôt qu'une performance holistique. IndustryNav se positionne comme le premier effort ciblant spécifiquement le domaine industriel avec complexité dynamique. Publié sur arXiv (version révisée du texte initial), le travail appelle la recherche en robotique incarnée à dépasser la simple perception pour développer des comportements stables, exploratoires et sûrs en environnement réel mouvant, une orientation qui concerne directement les futurs déploiements d'AMR et de robots mobiles en logistique.

RecherchePaper
1 source
XS-VLA : associe distillation spatiale à gros grain et appariement de flux latent pour un contrôle robotique léger
1530arXiv cs.RO 

XS-VLA : associe distillation spatiale à gros grain et appariement de flux latent pour un contrôle robotique léger

Des chercheurs publient sur arXiv (juillet 2026) XS-VLA, un modele Vision-Language-Action en deux etapes concu pour le controle robotique embarque a faible cout de calcul. La premiere etape distille les connaissances spatiales d'un grand modele, Qwen3-VL-4B, vers un squelette leger SmolVLM2 de seulement 0,25 milliard de parametres, via un fine-tuning sur des descriptions spatiales grossieres. La seconde etape conditionne ce squelette enrichi avec une politique de Latent Flow Matching, qui combine un autoencodeur variationnel conditionnel (CVAE) et une dynamique de flow matching pour modeliser des distributions d'actions multimodales, plutot qu'un controleur deterministe classique. Sur le benchmark de simulation LIBERO, XS-VLA atteint l'etat de l'art parmi les modeles de moins de 0,5 milliard de parametres, avec un gain de taux de reussite moyen allant jusqu'a 7,2 points par rapport a la base SmolVLA 0,25B, dont 23 points sur la tache LIBERO-Long, et depasse meme la version SmolVLA a 2,2 milliards de parametres, pres de neuf fois plus grosse. Les auteurs revendiquent aussi une acceleration de 3,2 fois du temps d'execution de mission face a la precedente politique de flow matching legere. Le resultat cible un probleme concret pour l'industrie robotique: les grands modeles vision-langage comprennent bien l'espace mais sont trop lourds pour du controle temps reel embarque, tandis que les modeles legers souffrent generalement de "cecite spatiale". Si les chiffres se confirment au-dela de la simulation, cela suggere qu'un entrainement cible, distillation spatiale puis generation d'actions par flow matching, peut compenser un manque de parametres, ce qui interesse directement les integrateurs cherchant a deployer des VLA sur du materiel edge limite plutot que sur des clusters GPU. Ce travail s'inscrit dans la vague de modeles VLA ouverts lancee par des politiques comme Pi-0, GR00T N2 ou Helix, et prolonge specifiquement la lignee SmolVLA d'Hugging Face en visant l'efficacite plutot que la taille. Il reste toutefois a un stade de recherche: les resultats sont mesures sur LIBERO, un benchmark simule standard mais eloigne des conditions reelles, et aucune validation sur robot physique n'est mentionnee a ce stade.

IA physiqueActu
1 source
Robots à bras multiples : apprentissage neuronal de l'accessibilité Hamilton-Jacobi pour la planification décentralisée de trajectoires sûres
1531arXiv cs.RO 

Robots à bras multiples : apprentissage neuronal de l'accessibilité Hamilton-Jacobi pour la planification décentralisée de trajectoires sûres

Une équipe de chercheurs propose NeHMO, une méthode d'apprentissage par réseau de neurones basée sur la réductibilité de Hamilton-Jacobi (HJR) pour la planification de mouvement multi-bras en sécurité et de façon décentralisée. Le papier, publié sur arXiv (arXiv:2507.13940, version 2), s'attaque au problème de la coordination de plusieurs bras robotiques évoluant dans un espace de configuration couplé et de haute dimension. Plutôt que de s'appuyer sur un planificateur centralisé qui coordonne tous les bras mais peine à passer à l'échelle en temps réel, ou sur des méthodes décentralisées existantes qui supposent un comportement prévisible des autres bras, les auteurs entraînent une fonction de valeur de sécurité qui capture les contraintes de collision inter-bras dans le pire des cas. Cette représentation apprise alimente ensuite un module d'optimisation de trajectoire décentralisé, exécutable en temps réel sur chaque bras indépendamment. L'enjeu dépasse l'exercice académique: la planification multi-bras sûre est un goulot d'étranglement concret pour les cellules de fabrication et les postes d'assemblage où plusieurs manipulateurs partagent un espace de travail restreint. Les approches centralisées classiques deviennent impraticables dès que le nombre de bras augmente, tandis que les méthodes décentralisées à base d'apprentissage profond échouent dès qu'un bras voisin dévie d'un comportement anticipé, c'est à dire exactement le scénario que redoutent les intégrateurs industriels en environnement non coopératif. En garantissant une sécurité dans le pire des cas plutôt qu'une prédiction probable de comportement, NeHMO répond à une limite reconnue des architectures actuelles: la fragilité face à l'imprévisibilité, sans sacrifier le passage à l'échelle. La réductibilité de Hamilton-Jacobi est un outil classique de la théorie du contrôle pour la vérification formelle de sécurité, historiquement trop coûteux en calcul pour des systèmes multi-bras à haute dimension. L'apport ici est de le rendre tractable via une approximation neuronale, généralisable à différentes configurations de manipulateurs sans réentraînement complet. Selon les auteurs, la méthode surpasse les références de l'état de l'art sur des tâches de planification multi-bras jugées difficiles. Il s'agit toutefois d'un résultat de recherche publié en preprint, sans partenaire industriel ni déploiement annoncé à ce stade.

RecherchePaper
1 source
ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement
1532arXiv cs.RO 

ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement

Le laboratoire à l'origine de ce papier arXiv (identifiant 2603.28545, version 2, soumission de type remplacement) présente ManipArena, un cadre d'évaluation standardisé pour la manipulation robotique en conditions réelles. Le benchmark couvre 20 tâches distinctes, s'appuie sur 10 812 trajectoires expertes et 13,5 millions d'images, pour un total d'environ 188 heures de fonctionnement robotique cumulées sur des scénarios de manipulation de table et de manipulation mobile. Le protocole combine variation de tâches définie par schéma, essais stratifiés en distribution, en décalage visuel et hors distribution sémantique, notation par crédit partiel au niveau des sous-tâches, annotations linguistiques à trois niveaux de granularité, signaux moteurs bas niveau, et environnements simulés jumeaux reconstruits à partir de scènes physiques réelles. Les chercheurs ont utilisé ce dispositif pour évaluer sept configurations de manipulation de table, couvrant à la fois des modèles vision-langage-action (VLA) et des modèles dits world-action. L'enjeu dépasse la simple création d'un nouveau jeu de tests. Les benchmarks en simulateur, bien que reproductibles et faciles à mettre à l'échelle, ne capturent pas fidèlement l'écart entre simulation et réel, ce dernier étant causé par le bruit de perception, la dynamique de contact, la latence et les erreurs de calibration. À l'inverse, les évaluations sur robots physiques existantes sont dispersées entre plateformes, scènes et règles de notation différentes, ce qui rend toute comparaison rigoureuse quasi impossible. Résultat clé de l'étude: les performances mesurées sur robot réel ne dépendent pas seulement de l'architecture du modèle, mais aussi de sa provenance, du régime de fine-tuning, de l'échantillonnage des données d'entraînement et de la granularité des annotations. Pour les intégrateurs et décideurs industriels, ce constat invite à relativiser fortement les annonces de performance basées uniquement sur des démonstrations vidéo ou des scores en simulation. Ce travail s'inscrit dans la course actuelle autour des modèles généralistes de contrôle robotique (VLA et world-action), un domaine où les affirmations de généralisation restent difficiles à vérifier faute de méthodologie commune. En proposant un référentiel reproductible avec attribution fine des échecs, ManipArena vise à devenir un outil diagnostique de référence pour mesurer les véritables limites de capacité de ces modèles, plutôt qu'un simple classement de plus.

RecherchePaper
1 source
Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée
1533arXiv cs.RO 

Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée

Un article mis à jour sur arXiv (version 2, référence 2606.22982) présente CLS-DP, un cadre décentralisé pour la manipulation multi-bras par des agents robotiques. Le système répond à un problème concret : les approches centralisées de coordination multi-agents passent mal à l'échelle quand le nombre de bras augmente, car elles exigent une vue globale partagée et des échanges d'état constants. CLS-DP suit le paradigme CTDE (entraînement centralisé, exécution décentralisée) : pendant l'entraînement, il distille dans un espace latent les dynamiques privilégiées de coordination multi-agents ; au déploiement, chaque bras infère ce "latent collaboratif" à partir de sa seule observation RGB locale et d'une instruction de tâche partagée, puis conditionne dessus son processus de débruitage par diffusion, sans communication inter-agents ni état global explicite. Sur six tâches du benchmark RoboFactory impliquant de deux à quatre agents, CLS-DP atteint un taux de réussite moyen de 38%, contre 20% pour la meilleure référence centralisée testée et seulement 9% pour une version décentralisée privée du latent collaboratif. Ce résultat contredit une hypothèse répandue en robotique multi-bras : qu'une coordination fine nécessite forcément une communication explicite ou une vue centralisée de la scène. En montrant qu'un latent appris peut encoder implicitement les dynamiques collaboratives à partir d'une simple image locale, CLS-DP ouvre la voie à des cellules multi-robots qui passent à l'échelle sans coût de communication croissant, un enjeu direct pour les intégrateurs qui déploient des postes de manipulation coopérative en usine. Les cartes d'attribution des auteurs montrent que chaque agent, conditionné sur ce latent, porte une attention élevée non seulement sur ses propres articulations et sa pince, mais aussi sur celles de ses coéquipiers pendant toute l'exécution, preuve que l'information de coordination circule réellement dans la représentation apprise. Pour qui évalue des architectures VLA (vision-language-action) en environnement multi-agent, le travail suggère qu'on peut réduire le coût de calcul par agent tout en égalant, voire en dépassant, des références centralisées plus lourdes. Ce travail s'inscrit dans la lignée des politiques de manipulation par diffusion, devenues une alternative courante au clonage comportemental classique, et s'appuie sur RoboFactory comme benchmark commun pour l'évaluation multi-agents. Le choix du paradigme CTDE rapproche aussi cette recherche des méthodes d'apprentissage par renforcement multi-agents, où entraînement centralisé et exécution décentralisée sont devenus un standard pour équilibrer performance et scalabilité. L'article ne mentionne aucun déploiement industriel ni partenariat avec un fabricant de bras robotiques : il s'agit pour l'instant d'un résultat validé en simulation, sans calendrier annoncé de transfert vers du matériel réel. L'étape logique suivante serait une validation sim-to-réel sur des cellules physiques à deux ou trois bras, véritable épreuve pour une méthode qui promet de faire tenir la coordination fine dans une seule caméra RGB par agent.

RecherchePaper
1 source
Bridge-WA : prédire où et comment le monde change pour l'action robotique
1534arXiv cs.RO 

Bridge-WA : prédire où et comment le monde change pour l'action robotique

Une équipe de chercheurs présente Bridge-WA, un nouveau framework "world-action" léger destiné aux modèles de manipulation robotique vision-langage-action (VLA), décrit dans un article publié sur arXiv (2607.02195v1) début juillet. Plutôt que de s'appuyer sur de lourds modèles génératifs du monde ou des séquences denses d'images futures pour anticiper les changements de scène, coûteux en calcul et souvent focalisés sur des détails visuels peu utiles au contrôle, Bridge-WA distille un "teacher" figé de prédiction des changements futurs en trois représentations compactes : des tokens de résultat visé, des cartes de changement pour identifier les zones d'intervention, et des cartes de flux de mouvement pour la direction locale des transitions. Un module appelé WorldBridge conditionne ensuite le transformer d'action sur ces trois priors via des mémoires d'attention multi-sources et des biais spatio-temporels, tandis que le modèle enseignant est retiré au moment de l'inférence. Les auteurs évaluent leur approche sur les benchmarks VLABench, RoboTwin2.0 et LIBERO-Plus, ainsi que sur des tests en robot réel, avec des gains en taux de réussite, en progression de tâche et en robustesse, particulièrement marqués face à des variations visuelles hors distribution. L'intérêt pour l'industrie robotique tient à la promesse d'un compromis efficacité-robustesse : obtenir les bénéfices d'un raisonnement sur l'évolution future de la scène sans payer le coût de génération d'images denses au déploiement, un frein connu pour l'intégration temps réel des modèles VLA. En filtrant les facteurs de nuisance comme le fond, l'éclairage ou les distracteurs pour se concentrer sur où et comment la scène va changer, l'approche s'attaque directement à l'écart généralisation/robustesse qui limite souvent le passage de la démonstration en labo au déploiement industriel. Le travail s'inscrit dans la lignée des modèles VLA à grande échelle qui cherchent à coupler perception, langage et action, un axe de recherche actif depuis l'essor de modèles génériques de manipulation. Comme il s'agit ici de résultats de recherche publiés par les auteurs eux-mêmes sur leurs propres benchmarks, sans déploiement industriel ni validation tierce à ce stade, la prudence reste de mise sur la portée réelle des gains annoncés. Le code et des visualisations sont mis à disposition sur le site du projet, ouvrant la voie à une reproduction indépendante des résultats.

IA physiqueActu
1 source
« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »
1535arXiv cs.RO 

« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »

Des chercheurs proposent une nouvelle méthode de sécurité pour les modèles Vision-Language-Action (VLA), les systèmes d'IA qui pilotent de plus en plus de robots humanoïdes et bras manipulateurs. Publiée sur arXiv (référence 2607.01378), l'étude cible spécifiquement les VLA basés sur le flow matching, une technique qui prédit non pas une seule action mais une trajectoire complète via un processus itératif de débruitage neuronal, à l'image de Pi-0, GR00T N2 ou Helix. Le problème identifié: les garde-fous de sécurité actuels ne bloquent que l'action immédiate du robot, sans anticiper les collisions à venir. La méthode proposée, baptisée guidage neuro-symbolique, reformule la sécurité comme un problème d'optimisation sous contrainte à norme minimale, appliqué directement pendant le débruitage des trajectoires intermédiaires bruitées. Testée sur le benchmark SafeLIBERO, elle atteint 82,8% d'évitement de collision et 81,6% de réussite des tâches, soit des gains de 6,3 et 19,8 points par rapport aux méthodes à une seule étape, les progrès les plus marqués apparaissant sur les tâches longues où les erreurs de trajectoire s'accumulent. Pour l'industrie robotique, cette avancée s'attaque à un angle mort réel du déploiement des VLA en usine ou en entrepôt: la plupart des systèmes actuels réagissent après coup plutôt que d'anticiper. Une correction en amont, intégrée au cœur du processus génératif plutôt qu'ajoutée en filtre externe, pourrait réduire les arrêts d'urgence et les interventions humaines sur les lignes où ces modèles pilotent des bras ou des robots mobiles autonomes (AMR). Le gain le plus significatif sur les tâches longues est particulièrement pertinent pour les intégrateurs, puisque c'est précisément sur ces séquences que les architectures VLA actuelles échouent le plus souvent en conditions réelles. Ce travail s'inscrit dans une littérature grandissante sur la sécurité des VLA, alors que ces modèles passent rapidement du stade de démonstration à des déploiements pilotes chez plusieurs acteurs de la robotique humanoïde. Les auteurs comparent leur approche aux méthodes de sécurité "single-step" existantes et proposent des démonstrations vidéo sur leur page de projet dédiée. Reste à voir si cette approche neuro-symbolique, validée pour l'instant en simulation sur SafeLIBERO, tiendra la route sur du matériel physique et à des cadences de production industrielles.

RecherchePaper
1 source
Modélisation de représentations volumétriques pour l'apprentissage de politiques de manipulation : VolumeDP
1536arXiv cs.RO 

Modélisation de représentations volumétriques pour l'apprentissage de politiques de manipulation : VolumeDP

Une équipe de recherche présente VolumeDP, une nouvelle architecture pour l'apprentissage par imitation en robotique manipulatrice, décrite dans une version révisée d'un article arXiv (2603.17720v2). Le problème visé est concret : la plupart des méthodes actuelles font correspondre directement des observations d'images 2D à des sorties d'action 3D, un décalage géométrique qui nuit au raisonnement spatial et fragilise la robustesse des politiques apprises. VolumeDP corrige ce défaut en raisonnant explicitement en trois dimensions : les features issues des images sont d'abord projetées dans une représentation volumétrique via un mécanisme d'attention croisée, puis un module apprenable sélectionne les voxels pertinents pour la tâche et les convertit en un ensemble compact de tokens spatiaux, ce qui réduit fortement le calcul sans perdre la géométrie utile à l'action. Un décodeur multi-tokens exploite ensuite l'ensemble de ces tokens pour prédire les actions, évitant l'agrégation destructrice qui réduit plusieurs indices spatiaux à un seul descripteur. Résultat chiffré : 88,8% de taux de réussite moyen sur le benchmark de simulation LIBERO, soit 14,8 points de mieux que la meilleure méthode concurrente, avec des gains également marqués sur ManiSkill et LIBERO-Plus. Des essais en conditions réelles confirment la généralisation à de nouvelles dispositions spatiales, de nouveaux points de vue caméra et de nouveaux environnements. Pour les équipes qui développent des politiques de manipulation robotique, ce travail illustre une limite structurelle des architectures VLA qui traitent la 3D comme un simple sous-produit d'un flux d'images : sans représentation spatiale explicite, la robustesse aux changements de caméra ou de décor s'effondre, un problème récurrent dès qu'on sort du laboratoire. VolumeDP montre qu'ajouter un raisonnement volumétrique explicite, plutôt que de compter uniquement sur l'échelle des données ou du modèle, améliore sensiblement la généralisation, ce qui nuance l'idée reçue selon laquelle scaler les VLA suffirait à résoudre le problème spatial. Le travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation ayant précédemment tenté d'intégrer une composante 3D, comme les approches de type Diffusion Policy en 3D, mais en visant une représentation volumétrique plus efficiente en calcul. Il s'agit à ce stade d'une contribution académique, publiée sur arXiv avec code et vidéos disponibles sur une page projet dédiée, et non d'un produit ou d'un système déployé commercialement. Les benchmarks utilisés (LIBERO, ManiSkill) restent des environnements de recherche standard, ce qui laissera aux prochaines étapes le soin de confirmer la tenue de ces résultats sur des tâches industrielles plus complexes.

RecherchePaper
1 source
Domain Arithmetic : adaptation VLA en un essai face aux changements environnementaux
1537arXiv cs.RO 

Domain Arithmetic : adaptation VLA en un essai face aux changements environnementaux

Des chercheurs du SNU MPR Lab (Seoul National University) publient sur arXiv (arXiv:2607.00666v1) une méthode baptisée DART, pour Domain ARiThmetic, qui permet d'adapter un modèle Vision-Language-Action (VLA) à un nouvel environnement à partir d'une seule démonstration, contre plusieurs dizaines habituellement nécessaires. Le problème visé est concret : un modèle VLA entraîné sur un bras Panda avec une caméra à un angle donné échoue souvent dès que la caméra bouge ou que le robot change, par exemple pour un UR5e. DART traite ce décalage comme un problème d'arithmétique de vecteurs de poids, en isolant l'information spécifique au nouveau domaine et en l'ajoutant au modèle d'origine, grâce à un alignement de sous-espaces entre composantes singulières qui filtre le bruit. Les auteurs rapportent de meilleures performances que les méthodes d'adaptation VLA existantes, en simulation comme sur des essais réels, avec du code publié sur GitHub (snumprlab/dart). Pour les intégrateurs et les équipes robotique, l'enjeu dépasse l'exercice académique : le coût de collecte de démonstrations reste l'un des principaux freins au déploiement des politiques VLA hors laboratoire, chaque cellule de production ayant sa propre configuration de caméra, son propre bras et ses propres contraintes. Réduire ce besoin à une seule démonstration attaquerait directement le goulot d'étranglement qui empêche les modèles comme Pi-0, GR00T N2 ou Helix de passer de la démo contrôlée au déploiement multi-site sans réentraînement coûteux à chaque nouvelle installation. DART s'inscrit dans la lignée des travaux sur l'arithmétique de tâches appliquée initialement aux grands modèles de langage, transposée ici aux modèles de fondation robotiques. Le champ de l'adaptation VLA reste actif et concurrentiel, porté par Physical Intelligence, Nvidia ou Figure sur leurs propres architectures. À ce stade, DART demeure une contribution académique validée par ses seuls auteurs, sans acteur français ou européen impliqué ; sa généralisation à d'autres paires de robots et à des VLA tiers reste à démontrer avant toute adoption industrielle.

RechercheActu
1 source
Robuste contrôle dans l'espace opérationnel avec bornes de perturbation conformes pour une manipulation redondante sûre
1538arXiv cs.RO 

Robuste contrôle dans l'espace opérationnel avec bornes de perturbation conformes pour une manipulation redondante sûre

Des chercheurs proposent un nouveau cadre de contrôle pour bras robotiques redondants combinant modèle physique et apprentissage statistique, testé sur un manipulateur Franka Research 3 à 7 degrés de liberté. Le système associe un contrôleur par couple calculé en espace opérationnel (OSCTC) à un observateur d'état étendu (ESO) qui estime en temps réel les perturbations agissant sur la tâche, sans nécessiter de mesure complète de l'état du robot comme le font les approches par apprentissage résiduel. Pour garantir la sécurité, une fonction de barrière de contrôle (CBF) robuste borne les écarts autorisés, mais ce type de garantie exige normalement de connaître à l'avance l'amplitude maximale des perturbations, ce qui rend le système inutilement prudent en pratique. Les auteurs contournent cette limite avec de la prédiction conforme par fenêtre glissante, une méthode statistique sans hypothèse sur la distribution des données, qui réestime en continu cette borne. Résultat annoncé : une précision de suivi de trajectoire de l'ordre du millimètre et un contrôle sûr en temps réel cadencé à 1 kHz, y compris face à des perturbations variées appliquées pendant les essais. Pour l'industrie de la manipulation robotique, ce travail s'attaque à un compromis connu entre robustesse et précision : les contrôleurs purement basés modèle se dégradent dès que la dynamique réelle s'écarte du modèle théorique, tandis que les approches par apprentissage de résidus, plus adaptatives, manquent de garanties formelles et complexifient le déploiement. En combinant les deux logiques via une méthode d'incertitude calibrée statistiquement plutôt qu'un réseau de neurones supplémentaire, l'approche vise des applications où bras redondants et humains partagent le même espace de travail, un enjeu central pour la cobotique industrielle et l'intégration en environnement contraint. Ce résultat s'inscrit dans une lignée de recherches cherchant à rendre les garanties de sécurité robotique moins conservatrices sans sacrifier la rigueur théorique, un problème classique des CBF robustes qui, mal calibrées, paralysent le mouvement autant qu'elles le sécurisent. L'usage de la prédiction conforme, technique empruntée au machine learning statistique, plutôt que de l'apprentissage de résidus par réseau de neurones, marque une différence d'approche notable. Il s'agit pour l'instant d'un résultat expérimental publié sur arXiv (2607.00424), validé sur un seul bras robotique en laboratoire, sans indication de transfert vers un produit ou un déploiement industriel.

RecherchePaper
1 source
Robotique mobile en flotte : génération de feuilles de route en espace continu avec contraintes de distance et discrétisation géométrique
1539arXiv cs.RO 

Robotique mobile en flotte : génération de feuilles de route en espace continu avec contraintes de distance et discrétisation géométrique

Une équipe de recherche propose une nouvelle méthode de génération de feuilles de route (roadmaps) en espace continu pour les flottes de robots mobiles utilisées en intralogistique, détaillée dans une version mise à jour d'un article arXiv (2511.07175v2). L'approche place les nœuds du graphe de navigation aux points d'angle convexe de l'espace libre ainsi qu'aux points d'interaction des stations, puis discrétise l'espace libre par expansion locale de grille. Elle impose des contraintes de distance minimale entre nœuds et entre nœuds et arêtes, calculées à partir des dimensions physiques des robots, et applique un élagage des chemins par K plus courts chemins piloté par la demande de transport. La méthode a été testée dans trois environnements d'intralogistique, avec deux solveurs de type MAPD (multi-agent pickup and delivery) : l'algorithme PIBT (Priority Inheritance with Backtracking) et un solveur A* spatio-temporel. Comparée à trois méthodes de référence, un échantillonnage par réaction-diffusion (GSRM), une grille à connexité 8 et un échantillonnage aléatoire, elle améliore la taille maximale de flotte gérable de 1,2 à 23,4 % par rapport à GSRM, d'au moins 9,1 % par rapport à la grille, et de plus de 10,4 % par rapport à l'échantillonnage aléatoire, avec des longueurs de chemin normalisées quasi optimales de 1,03 à 1,05. Pour les intégrateurs et opérateurs d'entrepôts déployant des flottes d'AMR (robots mobiles autonomes), ce travail cible un goulot d'étranglement connu : les méthodes en grille sacrifient la fidélité géométrique et imposent des contraintes de distance de type Manhattan, tandis que les méthodes continues existantes ignorent les contraintes de distance minimale et la demande de transport réelle. Une feuille de route plus redondante et mieux dimensionnée aux gabarits robotiques permet une exploitation sans conflit à plus grande échelle, un enjeu direct pour la densité de flotte tolérable dans un entrepôt donné et pour la planification de trajectoires en temps réel. Ce travail s'inscrit dans la lignée des recherches en planification de graphes de navigation pour la logistique automatisée, un domaine où les solveurs MAPD comme PIBT gagnent en adoption face à la複exité croissante des flottes commerciales. En comparant systématiquement contre GSRM, une méthode de référence en échantillonnage par réaction-diffusion, et des approches en grille plus classiques, les auteurs positionnent leur contribution comme une alternative directement mesurable sur des métriques de connectivité inter-stations et de complexité de graphe, ouvrant la voie à des tests en conditions réelles sur des flottes d'entrepôt.

RecherchePaper
1 source
IA physique appliquée à la reconstruction 3D sous occlusion manuelle grâce à la proprioception et au toucher multi-contact
1540arXiv cs.RO 

IA physique appliquée à la reconstruction 3D sous occlusion manuelle grâce à la proprioception et au toucher multi-contact

Des chercheurs publient une méthode de reconstruction 3D d'objets saisis à la main, conçue pour reconstruire la forme complète d'un objet même lorsque la main du robot le masque en grande partie (arXiv:2604.09100v2, version révisée). Contrairement aux approches précédentes qui s'appuient uniquement sur la vision pour deviner les parties cachées, le système combine trois sources d'information : la caméra RGB pour les zones visibles, la proprioception du bras robotique pour connaître la géométrie exacte de la main posée sur l'objet, et le toucher multi-contact pour contraindre où se situe physiquement la surface de l'objet dans les zones occultées. L'objet est représenté comme un champ de distance signée (SDF) aligné caméra, encodé dans un espace latent compact via un Structure-VAE, sur lequel est entraîné un modèle de diffusion par flow-matching. L'entraînement se fait en deux temps : préapprentissage sur des images sans occlusion, puis affinage sur des scènes de manipulation avec occlusion, en intégrant des contraintes physiques qui réduisent l'interpénétration main-objet et alignent la reconstruction sur les points de contact tactile mesurés. En simulation, l'ajout de la proprioception et du toucher améliore nettement la complétion de forme sous occlusion par rapport aux méthodes vision seule, avec une échelle métrique correcte. Les auteurs valident aussi un transfert sur un robot humanoïde réel, avec un effecteur différent de celui utilisé à l'entraînement. Pour l'industrie robotique, ce travail s'attaque à un angle mort classique de la perception manipulative : dès qu'une main saisit un objet, la caméra en perd une bonne partie de la vue, ce qui pénalise le placement de préhension, la planification de trajectoire ou la ré-estimation de pose en cours de tâche. Ajouter proprioception et toucher comme signaux de contrainte physique, plutôt que de tout faire reposer sur la vision, est une piste concrète pour fiabiliser les piles de perception des robots à mains dextres ou multi-doigts, notamment en contexte industriel où les objets manipulés sont souvent partiellement occultés par la préhension elle-même. Il faut toutefois noter que les gains rapportés restent majoritairement démontrés en simulation, la validation sur robot réel se limitant à un test de transfert et non à un déploiement en conditions de production. Le papier s'inscrit dans la lignée des méthodes de reconstruction amodale 3D, historiquement limitées à des signaux purement visuels et donc fragiles sous occlusion sévère. En ancrant la reconstruction dans la physique du contact plutôt que dans la seule vraisemblance visuelle, l'approche se positionne comme un module de perception réutilisable en amont d'un pipeline de reconstruction en deux étages, où une étape ultérieure affine la géométrie et prédit l'apparence. Les prochaines étapes attendues concernent l'élargissement à davantage d'effecteurs et de morphologies de main, ainsi que des essais plus poussés en conditions réelles au-delà du test de transfert présenté.

RecherchePaper
1 source
Robustesse de la manipulation robotique : fondations et perspectives
1541arXiv cs.RO 

Robustesse de la manipulation robotique : fondations et perspectives

Résumé pour l'article "Robustness of Robotic Manipulation: Foundations and Frontiers" : Une équipe de chercheurs publie sur arXiv une étude systématique consacrée à la robustesse de la manipulation robotique, un chantier resté jusqu'ici fragmenté entre sous-domaines qui n'utilisaient pas les mêmes définitions. Les auteurs proposent d'abord une définition formelle : la robustesse mesure la capacité d'un système de manipulation à atteindre son objectif malgré l'incertitude et la variation des conditions. Ils en dérivent ensuite deux formulations générales, l'une probabiliste, l'autre issue de la théorie du contrôle, avant de cartographier les mécanismes concrets qui produisent de la robustesse à chaque étage de la pile robotique : perception, planification, contrôle, apprentissage de politiques (policy learning) et conception matérielle. Chaque mécanisme est illustré par des travaux de référence, des fondations historiques aux publications récentes. Le papier revient aussi sur les métriques et protocoles d'évaluation existants, souvent hétérogènes, et se conclut par une liste de problèmes ouverts vers une robustesse comparable à celle des humains. L'enjeu dépasse l'exercice académique. Depuis deux ans, une génération de modèles VLA (vision-language-action) comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia, Helix de Figure ou Optimus de Tesla revendique des capacités de manipulation généralistes, mais les annonces s'appuient sur des démonstrations et des métriques propres à chaque acteur, difficiles à comparer entre elles. Pour les intégrateurs et décideurs B2B qui doivent choisir une solution pour de la logistique ou de l'assemblage, disposer d'un cadre commun pour distinguer un modèle réellement robuste d'une démonstration soigneusement sélectionnée devient central, surtout face à l'écart bien documenté entre performance en vidéo et performance en déploiement réel. Cette synthèse s'inscrit dans une lignée qui remonte au contrôle robuste classique des années 1980-1990, avant que l'apprentissage par renforcement puis les politiques end-to-end n'ouvrent de nouvelles pistes dans les années 2010-2020, jusqu'au boom actuel des modèles fondation pour la robotique portés par des laboratoires comme Physical Intelligence, Nvidia, Google DeepMind ou Figure. En posant un vocabulaire et des critères communs, les auteurs cherchent moins à trancher un débat qu'à donner aux chercheurs et industriels un langage partagé pour comparer leurs approches, une étape jugée nécessaire avant toute standardisation sectorielle des tests de robustesse.

RecherchePaper
1 source
Communication d'exécution robotique consciente du réseau pour l'inférence cloud sous connectivité spatialement hétérogène
1542arXiv cs.RO 

Communication d'exécution robotique consciente du réseau pour l'inférence cloud sous connectivité spatialement hétérogène

Les chercheurs proposent un nouveau cadre pour l'exécution robotique s'appuyant sur des modèles fondamentaux hébergés dans le cloud, dans des environnements où la connectivité sans fil varie fortement selon la position du robot. Le problème posé est concret : un robot exécute une primitive de mouvement générée à distance, et doit recevoir la suivante avant d'épuiser la marge de manœuvre de la primitive en cours. Or la qualité de connexion nécessaire pour envoyer une requête et récupérer la réponse dépend de l'endroit où se trouve le robot, pas seulement du temps de latence du réseau. Les auteurs introduisent la notion de "fenêtre requête-réponse", qui intègre le temps de transmission montante, l'inférence cloud, la récupération descendante et l'incertitude d'inférence. Sur cette base, et à partir d'une carte de communication de l'environnement, le système choisit dynamiquement un point d'envoi de requête pendant l'exécution de la primitive en cours, puis guide le robot vers ce point via un planificateur local avant de reprendre sa tâche. Les tests, menés dans un scénario intérieur construit à partir de mesures radio réelles, montrent que la méthode obtient le meilleur taux de réussite de tâche (ou ex æquo) parmi les approches comparées, avec moins de tentatives de requête et un taux d'échec de requête plus faible. L'enjeu dépasse la démonstration académique : il touche directement à la viabilité des architectures robotiques qui délèguent le raisonnement sémantique lourd à des modèles cloud plutôt que de tout embarquer, une tendance de fond dans la robotique VLA (vision-language-action) actuelle. Jusqu'ici, la plupart des optimisations de latence réseau traitaient la transmission comme un problème purement temporel, en ignorant que la position physique du robot détermine si une requête peut même aboutir. En traitant le point de requête comme une décision de mouvement à part entière, intégrée au planificateur local, les auteurs déplacent le problème de la couche réseau vers la couche de contrôle du robot. Pour les intégrateurs qui envisagent des flottes robotiques dépendantes du cloud dans des entrepôts, usines ou espaces publics où la connectivité Wi-Fi ou 5G est hétérogène, cela offre une piste concrète pour réduire les échecs de tâche liés aux zones mortes, sans nécessiter une couverture réseau uniforme coûteuse. Ce travail s'inscrit dans la lignée des recherches sur le déchargement de calcul (offloading) pour la robotique cloud, un axe qui a pris de l'ampleur avec la multiplication des modèles fondamentaux trop volumineux pour tourner entièrement en embarqué, à l'image des architectures VLA de type GR00T ou Helix évoquées dans l'industrie humanoïde. Contrairement aux approches qui se concentrent uniquement sur la compression de modèle ou la réduction de latence par transmission optimisée, cette étude aborde le problème sous l'angle de la planification spatiale de la communication elle-même. L'article, déposé sur arXiv (2606.31497v1), ne précise pas de partenariat industriel ni de déploiement réel au-delà du banc de test indoor basé sur des mesures de terrain ; il s'agit à ce stade d'une contribution méthodologique, dont la prochaine étape logique serait une validation sur des plateformes robotiques réelles opérant dans des environnements de connectivité variable, comme des entrepôts logistiques ou des sites industriels multi-étages.

RecherchePaper
1 source
Freeform Preference Learning pour la manipulation robotique
1543arXiv cs.RO 

Freeform Preference Learning pour la manipulation robotique

Voici l'article traduit et reformaté selon les consignes : Des chercheurs présentent Freeform Preference Learning (FPL), une méthode d'apprentissage de politiques robotiques à partir de préférences humaines exprimées en langage libre, publiée sur arXiv le 30 juin 2026. Le problème ciblé est connu dans la manipulation robotique à long horizon : les signaux de succès binaires (réussite ou échec) sont trop rares pour guider l'apprentissage, et les préférences par paires classiques (« la trajectoire A est meilleure que B ») écrasent en un seul score des critères de qualité pourtant distincts, comme la vitesse, la sécurité du geste ou la précision du placement d'un objet. FPL change l'approche en laissant les annotateurs définir eux-mêmes des axes de préférence en langage naturel, par exemple « rapidité », « prudence » ou « qualité du placement », puis en collectant des comparaisons par paires spécifiques à chaque axe. Ces annotations servent à entraîner un modèle de récompense conditionné par le langage, capable d'associer une trajectoire et un axe donné à un score de récompense propre à cet axe, sur lequel est ensuite entraînée une politique unique optimisant simultanément ces multiples dimensions. Sur quatre tâches de manipulation en conditions réelles et deux tâches simulées, toutes à horizon long, FPL améliore les taux de réussite de 38 points de pourcentage par rapport aux méthodes à récompense éparse et aux méthodes à préférence binaire classique. L'enjeu dépasse le simple gain de performance chiffré. FPL produit un signal de progression dense sans nécessiter de découpage manuel en sous-tâches, ce qui allège considérablement le travail d'ingénierie de récompense, souvent le vrai goulot d'étranglement des pipelines d'apprentissage par renforcement appliqués à la robotique. Le résultat le plus notable pour les équipes qui conçoivent ces systèmes est la possibilité de piloter le comportement de la politique au moment de l'inférence, en pondérant différemment les axes appris, sans réentraînement, une flexibilité rarement démontrée à ce niveau. Les auteurs rapportent aussi une forme de compositionnalité : la politique combine des comportements qui n'apparaissaient pas ensemble dans les données d'entraînement, un indice que le modèle de récompense capture des notions de qualité généralisables plutôt que de simples heuristiques mémorisées. Ce travail s'inscrit dans la lignée des efforts récents pour dépasser les limites du reinforcement learning from human feedback (RLHF) appliqué au-delà du texte, notamment dans la manipulation robotique où des méthodes comme les préférences binaires ou le reward shaping manuel dominent encore. Il ne s'agit pas d'un système déployé commercialement mais d'une contribution méthodologique testée en laboratoire sur un nombre limité de tâches, avec du matériel de démonstration disponible en ligne (freeform-pl.github.io/fpl.website). Les prochaines étapes attendues concernent le passage à l'échelle sur des jeux de tâches plus vastes et l'intégration éventuelle à des architectures VLA (vision-language-action) génériques, où la définition de récompenses reste un obstacle central au déploiement industriel de robots généralistes.

RecherchePaper
1 source
TactX : apprentissage de représentations tactiles partagées entre capteurs variés
1544arXiv cs.RO 

TactX : apprentissage de représentations tactiles partagées entre capteurs variés

Des chercheurs ont présenté TactX, un système d'apprentissage capable d'unifier les représentations tactiles issues de capteurs technologiquement incompatibles entre eux. Trois modalités de transduction radicalement différentes sont couvertes : résistive, magnétique et par vision. Concrètement, TactX projette les signaux bruts de chaque type de capteur dans un espace latent partagé grâce à des encodeurs spécifiques à chaque modalité, entraînés sur des données de contact appariées, c'est-à-dire des interactions physiques identiques capturées simultanément par plusieurs capteurs différents. Ce signal d'alignement naturel permet un entraînement conjoint qui rend l'espace latent cohérent quel que soit le matériel d'origine. Les auteurs valident l'approche sur quatre tâches de manipulation à contact riche : le pick-and-place, l'insertion de connecteurs (plug insertion), l'essuyage de surface et la réorientation d'objets. Résultat chiffré central de l'étude : une politique entraînée avec un seul type de capteur transfère en zero-shot vers des capteurs physiquement distincts via l'espace latent commun, faisant passer le taux de réussite moyen de 27,5% pour une politique vision seule à 45,9% avec TactX. L'enjeu dépassé ici est celui du couplage matériel, un frein connu à l'industrialisation de la manipulation robotique fine. Aujourd'hui, changer de capteur tactile sur une ligne de production ou un bras robotisé impose généralement de ré-entraîner intégralement la politique de contrôle, ce qui verrouille les intégrateurs sur un fournisseur unique et complique la maintenance ou l'évolution du parc matériel. Une représentation tactile transférable ouvre la voie à des politiques de manipulation réutilisables indépendamment du capteur physique installé, un argument direct pour les intégrateurs industriels qui doivent gérer des flottes hétérogènes ou remplacer des composants obsolètes sans tout refaire. Le gain observé (27,5% à 45,9%) reste toutefois modeste en valeur absolue: la démonstration prouve la faisabilité du transfert zero-shot plus qu'elle ne livre une solution mature et déployable en l'état. Ce travail s'inscrit dans une tendance de fond de la recherche en robotique tactile, où la fragmentation des technologies de capteurs (résistifs, capacitifs, magnétiques, ou à base de caméras comme GelSight) a longtemps freiné la mutualisation des données et des modèles, contrairement à la vision où des architectures génériques type ViT dominent largement. Le papier, publié en preprint sur arXiv, ne mentionne pas d'acteur industriel ni de partenariat de déploiement: il s'agit à ce stade d'une contribution académique testée en environnement contrôlé, sans indication de calendrier vers une intégration commerciale. Les prochaines étapes attendues pour ce type de recherche incluraient l'extension à davantage de familles de capteurs, des tests sur des tâches de manipulation plus complexes, et potentiellement une validation par des fabricants de capteurs tactiles ou des intégrateurs cherchant à réduire leur dépendance à un hardware spécifique.

RecherchePaper
1 source
HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains
1545arXiv cs.RO 

HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains

Des chercheurs publient HABIT (Human-Aware Behavior and Interaction Training), un jeu de données de démonstration pour l'apprentissage de politiques de manipulation robotique en présence humaine, décrit dans un article déposé sur arXiv (identifiant 2606.31682, juin 2026). Le corpus rassemble plus de 10 000 épisodes et 160 heures d'enregistrements couvrant 60 tâches, organisées selon trois rôles d'interaction homme-robot : « Collaborateur », où humain et robot accomplissent une tâche ensemble, « Collègue », où ils opèrent des tâches séparées dans un espace partagé, et « Superviseur », où l'humain dirige le robot par instructions. Contrairement aux jeux de données existants pour les politiques robotiques généralistes, collectés sans présence humaine dans la scène, HABIT introduit explicitement des humains dans les démonstrations. L'enjeu est la capacité des robots à adopter des comportements conscients de la présence humaine, un angle mort des grands corpus qui alimentent aujourd'hui les politiques VLA (vision-langage-action). Les expériences montrent que l'entraînement sur données incluant des humains fait émerger des comportements que les données robot seul ne produisent pas : synchronisation spatio-temporelle dans les tâches de collaboration, cession de passage dans les tâches de coexistence, et ancrage gestuel pour interpréter les instructions du superviseur. Les auteurs indiquent aussi que l'entraînement sur HABIT accélère l'adaptation à de nouvelles tâches d'interaction homme-robot. Pour les intégrateurs qui déploient des robots en usine ou en entrepôt aux côtés d'opérateurs, c'est un signal que la cohabitation sûre et fluide dépend moins du matériel que de la composition des données d'entraînement, un manque que la course aux modèles fondation robotiques a largement laissé de côté. HABIT s'inscrit dans la lignée des grands corpus type Open X-Embodiment ou DROID, qui ont permis l'essor des politiques généralistes telles que Pi-0 ou GR00T N2 mais restent tournés vers des scènes sans humains, un manque que plusieurs équipes académiques cherchent désormais à combler à mesure que les humanoïdes et bras collaboratifs sortent des lignes de démonstration pour entrer dans des ateliers occupés. À ce stade, HABIT reste une publication de recherche accompagnée d'un jeu de données, sans annonce de produit ni de partenariat industriel ; sa portée dépendra de son adoption par d'autres laboratoires pour entraîner et comparer leurs politiques sur des tâches de collaboration homme-robot.

RecherchePaper
1 source
AeroPlace-Flow : placement d'objets guidé par le langage pour manipulateurs aériens via prévision visuelle et flux d'objets
1546arXiv cs.RO 

AeroPlace-Flow : placement d'objets guidé par le langage pour manipulateurs aériens via prévision visuelle et flux d'objets

Des chercheurs ont publié sur arXiv (arXiv:2603.07744) AeroPlace-Flow, un framework de placement d'objets par langage naturel pour manipulateurs aériens, des drones équipés de bras robotiques. Le système prend en entrée des observations RGB-D de l'objet saisi et de la scène cible, ainsi qu'une instruction en langue naturelle, pour produire une trajectoire de placement exécutable sans coordonnées prédéfinies. Concrètement, AeroPlace-Flow génère d'abord une image objectif synthétique ("goal image") via un modèle d'édition d'images qui visualise la configuration finale souhaitée, puis ancre cette image dans l'espace métrique 3D par alignement de profondeur et raisonnement centré sur l'objet. Il en déduit un "object flow", un champ de déplacement 3D tenant compte des collisions, qui guide le manipulateur vers une pose de pose cohérente avec l'instruction et les contraintes de contact. Les expériences menées en simulation et en conditions réelles affichent un taux de succès moyen de 75% sur plateforme matérielle, sur des scénarios de placement variés. L'intérêt principal de cette approche réside dans son caractère "training-free" : contrairement aux pipelines classiques de manipulation aérienne qui nécessitent soit des coordonnées cibles codées en dur, soit un entraînement spécifique à chaque tâche, AeroPlace-Flow ne requiert aucune donnée d'apprentissage dédiée au placement. Pour un intégrateur ou un OEM développant des drones industriels à capacité de manipulation, cela réduit considérablement le coût de mise en service sur de nouveaux environnements. La combinaison de la prévoyance visuelle (foresight) et du raisonnement géométrique explicite représente également une alternative aux architectures VLA (Vision-Language-Action) entièrement end-to-end, dont le transfert sim-to-real reste problématique à grande échelle. La manipulation aérienne reste un domaine de recherche émergent, largement dominé par les travaux sur la saisie (grasping) et le contrôle en vol, le placement précis d'objets étant jusqu'ici peu étudié dans ce contexte. Des acteurs comme Aeroarms, LAAS-CNRS ou des équipes de ETH Zurich travaillent sur des architectures concurrentes, généralement contraintes à des poses cibles explicites. AeroPlace-Flow se positionne comme une couche de raisonnement sémantique au-dessus des pipelines de contrôle existants, compatibles avec un suivi de trajectoire standard. Il s'agit à ce stade d'un résultat de recherche avec validation expérimentale, sans déploiement industriel annoncé ni partenaire commercial identifié.

UEDes équipes européennes actives sur la manipulation aérienne, notamment LAAS-CNRS en France, pourraient s'appuyer sur cette approche sans entraînement pour accélérer leurs propres travaux sur le placement sémantique d'objets par drone.

IA physiquePaper
1 source
CSAR : architecture système conteneurisée pour la robotique
1547arXiv cs.RO 

CSAR : architecture système conteneurisée pour la robotique

Des chercheurs ont publié en juin 2026 CSAR (Containerized System Architecture for Robotics), un cadre architectural décrit dans un preprint arXiv (identifiant 2606.30293). L'architecture s'appuie sur la conteneurisation système via LXC/LXD, la communication inter-processus ROS 2/DDS, et une infrastructure edge organisée en trois couches : Infrastructure Core, Platform and Multi-User Orchestration, et Compute and Acceleration. Ces couches visent à créer des environnements d'exécution persistants et "hardware-affines", découplés des charges expérimentales volatiles. CSAR a été déployé et évalué dans un laboratoire de robotique académique à travers deux cas d'usage représentatifs : du SLAM 3D déporté sur serveur edge et de la cartographie sémantique accélérée par GPU. Les templates de déploiement, fichiers de configuration et documentation sont publiés en open source sur GitHub (goyoambrosio/CSAR). L'intégration logicielle en robotique distribuée souffre depuis des années de frictions récurrentes : isolation des dépendances défaillante, incompatibilités entre environnements embarqués et cloud, partage inefficace des GPU dans les équipes multi-utilisateurs. CSAR apporte une réponse structurée en séparant explicitement les couches d'infrastructure stables des workloads expérimentaux. Selon les auteurs, les résultats observés incluent une meilleure utilisation des ressources partagées, une intégration logicielle simplifiée et un prototypage plus sûr. Pour un intégrateur ou un responsable R&D, l'enjeu est concret : réduire le phénomène "works on my machine" et raccourcir le cycle test-déploiement sur des architectures edge hétérogènes, un problème chronique dans les labo multi-robots ou multi-chercheurs. L'adoption de Docker et Kubernetes en robotique s'est faite de manière ad hoc, sans tenir compte des contraintes spécifiques du secteur : latence temps-réel, accès direct au matériel (GPU, capteurs), et partage de ressources entre utilisateurs concurrents. CSAR s'inscrit dans un courant de travaux "devops for robotics" qui inclut AWS RoboMaker, les environnements CI Gazebo, ou encore des projets académiques sur la robotics cloud infrastructure. Il faut noter que CSAR reste pour l'instant une contribution de recherche avec un déploiement en labo académique, sans adoption industrielle annoncée. Les suites naturelles seraient une validation à plus grande échelle, sur des architectures multi-sites, ou une intégration dans des pipelines de déploiement de flottes robotiques réelles.

InfrastructureOpinion
1 source
RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes
1548arXiv cs.RO 

RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes

Des chercheurs ont déposé en juin 2026 sur arXiv (référence 2606.27036) RelAfford6D, un framework sans entraînement pour la manipulation robotique d'objets articulés. Le système s'appuie sur un graphe d'affordances 6D relationnel : à partir d'une consigne en langage naturel, il déduit une topologie sémantique reliant la partie principale d'interaction d'un objet à son ancre physique. Ces noeuds topologiques sont ensuite convertis en poses métriques précises dans l'espace SE(3), soit six degrés de liberté complets en position et orientation, via des modèles de vision fondamentaux pré-entraînés. L'exécution est formulée comme un problème de satisfaction de contraintes cinématiques : le robot génère des trajectoires continues en suivant des variétés physiques strictement définies, qu'il s'agisse d'orbites rotoïdes (rotation) ou prismatiques (translation). Un mécanisme de suivi en boucle fermée assure la replanification en temps réel face aux perturbations. L'approche tranche avec la majorité des politiques data-driven actuelles, comme les VLA basés sur l'imitation ou les méthodes à affordances latentes, qui extraient des points de contact isolés sans contraintes cinématiques explicites. En formulant la manipulation comme satisfaction de contraintes, RelAfford6D obtient des taux de succès zero-shot supérieurs aux baselines data-driven testées, avec une généralisation inter-catégories documentée sur des objets articulés variés (tiroirs, portes, manettes) aussi bien en simulation que dans des environnements physiques réels. Pour les intégrateurs industriels, l'absence d'entraînement spécifique à la tâche est significative : le framework peut s'adapter à de nouveaux mécanismes sans collecter de données de démonstration supplémentaires. La manipulation d'objets articulés en open-world reste l'un des verrous majeurs de la robotique de service et industrielle. Les approches récentes à base de VLA ont progressé sur la flexibilité sémantique mais peinent à garantir la précision géométrique requise pour des mécanismes contraints comme des vannes, portes ou tiroirs industriels. RelAfford6D s'inscrit dans une tendance émergente combinant fondations visuelles pré-entraînées et raisonnement géométrique analytique, sans fine-tuning coûteux. Parmi les travaux concurrents figurent CabiNet, les méthodes à affordance implicite comme GNFactor ou F3RM, et les approches VLA récentes telles que Pi-0. Ce preprint constitue une démonstration académique validée sur banc réel, sans partenariat industriel ni timeline de déploiement annoncé à ce stade.

RecherchePaper
1 source
PAMAE : mélange d'experts d'action sensible aux phases pour des politiques VLA fiables par flow matching
1549arXiv cs.RO 

PAMAE : mélange d'experts d'action sensible aux phases pour des politiques VLA fiables par flow matching

Des chercheurs ont publié le 27 juin 2026 sur arXiv (2606.27144) un module baptisé PAMAE (Phase-Aware Mixture-of-Experts Action Experts), conçu pour améliorer la fiabilité des politiques d'action dans les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique multi-étapes. Le principe est simple : remplacer l'expert d'action unique partagé des architectures VLA à flow-matching par un mélange sparse d'experts spécialisés, sans toucher au backbone VLA pré-entraîné. Un routeur "phase-aware" oriente dynamiquement la génération d'actions vers l'expert approprié selon la phase d'exécution en cours, grâce à une tête de prédiction de phase légère et un objectif d'alignement de routage. L'entraînement se déroule en deux temps : d'abord un échauffement standard sous la loss de flow-matching, puis une optimisation du routage phase-cohérent sous supervision auxiliaire. Sur des benchmarks de simulation de manipulation multi-étapes, PAMAE affiche jusqu'à 9,2 % de gain en taux de succès par rapport à des baselines VLA solides. Ce résultat est notable parce qu'il s'attaque à un goulot d'étranglement concret des VLA à flow-matching : la tendance à lisser les comportements de contrôle à travers toutes les phases d'exécution avec un seul expert, ce qui nuit aux transitions critiques (saisie, repositionnement, insertion). L'approche "plug-and-play" est stratégiquement importante pour les intégrateurs -- elle évite le coût d'un réentraînement complet du backbone et reste compatible avec des fondations VLA existantes comme Pi-0 ou OpenVLA. Le gain de 9,2 % en simulation est mesuré sur des tâches multi-étapes, là où les architectures à expert unique échouent le plus souvent, ce qui rend la comparaison pertinente. Cela dit, la validation reste exclusivement en simulation, et le transfert sim-to-real n'est pas encore démontré : le "reality gap" demeure le vrai test pour ce type d'amélioration. Les VLA à flow-matching sont apparus comme une alternative aux politiques de diffusion classiques (Diffusion Policy, ACT) en combinant ancrage multimodal fort et généralisation, notamment via des modèles comme Pi-0 de Physical Intelligence ou les travaux de OpenVLA. L'idée des Mixture-of-Experts (MoE) pour les politiques de robot n'est pas nouvelle -- elle est empruntée au monde des LLMs (Mixtral, Switch Transformer) -- mais son application phase-conditioned dans un pipeline VLA end-to-end constitue une contribution originale. Côté concurrents, des approches comme HiRT, RoboVLMs ou les travaux de DeepMind sur RT-2 et ses successeurs explorent des trajectoires similaires pour améliorer la robustesse sur les tâches longues. La prochaine étape naturelle pour PAMAE serait une évaluation sur robot réel (plateforme Franka, UR5 ou bras humanoïde) et une comparaison directe avec des politiques récentes comme Pi-0.5 ou GR00T N2 de NVIDIA, dont les résultats terrain commencent à circuler.

RechercheOpinion
1 source
RoDyn : apprivoiser un modèle du monde 2.5D interactif pour la manipulation robotique
1550arXiv cs.RO 

RoDyn : apprivoiser un modèle du monde 2.5D interactif pour la manipulation robotique

Des chercheurs ont publié sur arXiv (identifiant 2510.09036, seconde version) RoDyn, un modèle de monde 2.5D destiné à la manipulation robotique. L'architecture repose sur un espace latent géométriquement conscient plutôt que sur des flux vidéo 2D bruts. Son composant central, le Robot-Dynamic Tokenizer, couple les représentations visuelles sémantiques avec des informations spatiales et centrées sur l'agent via un mécanisme de cross-attention dominé par le canal RGB, complété d'un guidage par masque dynamique. Une architecture autorégressi guidée par ces masques oriente ensuite le modèle vers les zones d'interaction active entre le robot et les objets manipulés. Sur des jeux de données à grande échelle, RoDyn atteint l'état de l'art en fidélité de génération et affiche, point le plus saillant, une amélioration de 42% du taux de réussite en imitation learning dans le monde réel par rapport aux baselines purement 2D. Ce gain de 42% doit être lu avec soin: il est mesuré contre des modèles 2D, non contre d'autres approches 2.5D ou 3D, ce qui circonscrit la portée de la comparaison. Il illustre néanmoins un problème structurel bien documenté: les modèles vidéo 2D, aussi convaincants visuellement, ne capturent pas la géométrie ni la cinématique indispensables aux interactions physiques précises. En introduisant une représentation intermédiaire 2.5D, soit une profondeur estimée sans reconstruction 3D complète et coûteuse, RoDyn tente de combler ce fossé à moindre coût computationnel. Pour les équipes R&D en manipulation industrielle, l'intérêt concret réside dans l'accélération du reinforcement learning model-based (MBRL), qui réduit potentiellement le nombre d'interactions physiques requises à l'entraînement, et dans une meilleure généralisation aux objets non vus en simulation. Le champ des modèles de monde pour la robotique s'est densifié depuis 2023, porté par Dreamer (DeepMind), UniSim, et plus récemment les architectures VLA comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). RoDyn occupe une niche spécifique: la simulation neuronale pour la manipulation de précision, avec un compromis géométrique explicite entre vidéo pure et reconstruction 3D complète. Cette publication reste à ce stade purement académique, sans annonce de déploiement commercial ni partenariat industriel mentionné. Les suites naturelles concerneront des tâches de manipulation plus exigeantes (assemblage fin, dépose contrainte) et une éventuelle intégration dans des pipelines VLA existants. Aucun acteur français ou européen n'est impliqué dans ces travaux.

RechercheOpinion
1 source