Aller au contenu principal

Actualités robotique — page 47

4 741 articles au fil, du plus récent au plus ancien.

ROBOSHACKLES : un jeu de données de sécurité pour la prévention des blessures humaines dans les modèles fondation incarnés
2301arXiv cs.RO 

ROBOSHACKLES : un jeu de données de sécurité pour la prévention des blessures humaines dans les modèles fondation incarnés

Une équipe de chercheurs publie ROBOSHACKLES, un jeu de données de 10 000 clips vidéo robotiques conçu pour évaluer la sécurité des modèles de fondation embarqués (EFMs, Embodied Foundation Models) face aux risques de blessures humaines. Disponible sur HuggingFace, le dataset est construit à partir d'observations réelles du corpus DROID, un jeu de téléopération robotique existant. Le pipeline suit quatre étapes : compréhension de scène, édition d'image orientée dangers, génération de prompts temporels décrivant l'évolution attendue, puis synthèse en un seul passage via le modèle vidéo Wan2.7. Les clips couvrent six catégories de risques : deux de dommages directs (contact physique avec un humain) et quatre de dommages indirects (situations domestiques dangereuses créées par le robot). L'évaluation de six EFMs représentatifs selon un critère de refus d'action donne un résultat sans équivoque : 100% de taux de génération d'actions dangereuses dans tous les scénarios testés. Ce chiffre interpelle directement les intégrateurs et décideurs industriels envisageant le déploiement de robots à base d'EFMs en environnements mixtes. Il expose un angle mort structurel : contrairement aux LLMs textuels, les EFMs ne disposent pas encore de mécanismes d'alignement de sécurité pour anticiper les séquences d'actions dangereuses avant leur exécution physique. La difficulté est méthodologique : collecter des données réelles de robots blessant des humains est éthiquement et légalement impossible, ce qui explique l'absence de benchmarks dans ce domaine jusqu'ici. ROBOSHACKLES propose une voie scalable via la synthèse vidéo, pour entraîner des modèles à refuser des actions à risque et à anticiper les dangers en amont de l'exécution. Les EFMs sont au cœur d'une compétition intense entre les principaux acteurs : Physical Intelligence avec π0, Google DeepMind avec RT-2, NVIDIA avec GR00T N2, et plusieurs implémentations open-source comme OpenVLA. Ces modèles combinent compréhension multimodale, raisonnement sur les états futurs et génération d'actions directement exécutables sur le robot, un paradigme qui accélère la commercialisation mais expose à des risques que le RLHF classique ne couvre pas. ROBOSHACKLES s'inscrit dans un effort émergent de safety spécifique à la robotique physique, avec pour suites logiques son intégration dans des pipelines de refusal learning et son extension à des scénarios industriels à plus haute énergie cinétique.

RechercheOpinion
1 source
TactSpace : apprendre un espace latent partagé enrichi par la physique pour le transfert sim-vers-réel tactile
2302arXiv cs.RO 

TactSpace : apprendre un espace latent partagé enrichi par la physique pour le transfert sim-vers-réel tactile

Une équipe de recherche a publié sur arXiv (identifiant 2606.18959) TactSpace, un cadre d'apprentissage de représentations multi-modales conçu pour résoudre l'un des verrous majeurs de la manipulation robotique : le transfert sim-to-real des capteurs tactiles. Le problème est structurel : les simulateurs actuels sont incapables de reproduire fidèlement la mécanique de déformation et de transduction des capteurs tactiles physiques, rendant inutilisables en conditions réelles les politiques entraînées en simulation. TactSpace contourne ce problème en alignant des modalités tactiles hétérogènes dans un espace latent partagé, sans jamais avoir besoin de simuler le signal brut du capteur. Des encodeurs spécifiques à chaque modalité projettent des observations aussi différentes que la profondeur de pénétration simulée et la capacitance mesurée sur un capteur réel dans un embedding commun. L'entraînement combine des objectifs de reconstruction croisée et d'alignement contrastif. Évalué sur trois tâches, identification de formes d'indenteur, prédiction de force et reconstruction géométrique, le système entraîné exclusivement en simulation transfère directement sur des mesures réelles sans fine-tuning : zéro-shot. Les gains mesurés atteignent 16,7 % de réduction d'erreur en prédiction de force et 45,8 % en reconstruction de forme par rapport aux baselines. Ces résultats adressent un goulot d'étranglement critique pour l'ensemble de la robotique de manipulation dextre. Le tactile est indispensable pour les tâches d'assemblage fin, de tri délicat ou de manipulation d'objets déformables, segments où les bras industriels classiques butent faute de retour de contact fiable. Jusqu'ici, la difficulté à simuler correctement les capteurs tactiles forçait soit à collecter massivement des données réelles, coûteuses et lentes, soit à se passer du tactile. TactSpace propose une troisième voie : accepter que simulation et réalité restent physiquement dissemblables, et apprendre malgré tout des représentations invariantes aux modalités mais riches en information de contact. La publication accompagne le code d'une implémentation Warp-based du simulateur tactile pénalité intégrée à Isaac Lab, la plateforme de simulation physique de NVIDIA, ce qui ouvre la génération de données tactiles scalable à la communauté. Le contexte de cette recherche s'inscrit dans une effervescence autour des capteurs tactiles à haute résolution, portée notamment par GelSight (MIT, aujourd'hui GelSight Inc.), DIGIT (Meta AI) et les capteurs capacitifs embarqués dans plusieurs plateformes humanoïdes. Isaac Lab, qui sert de base à ce travail, est devenu un standard de facto pour l'entraînement de politiques robotiques en simulation, utilisé par Figure, 1X et Agility entre autres. TactSpace reste à ce stade un preprint non évalué par les pairs, sans déploiement annoncé sur plateforme physique commerciale. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation réelles bout-en-bout et une intégration dans des pipelines Vision-Language-Action (VLA) où le retour tactile pourrait renforcer la robustesse en conditions industrielles.

RecherchePaper
1 source
RL résiduel centré sur les objets pour l'amélioration zéro-shot des VLA en transfert simulation-réel
2303arXiv cs.RO 

RL résiduel centré sur les objets pour l'amélioration zéro-shot des VLA en transfert simulation-réel

Des chercheurs de Microsoft Research ont publié fin juin 2026 un framework baptisé Object-Centric Residual RL (arXiv:2606.18953), conçu pour améliorer la robustesse des modèles Vision-Language-Action (VLA) dans des tâches de manipulation physique précise. Le principe : entraîner une politique correctrice en simulation pure, basée non pas sur des images mais sur les poses des objets, puis la transférer directement sur un robot réel sans aucun fine-tuning supplémentaire. Sur un bras Franka Research 3 (FR3), la méthode fait passer le taux de succès moyen de 42 % à 76 % en zero-shot sur cinq tâches de manipulation, avec une politique résiduelle entraînée exclusivement en simulation, avec injection de bruit de pose et dropout. Le processus inclut également le rejeu des démonstrations de télé-opération en simulation pour entraîner un VLA "jumeau" simulé, auquel la politique résiduelle est ensuite couplée avant transfert zero-shot. L'enjeu est direct pour les intégrateurs et les équipes de déploiement robotique : les VLA actuels, qu'il s'agisse de Pi-0 (Physical Intelligence), d'OpenVLA ou des modèles RT de Google, généralisent bien à travers des tâches variées mais accumulent des erreurs d'exécution lors d'interactions physiques précises (pincements, insertions, assemblages) où la précision millimétrique est requise. Les approches concurrentes butent sur un trilemme classique : les méthodes à états privilégiés nécessitent une distillation coûteuse pour le déploiement, les méthodes basées image souffrent du fossé visuel sim-to-réel, et le RL en conditions réelles reste coûteux et risqué pour le matériel. En substituant les poses d'objets aux images comme espace d'observation, le framework crée une représentation compacte et cohérente entre simulation et réalité, suffisamment légère pour un transfert zero-shot fiable. Autre résultat notable : les rollouts améliorés peuvent être réutilisés pour ré-entraîner le VLA de base, ouvrant une boucle d'auto-amélioration sans télé-opération supplémentaire. Le sim-to-real gap est un problème structurel qui freine la commercialisation des robots polyvalents depuis plusieurs années, et les VLA n'y échappent pas malgré leurs capacités de généralisation linguistique. Cette publication s'inscrit dans une dynamique de recherche intense où Physical Intelligence (Pi-0, Pi-0 FAST), Figure AI et 1X Technologies tentent chacun de réduire cet écart par des voies différentes : données réelles massives, domain randomization, ou standardisation du hardware. Microsoft Research, moins visible sur le déploiement commercial que ces acteurs, confirme ici un axe de recherche sur la correction post-entraînement des fondations robotiques par RL simulé. La page projet est publiée en accès ouvert sur le site de Microsoft Research ; aucun partenariat industriel ni timeline de déploiement n'est mentionné dans la publication, qui reste pour l'heure une contribution académique.

IA physiqueOpinion
1 source
HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique
2304arXiv cs.RO 

HT-Bench : évaluation et apprentissage des représentations tactiles dextériques de la main par vision égocentrique

Une équipe de chercheurs a publié HT-Bench, un benchmark à grande échelle destiné à évaluer les représentations tactiles main entière dans la manipulation robotique dextre, avec un dataset de 10 millions de trames RGB et 7,8 millions de trames tactiles collectées sur 226 tâches distinctes. La publication (arXiv:2606.19161, juin 2026) propose une approche centrée sur la vision égocentrique couplée à des capteurs tactiles couvrant l'intégralité de la main robotique. Le benchmark structure l'évaluation autour de quatre tâches : récupération de similarité tactile fine, inpainting de trames masquées, synthèse vision-vers-tactile, et prédiction multimodale de trames tactiles. En parallèle, les auteurs introduisent HandTouch, un encodeur vision-tactile à quantification vectorielle (VQ), entraîné selon trois phases progressives : spatiale, cross-modale et temporelle. Les gains quantitatifs de HandTouch sur HT-Bench sont nets : le Recall@5 en récupération de similarité tactile passe de 74,65 % à 85,23 %, l'erreur quadratique moyenne (RMSE) en inpainting chute de 0,022 à 0,010, et le score cIoU hors-distribution (OOD) en synthèse vision-tactile progresse de 0,628 à 0,705. Pour l'industrie robotique, cela valide une hypothèse structurante : coupler vision égocentrique et retour tactile main entière constitue une base d'apprentissage généralisable, sans exiger des capteurs ou des embodiments standardisés. C'est un signal concret pour les intégrateurs et équipes R&D travaillant sur la manipulation dextre en environnements non structurés, où percevoir l'état d'une prise sans vision directe reste un verrou majeur. Le domaine du tactile en robotique souffre depuis longtemps d'une fragmentation des formats de capteurs et des protocoles, rendant les comparaisons entre travaux difficiles. HT-Bench s'inscrit dans une dynamique de benchmarking qui émerge en 2025-2026, aux côtés d'initiatives comme RoboSet, DROID ou LIBERO pour la manipulation généraliste. Des laboratoires comme le CMU Robotics Institute et le MIT CSAIL, ainsi que des entreprises comme Sanctuary AI, explorent des approches similaires de fusion tactile-visuelle. Aucun acteur européen n'est directement cité dans ce travail, mais des startups comme Enchanted Tools ou Wandercraft, actives sur la manipulation avancée, pourraient tirer parti d'un tel benchmark pour standardiser leurs évaluations internes. L'étape suivante logique serait l'intégration de HandTouch dans des pipelines VLA (Vision-Language-Action), où le retour tactile reste aujourd'hui largement absent.

RecherchePaper
1 source
DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent
2305arXiv cs.RO 

DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent

DREAM-Chunk (arXiv:2606.18589, juin 2026) est une méthode d'inférence conçue pour corriger une fragilité structurelle des modèles vision-language-action (VLA) : l'exécution en boucle ouverte lors de l'action chunking. Ce paradigme, devenu standard dans les VLA actuels, consiste à inférer à basse fréquence un bloc d'actions (un "chunk") que le robot exécute séquentiellement à haute fréquence, sans rétroaction intermédiaire. Dès qu'un chunk est lancé, le robot le suit à l'aveugle, vulnérable aux perturbations dynamiques, aux erreurs matérielles et à l'observabilité partielle. DREAM-Chunk adresse ce problème sans modifier ni réentraîner la politique sous-jacente : à l'inférence, il génère plusieurs chunks candidats, simule leurs trajectoires dans un espace latent via un world model léger, et sélectionne celui dont l'état prédit correspond le mieux à l'observation réelle. La méthode est validée sur le benchmark Kinetix et sur quatre tâches de manipulation couvrant deux plateformes robotiques et deux architectures VLA distinctes. L'intérêt pratique est direct pour les intégrateurs industriels qui déploient des VLA pré-entraînés sans accès au pipeline d'entraînement : DREAM-Chunk s'insère comme une couche plug-and-play, sans fine-tuning requis. La méthode s'inscrit dans la tendance du test-time compute scaling, bien établie côté LLM mais encore naissante en robotique physique, où dépenser davantage de calcul à l'inférence peut compenser les limites d'un modèle sans passer par un nouveau cycle d'entraînement coûteux. Les résultats montrent que les gains augmentent avec le nombre de chunks candidats échantillonnés, et que l'avantage est particulièrement marqué lorsque les démonstrations contiennent des comportements correctifs, ce qui soulève une question pratique sur la composition des datasets de démo. Les world models latents en robotique ont une longue tradition (DREAMER, TD-MPC2, DreamerV3), mais leur couplage avec des VLA basés sur le chunking reste récent. Physical Intelligence avec pi-0, Figure AI et des équipes de Stanford, CMU et Berkeley explorent simultanément comment améliorer la robustesse en déploiement sans réentraînement complet. DREAM-Chunk se distingue par son caractère agnostique au modèle sous-jacent, ce qui facilite son adoption sur des architectures hétérogènes. La prochaine étape logique serait une validation sur des plateformes commerciales à manipulation dextre (Fourier GR1, Unitree G1) et des tâches à dynamiques hautement stochastiques comme l'assemblage de précision. Le papier ne mentionne ni partenaires industriels ni pilotes commerciaux annoncés.

IA physiqueOpinion
1 source
Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs
2306arXiv cs.RO 

Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs

Des chercheurs ont publié en juin 2026 (arXiv:2606.18747) un système permettant au robot humanoïde Pepper de générer des gestes co-verbaux naturels à l'exécution, sans recours à des animations préprogrammées. L'architecture combine ChatGPT pour la génération de code gestuel en langage naturel, couplée à un pipeline d'apprentissage par renforcement à partir de retours humains (RLHF) appliqué de manière itérative. Des utilisateurs évaluent les gestes produits par Pepper lors d'une étude comparative, ces préférences servant de signal de récompense pour affiner le modèle de langage. Résultat annoncé : des mouvements jugés plus expressifs, pertinents et fluides qu'avec le seul pipeline LLM de base. L'enjeu est significatif pour les intégrateurs de robots sociaux. Aujourd'hui, la quasi-totalité des comportements gestuels déployés en production repose sur des bibliothèques d'animations conçues à la main par des experts, ce qui rend les robots rigides face à des contextes conversationnels imprévus. Les approches par apprentissage automatique peinent à capturer la naturalité perçue, un critère subjectif qui se dégrade à mesure que le nombre de degrés de liberté augmente. Ce travail propose une alternative concrète : utiliser un LLM comme générateur de comportements moteurs au runtime, puis le corriger via RLHF pour coller aux préférences réelles des utilisateurs. C'est une transposition directe de la méthode qui a rendu ChatGPT lui-même plus utile, appliquée ici au domaine de la communication non verbale humain-robot. Les résultats restent néanmoins issus d'une étude utilisateur contrôlée, pas d'un déploiement à grande échelle. Pepper est le robot social d'Aldebaran Robotics, société française rachetée par SoftBank en 2012, aujourd'hui commercialisé dans les secteurs retail, accueil et éducation. Après une phase de déception commerciale liée précisément à la rigidité comportementale du robot, plusieurs équipes académiques cherchent à relancer son potentiel via des couches IA génératives. Sur ce terrain, Pepper fait face à une concurrence croissante des agents conversationnels incarnés (avatars AR/VR) et de nouvelles plateformes comme Enchanted Tools (France) avec son robot Miroki, conçu dès l'origine pour une expressivité naturelle. La prochaine étape logique serait un déploiement en contexte réel pour mesurer le gap entre l'évaluation en laboratoire et l'acceptation en environnement ouvert, une question que les auteurs n'adressent pas encore.

FR/EU ecosystemePaper
1 source
RSLCPP : simulations déterministes avec ROS 2
2307arXiv cs.RO 

RSLCPP : simulations déterministes avec ROS 2

Une équipe de l'Université Technique de Munich (TUM) publie RSLCPP, une bibliothèque open-source en C++ conçue pour rendre les simulations robotiques sous ROS 2 entièrement déterministes. La contribution, présentée dans un article révisé sur arXiv (arXiv:2601.07052v2), s'attaque à un problème structurel de ROS : son architecture asynchrone et multi-processus rend les résultats de simulation non reproductibles d'une machine à l'autre, voire d'une exécution à l'autre sur le même matériel. L'équipe démontre que RSLCPP produit des résultats bit-à-bit identiques sur plusieurs architectures CPU, validés sur un benchmark synthétique et sur un système robotique réel. La bibliothèque est disponible en open-source sur GitHub (TUMFTM/rslcpp). Le problème que résout RSLCPP est fondamental pour quiconque utilise ROS 2 en simulation : lorsque les temps de calcul et les latences de communication varient, l'ordre d'exécution des callbacks n'est pas garanti, ce qui compromet la reproductibilité des résultats. Pour le benchmarking scientifique et l'intégration continue (CI/CD), où la répétabilité est essentielle, cela constitue un frein réel. RSLCPP impose un ordonnancement déterministe des callbacks en combinant les nœuds ROS existants dans une routine de simulation séquentielle, sans nécessiter de modification du code source. Ce dernier point est décisif : les équipes peuvent instrumenter leurs stacks ROS existantes sans refactoring, ce qui abaisse significativement le coût d'adoption. ROS 2, maintenu par Open Robotics, est devenu le standard de facto en robotique académique et industrielle. La non-reproductibilité des simulations est un problème connu depuis des années dans la communauté, que des simulateurs comme Gazebo ou Isaac Sim de NVIDIA ont partiellement adressé via leurs propres mécanismes internes. RSLCPP se distingue en opérant directement au niveau de l'exécuteur ROS 2, rendant l'approche indépendante du simulateur physique sous-jacent et donc plus portable. La prochaine étape logique serait l'intégration dans des pipelines CI robotiques pour valider des comportements algorithmiques sans variabilité matérielle, un besoin croissant à mesure que les équipes industrielles adoptent des pratiques DevOps pour le développement robotique.

InfrastructureOpinion
1 source
Les modèles VLA maîtrisent-ils les bases ? Évaluation de la rétention du sens commun et des connaissances du monde
2308arXiv cs.RO 

Les modèles VLA maîtrisent-ils les bases ? Évaluation de la rétention du sens commun et des connaissances du monde

Une équipe de recherche a publié sur arXiv (arXiv:2606.19297) un protocole d'évaluation baptisé Act2Answer, conçu pour mesurer objectivement combien de connaissances de sens commun et de savoirs factuels les modèles Vision-Language-Action (VLA) conservent après leur fine-tuning sur des données robotiques. Le protocole transforme les benchmarks classiques d'évaluation de modèles de langage visuels (VLM) en épisodes tabulaires courts : l'agent doit répondre à une question en plaçant physiquement un objet parmi plusieurs candidats sur une surface, ce qui ancre l'évaluation dans une action réelle plutôt que dans un output textuel. L'étude couvre 7 modèles VLA et 9 modèles VLM de référence, testés sur une suite de scénarios couvrant plusieurs catégories de connaissances. À cela s'ajoute une technique de sondage couche par couche (layerwise intent probing) pour localiser où l'information pertinente à la réponse est encodée dans le backbone VLM et la tête d'action. Les résultats révèlent une dégradation systématique, mais inégale, des connaissances après adaptation robotique. Les VLA maintiennent des performances solides sur les concepts simples, mais accusent des écarts significatifs sur les catégories sémantiquement plus riches par rapport à leurs VLM d'origine. Autrement dit, le fine-tuning robotique érode préférentiellement les représentations de haut niveau, celles qui portent le raisonnement nuancé. Le probing couche par couche montre que les signaux pertinents culminent dans les couches intermédiaires du réseau, puis s'atténuent dans les couches supérieures, ce qui suggère que la tête d'action interfère avec la propagation des connaissances sémantiques. Fait notable : l'entraînement conjoint avec des données VQA (Visual Question Answering) est associé à une meilleure rétention des connaissances, ouvrant une piste concrète pour les architectures futures. L'outil résout aussi un problème méthodologique persistant : il devient difficile de distinguer un échec dû à une connaissance absente d'un échec de contrôle moteur de bas niveau. Act2Answer s'inscrit dans un débat plus large sur le sim-to-real gap et la robustesse des VLA en déploiement industriel. Les modèles VLA actuels, comme Pi-0 (Physical Intelligence), OpenVLA, ou les architectures dérivées de modèles comme LLaVA et Qwen-VL, héritent de VLMs préentraînés sur des corpus massifs, puis sont spécialisés sur des datasets robotiques relativement restreints. La question de la rétention des connaissances est directement pertinente pour les intégrateurs qui misent sur ces modèles pour des tâches impliquant une compréhension contextuelle du monde réel, au-delà du simple pick-and-place. Aucun acteur européen n'est mentionné dans l'étude. Le code et les environnements Act2Answer sont disponibles publiquement, ce qui permettra à d'autres équipes de compléter les comparaisons avec d'autres architectures et de tester l'impact de stratégies d'entraînement alternatives.

RechercheOpinion
1 source
ART-VS : tuilage à résolution adaptative pour l'asservissement visuel par Vision Transformer
2309arXiv cs.RO 

ART-VS : tuilage à résolution adaptative pour l'asservissement visuel par Vision Transformer

Une équipe de chercheurs propose ART-VS (Adaptive Resolution Tiling Visual Servoing), une méthode en deux phases pour le servo-visuel robotique exploitant des descripteurs de Vision Transformer (ViT) auto-supervisés, sans aucun entraînement spécifique à la tâche. Le principe : une première phase à résolution native assure un alignement grossier robuste, puis une seconde phase découpe l'image en tuiles haute résolution et restreint la mise en correspondance aux voisinages locaux pour affiner la précision finale. Sur le banc de test standard sous perturbations, ART-VS atteint 95,4% de convergence, contre 76,6% pour l'approche ViT standard et 81,0% pour le traitement pleine résolution, soit respectivement +18,8 et +14,4 points. La méthode s'exécute plus de 10 fois plus vite que l'approche pleine résolution tout en consommant 27% moins de VRAM, réduisant l'erreur de positionnement de 53% par rapport au ViT standard. En validation réelle sur des instances jamais vues à l'entraînement, ART-VS atteint 95/100 sur des bouteilles transparentes et 98/100 sur des chaussures, sur trois architectures ViT distinctes. Ces résultats comptent dans le débat sur la généralisabilité des approches visuelles en robotique. La saisie d'objets transparents à 95% de réussite sans données d'entraînement spécifiques constitue une démonstration concrète de la valeur des descripteurs ViT fondés sur l'auto-supervision (DINO, DINOv2), que les méthodes classiques basées sur la profondeur ou la texture peinent structurellement à gérer. Pour les intégrateurs et les équipes robotiques industrielles, l'absence de fine-tuning élimine une friction majeure au déploiement multi-catégories, et le gain d'efficacité computationnelle ouvre la voie à des boucles de servo-visuel embarquées ou à faible latence. La réduction de 53% de l'erreur de positionnement est particulièrement pertinente pour les tâches d'assemblage ou d'insertion à tolérance serrée. ART-VS s'inscrit dans un courant qui exploite les modèles fondationnels visuels pré-entraînés comme socle pour le contrôle robotique sans annotation. Le servo-visuel classique reposait sur des descripteurs artisanaux (SIFT, SURF) ou des pipelines supervisés, tous deux limités en généralisation inter-objets. L'utilisation de ViT auto-supervisés pour générer des correspondances denses avait déjà montré des résultats prometteurs, mais le compromis entre résolution grossière (robuste, imprécise) et haute résolution (précise, coûteuse) restait non résolu. Le travail est publié en preprint sur arXiv (2606.19089), le code étant disponible publiquement. Les suites naturelles incluront la validation en environnements industriels contraints et l'intégration avec des architectures Vision-Language-Action (VLA) pour des tâches de manipulation longue séquence.

RecherchePaper
1 source
Perception 3D monoculaire pour robots piétons par apprentissage hybride 2D-3D
2310arXiv cs.RO 

Perception 3D monoculaire pour robots piétons par apprentissage hybride 2D-3D

Une équipe de chercheurs a publié en juin 2026 sur arXiv (référence 2606.19122) WalkOCC, un framework de perception 3D de l'espace occupé conçu spécifiquement pour les robots circulant sur les trottoirs, notamment les robots de livraison du dernier kilomètre et les fauteuils roulants autonomes. Contrairement aux systèmes existants qui requièrent plusieurs caméras et des nuages de points LiDAR densément annotés en 3D, WalkOCC repose sur une seule caméra monoculaire. L'architecture hybride combine du ray-marching géométrique calibré sur des séquences LiDAR-RGB avec un apprentissage à grande échelle sur des images monoculaires non appariées, sans nécessiter d'annotations 3D coûteuses sur ces données supplémentaires. Les auteurs publient également Sidewalk3D, un dataset collecté sur plusieurs sites et périodes, incluant des séquences LiDAR-caméra synchronisées et des annotations sémantiques d'occupancy 3D pour l'évaluation comparative. L'enjeu est directement opérationnel pour les intégrateurs de robots mobiles en milieu urbain. Les trottoirs présentent des structures fines et hétérogènes, bordures (curbs), caniveaux (gutters), mobilier urbain, piétons proches, que les pipelines de prédiction d'occupancy conçus pour l'automobile autonome capturent mal. WalkOCC améliore la segmentation fine de ces éléments et maintient de bonnes performances lors de changements environnementaux (conditions lumineuses, météo) et de changements de plateforme robotique (cross-embodiment), un point critique pour les opérateurs qui déploient plusieurs modèles de robots sur une même infrastructure logicielle. La réduction de dépendance au LiDAR multi-faisceau, dont le coût reste prohibitif pour les robots de faible valeur unitaire, constitue un argument industriel concret pour le déploiement à échelle. Ce travail s'inscrit dans une dynamique de transfert des méthodes de perception automobile vers la robotique de service en environnement non structuré. Les approches dominantes en véhicule autonome ont largement établi la prédiction d'occupancy comme primitive centrale, mais elles présupposent des infrastructures de collecte et des densités de capteurs inaccessibles pour les flottes de robots de trottoir. WalkOCC concurrence directement les baselines auto-supervisées sur image seule en apportant un gain de précision sans alourdir le pipeline de collecte de données. Il n'existe aujourd'hui aucun standard commun pour l'évaluation de la perception piétonne robotique; si le code et le dataset Sidewalk3D sont effectivement publiés comme annoncé, ce travail pourrait s'imposer comme référence de benchmarking dans ce segment encore peu structuré.

RecherchePaper
1 source
L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien
2311arXiv cs.RO 

L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien

Des chercheurs ont mis en ligne sur arXiv en juin 2026 un algorithme nommé DO AS I DO, conçu pour extraire automatiquement des trajectoires de manipulation dextère à partir de vidéos RGB monoculaires filmant des mains humaines en action. Le pipeline reconstruit les interactions main-objet depuis des vidéos égocentriques (caméra portée par l'opérateur) ou exocentriques (caméra tierce), captées en conditions réelles et sans capteurs de profondeur ni marqueurs, puis effectue un retargeting de ces estimations vers des mains robotiques multi-doigts pour produire des séquences d'actions directement exécutables sur robot physique. Selon les évaluations conduites sur plusieurs jeux de données annotés ainsi que sur des clips collectés en ligne, DO AS I DO dépasse l'état de l'art précédent en précision d'estimation des interactions main-objet et en qualité des trajectoires extraites. L'enjeu est structurel : la collecte de données de manipulation reste le principal goulot d'étranglement pour entraîner des robots dextères. La téléopération est lente et coûteuse, la simulation difficile à transférer en conditions réelles sur des mains à 16 DOF ou plus, un phénomène connu sous le nom de sim-to-real gap. DO AS I DO propose une troisième voie en exploitant des vidéos déjà disponibles en ligne comme source de supervision passive, sans infrastructure dédiée. Pour les équipes R&D travaillant sur des manipulateurs multi-doigts, cela pourrait réduire significativement le coût de collecte de démonstrations. Les auteurs publient également un "efficacy playbook", soit un ensemble de recommandations pratiques destinées aux équipes terrain. Le point critique reste la fidélité du retargeting : le fossé cinématique entre les 21 degrés de liberté d'une main humaine et l'anatomie d'un effecteur robotique introduit des approximations que le papier reconnaît sans les quantifier de façon exhaustive. La manipulation dextère demeure l'un des problèmes les moins résolus de la robotique humanoïde commerciale. Physical Intelligence avec Pi-0, Figure AI avec Figure 03 et NVIDIA avec GR00T N2 investissent massivement dans des pipelines de données alternatifs, notamment la génération en simulation via DexMimicGen ou la téléopération structurée à grande échelle comme DROID et ALOHA 2. DO AS I DO se distingue en ciblant directement l'embodiment gap sans recourir à de l'infrastructure de capture spécialisée, en valorisant des vidéos grand public. Ce preprint ne mentionne aucun déploiement industriel ni partenariat commercial ; il s'agit d'une contribution académique, pas d'un produit prêt à l'emploi. L'étape naturelle sera de mesurer si ces trajectoires retargetées alimentent efficacement l'entraînement de modèles VLA à l'échelle, la question ouverte centrale de la robotique de manipulation en 2026.

RecherchePaper
1 source
Bench-Push : benchmark pour la navigation et la manipulation par poussée des robots mobiles
2312arXiv cs.RO 

Bench-Push : benchmark pour la navigation et la manipulation par poussée des robots mobiles

Une équipe de chercheurs a publié Bench-Push (arXiv:2512.11736), le premier benchmark unifié dédié à l'évaluation des robots mobiles capables de pousser et de manipuler des objets dans leur environnement immédiat. La suite comprend quatre environnements de simulation aux niveaux de complexité variables : navigation en labyrinthe avec obstacles mobiles, navigation autonome de navire en eaux glacées, livraison de caisses, et nettoyage de zones encombrées. Bench-Push intègre également un jeu de métriques originales conçues pour mesurer l'efficacité, l'effort d'interaction mécanique et la complétion partielle des tâches, ainsi que des démonstrations de baselines établies. La bibliothèque est open-source, distribuée sous Python avec une architecture modulaire, et disponible sur GitHub (IvanIZ/BenchNPIN). L'absence de référentiel commun dans ce domaine constitue un frein réel : jusqu'ici, chaque équipe évaluait ses approches sur des configurations ad hoc, rendant toute comparaison inter-laboratoires impossible et la reproductibilité aléatoire. Or la question est loin d'être académique. Les robots mobiles autonomes (AMR) déployés en logistique, en entrepôt ou en milieu industriel se retrouvent régulièrement dans des espaces encombrés d'objets déplaçables que les algorithmes classiques d'évitement d'obstacles ne savent tout simplement pas gérer. Les stratégies de poussée (pushing, nudging) constituent une compétence clé pour ces environnements réels, et Bench-Push offre désormais un terrain de comparaison structuré pour les évaluer. La métrique de complétion partielle est notamment utile pour les décideurs B2B, qui ont besoin de quantifier la dégradation progressive des performances plutôt qu'un simple succès ou échec binaire. Le champ dit NAMO (Navigation Among Movable Obstacles) connaît une croissance soutenue, mais restait fragmenté faute d'outil fédérateur. Bench-Push s'inscrit dans la continuité des efforts de standardisation observés ailleurs en robotique, à l'image de ce que RoboSuite ou Isaac Gym ont apporté à la manipulation. L'inclusion d'un scénario de navigation en eaux glacées témoigne d'une ambition d'élargissement au-delà de la robotique d'entrepôt stricte, vers des domaines comme la navigation maritime autonome. Il n'existe à ce stade aucune annonce de déploiement industriel : Bench-Push est un outil de recherche, mais sa conception modulaire et son accessibilité via pip en font un candidat sérieux à une adoption rapide par les équipes travaillant sur la planification en environnements dynamiques.

RecherchePaper
1 source
Guava : un cadre efficace et universel pour la manipulation incarnée
2313arXiv cs.RO 

Guava : un cadre efficace et universel pour la manipulation incarnée

Des chercheurs ont publié en juin 2026 sur arXiv (identifiant 2606.18363) Guava, un cadre de harness pour agents robotiques de manipulation. Le système repose sur trois ingrédients identifiés après une exploration systématique de l'espace de conception : des boucles itératives perception-raisonnement-action, des abstractions d'action sémantiques et des observations multimodales. À partir de ces principes, les auteurs ont entraîné un modèle open-source de 4 milliards de paramètres en utilisant moins de 2 000 trajectoires collectées entièrement en simulation, sans aucune donnée réelle. Les évaluations en environnement simulé et en conditions réelles montrent des performances comparables aux modèles propriétaires de pointe, avec une généralisation robuste à des objets non vus en entraînement, des instructions inédites et des tâches longues à plusieurs étapes. Le résultat le plus significatif est qu'un modèle compact peut atteindre des performances compétitives avec des systèmes propriétaires massifs à condition que l'architecture de harness soit bien conçue, et non que le modèle soit immense. Cela conteste directement l'hypothèse dominante selon laquelle les systèmes VLA (Vision-Language-Action) end-to-end nécessitent des millions de trajectoires réelles pour franchir le sim-to-real gap. L'approche par tool use découple le raisonnement de haut niveau des modules de perception et de contrôle, rendant le cadre agnostique au modèle sous-jacent, un avantage concret pour les intégrateurs industriels souhaitant substituer les composants sans réentraîner l'ensemble du système. Ce travail s'inscrit dans un débat structurant de la manipulation robotique qui oppose les VLA end-to-end, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, aux approches modulaires par harness, qui misent sur la composabilité et le raisonnement émergent des LLM. L'approche rappelle SayCan (Google/Everyday Robots) ou Code as Policies, mais avec une validation sim-to-real plus explicite et sur modèle open-source. Le modèle 4B utilisé n'est pas nommé dans le papier, et aucun déploiement industriel ni partenariat commercial n'est mentionné : Guava demeure pour l'instant un résultat de recherche, sans timeline de productisation annoncée.

RechercheOpinion
1 source
Mem-World : modèles du monde conditionnés par l'action et augmentés par la mémoire pour la manipulation robotique persistante
2314arXiv cs.RO 

Mem-World : modèles du monde conditionnés par l'action et augmentés par la mémoire pour la manipulation robotique persistante

Des chercheurs ont publié Mem-World sur arXiv (réf. 2606.18960, juin 2026), un modèle du monde multi-vues augmenté par mémoire pour la manipulation robotique. Le problème adressé est fondamental aux modèles du monde conditionnés par l'action (action-conditioned world models) : lors d'une tâche de manipulation, l'effecteur terminal occulte fréquemment la scène, et les mouvements rapides de la caméra embarquée au poignet rendent l'observation courante insuffisante pour prédire les vues futures, poussant les modèles à halluciner ou oublier des détails observés antérieurement. L'innovation centrale est W-VMem, une mémoire indicée par surfels (éléments de surface 3D) en 4D, centrée sur la vue poignet, qui ancre les observations historiques à des éléments de surface évoluant dans le temps. Cette structure permet une récupération de contexte conditionnée sur les actions futures et consciente de la géométrie de scène, via rendu et scoring basés sur les surfels. Sur les tâches de long horizon, le taux de réussite progresse de 58 % à 72 % grâce à la génération de données synthétiques, et la corrélation de Pearson entre évaluations simulées et performances réelles s'améliore de 14,5 % par rapport à Ctrl-World, le modèle de référence. Ce gain en corrélation est directement actionnable pour les équipes robotique : il indique qu'on peut davantage faire confiance aux rollouts simulés pour prédire le comportement réel d'une politique, réduisant la dépendance aux expérimentations physiques coûteuses. L'hallucination de scène était jusqu'ici un verrou majeur à l'utilisation des world models pour l'entraînement de politiques dextres ; en séparant explicitement quand et où chaque élément a été observé, W-VMem produit un contexte historique non-redondant et pertinent. Il convient toutefois de noter que les scénarios de test et les métriques d'évaluation ne sont pas détaillés dans le résumé disponible, ce qui limite l'interprétation directe des chiffres annoncés. Les world models conditionnés par l'action sont apparus d'abord en jeu vidéo et conduite autonome (DreamerV3, GAIA-1) avant d'être adaptés à la manipulation, domaine plus exigeant en raison des occlusions proches et de la dynamique de caméra embarquée. Ctrl-World est la référence directe contre laquelle Mem-World se positionne. Cette publication reste un preprint, non encore évalué par des pairs, sans partenaire industriel ni timeline de déploiement annoncé. Les suites naturelles incluent une évaluation sur des benchmarks standardisés comme RLBench et une intégration dans des pipelines de modèles Visual Language Action (VLA), où la cohérence temporelle des rollouts est un prérequis à l'entraînement à grande échelle.

RechercheOpinion
1 source
Rapport technique pour le challenge ICRA 2026 GOOSE de segmentation sémantique 2D : utilisation de DINOv3 pour la compréhension robuste des scènes extérieures en robotique de terrain
2315arXiv cs.RO 

Rapport technique pour le challenge ICRA 2026 GOOSE de segmentation sémantique 2D : utilisation de DINOv3 pour la compréhension robuste des scènes extérieures en robotique de terrain

Une équipe de chercheurs a remporté la première place du GOOSE 2D Fine-Grained Semantic Segmentation Challenge, organisé dans le cadre du Workshop on Field Robotics de la conférence ICRA 2026. Ce défi porte sur la segmentation sémantique dense d'images hors-route selon une taxonomie fine de 64 classes et 11 catégories coarses évaluées. La solution gagnante repose sur deux apports complémentaires : une architecture combinant un backbone DINOv3 ViT-L/16 (auto-supervisé, patch 16x16), un ViT-Adapter, et un décodeur Mask2Former à classification par masques, complétés par une loss auxiliaire sur le token global [CLS] pour la supervision à grain coarse. À l'inférence, les auteurs appliquent une stratégie d'agrégation multi-échelle avec flip horizontal (test-time augmentation) et un ensemble des trois meilleurs checkpoints sélectionnés via les scores Codabench. Le score composite officiel atteint 76,57 %, décomposé en 69,32 % de mIoU fine-classe et 83,81 % de mIoU catégorie, plaçant cette méthode en tête du leaderboard final. Ce résultat est notable pour la robotique de terrain car la segmentation hors-route à grain fin reste un verrou opérationnel majeur : les environnements non structurés (boue, végétation dense, rochers, herbe haute) produisent une variance visuelle que les modèles entraînés sur données urbaines gèrent mal. La combinaison DINOv3 + ViT-Adapter démontre ici que les représentations auto-supervisées issues de grandes masses de données génériques transfèrent efficacement vers des taxonomies spécialisées outdoor avec 64 classes, sans nécessiter de préentraînement spécifique au domaine. Pour les intégrateurs de robots agricoles, militaires ou de search-and-rescue, cela valide une voie d'architecture réplicable avec des backbones publics, sans dépendance à des datasets propriétaires. Le dataset GOOSE (German Outdoor and Open-Source) a été développé pour combler le manque de benchmarks off-road à haute granularité, là où les jeux de données comme Cityscapes ou ADE20K restent centrés sur la ville. ICRA 2026, tenu en mai à Atlanta, concentre cette année plusieurs challenges dédiés au terrain non structuré, signalant une montée en maturité du sous-domaine face à l'essor des robots d'inspection, de déminage et d'agriculture autonome. Les concurrents directs de cette approche incluent des solutions basées sur des backbones InternImage ou SegFormer, mais la combinaison DINOv3 + supervision auxiliaire coarse semble offrir un gain de robustesse mesurable sur les classes rares. Les auteurs n'annoncent pas de déploiement terrain immédiat, mais le rapport technique soumis à ICRA 2026 constitue une base de référence pour les équipes travaillant sur la perception outdoor en conditions réelles.

RecherchePaper
1 source
Pourquoi automatiser ? Corrélations entre désir d'automatisation robotique, temps consacré et bien-être
2316arXiv cs.RO 

Pourquoi automatiser ? Corrélations entre désir d'automatisation robotique, temps consacré et bien-être

Une étude publiée sur arXiv (référence 2501.06348v4) par le laboratoire ROBIN de l'Université du Texas à Austin interroge les ressorts psychologiques qui poussent les individus à vouloir déléguer des tâches domestiques à des robots. Les chercheurs ont croisé trois sources de données : le dataset BEHAVIOR-1K, qui répertorie environ un millier d'activités domestiques types, l'American Time-Use Survey (ATUS), qui mesure le temps consacré à chaque activité, et le module Well-Being de ce même sondage, qui capture six états émotionnels associés (bonheur, sens, tristesse, douleur, stress, fatigue). L'objectif central était de déterminer si c'est la durée d'une tâche ou son ressenti émotionnel qui prédit le mieux le désir d'automatisation, en différenciant les résultats selon le genre et le niveau de revenu des répondants. Le résultat principal contredit une hypothèse structurante du secteur : le temps consacré à une activité n'est pas un bon prédicteur du souhait de l'automatiser. Ce sont l'absence de bonheur et la douleur physique ressentie qui constituent les indicateurs les plus forts. Pour les concepteurs de robots et les décideurs industriels, cela signifie que prioriser la vitesse d'exécution ou les gains de temps risque de manquer les priorités réelles des utilisateurs finaux. L'étude révèle par ailleurs des écarts démographiques nets : les femmes souhaitent en priorité automatiser les activités stressantes, tandis que les hommes ciblent celles qui les rendent malheureux. Les individus à revenus intermédiaires visent les tâches jugées ni agréables ni significatives, alors que les tranches basses et hautes de revenu ne présentent aucune corrélation statistiquement significative. Ce travail s'appuie sur BEHAVIOR-1K, un benchmark développé à UT Austin pour évaluer les capacités des robots domestiques sur un spectre large d'activités quotidiennes. Il arrive alors que plusieurs acteurs du marché des robots humanoïdes, dont Figure, 1X Technologies, Apptronik ou Enchanted Tools côté français, intensifient leurs efforts vers des déploiements en environnement résidentiel. L'étude souligne que le secteur conçoit trop souvent ses produits autour de métriques d'efficacité qui ne reflètent pas la psychologie des utilisateurs. Les données complètes et un outil de visualisation interactif sont disponibles publiquement, mais les résultats restent ancrés dans le contexte américain, une réserve importante avant toute transposition à d'autres marchés culturels.

RecherchePaper
1 source
L'action latente axée sur le mouvement permet l'entraînement VLA multi-morphologie depuis des vidéos subjectives humaines
2317arXiv cs.RO 

L'action latente axée sur le mouvement permet l'entraînement VLA multi-morphologie depuis des vidéos subjectives humaines

Une équipe de chercheurs a publié un cadre d'entraînement basé sur des actions latentes permettant de former des modèles VLA (Vision-Language-Action) généralistes à partir de vidéos égocentriques humaines non annotées, sous l'identifiant arXiv:2606.18955. L'architecture centrale, baptisée Hybrid Disentangled VQ-VAE, décompose les dynamiques de mouvement des arrière-plans environnementaux via des masques physiques et construit un codebook d'actions multi-embodiment. Pré-entraîné exclusivement sur des vidéos humaines sans étiquettes d'action, le modèle ne requiert que 50 trajectoires robotiques annotées pour s'adapter à un embodiment cible, contre des milliers généralement exigés par les approches concurrentes. Les résultats, validés en simulation et en environnement réel, affichent des performances comparables aux meilleurs modèles VLA entraînés sur des jeux de données massifs et entièrement annotés. Une stratégie de découplage intention-perception complète l'architecture : le backbone VLM prédit l'intention d'action tandis qu'un encodeur visuel gelé distinct fournit les caractéristiques propres à l'état courant à un module expert d'action, réduisant ainsi les hallucinations d'action. Ce travail s'attaque directement au principal goulot d'étranglement du domaine : la rareté des données robotiques avec annotations de haute fidélité. Les vidéos humaines égocentriques, abondantes sur internet et capturant une grande diversité environnementale, restaient jusqu'ici inexploitables dans les paradigmes d'entraînement classiques faute de labels d'action. Descendre à 50 trajectoires pour l'adaptation aval représente un changement d'ordre de grandeur pour les intégrateurs industriels qui n'ont ni la logistique ni le budget pour constituer des datasets robotiques à grande échelle. Le codebook cross-embodiment ouvre en outre la voie à des modèles fondamentaux transférables entre différentes morphologies de robots, ce qui répond à l'un des reproches récurrents faits aux approches VLA : leur faible généralisation inter-plateforme. Le contexte concurrentiel est dense. Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA visent tous à former des modèles VLA généralistes, mais s'appuient principalement sur des datasets robotiques annotés comme OpenX-Embodiment ou des jeux propriétaires. Des travaux antérieurs comme UniSim ou des approches de pré-entraînement sur vidéo internet avaient déjà exploré cette direction sans atteindre ce niveau de frugalité en données. Ce preprint arXiv reste à ce stade une contribution de recherche : pas de déploiement industriel annoncé, pas de partenariat déclaré. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés comme LIBERO ou RoboSuite, et une validation sur une palette plus large de morphologies robotiques réelles.

RechercheOpinion
1 source
PAIWorld : un modèle fondation du monde en 3D cohérent pour la manipulation robotique
2318arXiv cs.RO 

PAIWorld : un modèle fondation du monde en 3D cohérent pour la manipulation robotique

Des chercheurs ont soumis PAIWorld sur arXiv (2506.18375, juin 2026), un framework de modèle fondationnel de monde (world foundation model, WFM) conçu pour la manipulation robotique avec cohérence 3D multi-vues. L'architecture, construite sur un transformateur de diffusion (DiT), intègre trois composants : des blocs d'attention croisée géométriquement informés (Geometry-Aware Cross-View Attention), un encodage positionnel rotatif qui intègre directions de rayons caméra et poses extrinsèques (Geometric RoPE), et un module Latent 3D-REPA qui distille des représentations 3D à partir de modèles 3D figés. Sur les benchmarks publics, PAIWorld se classe premier sur le leaderboard WorldArena et deuxième sur l'AgiBot-Challenge2026, deux références communautaires pour les simulateurs de manipulation. Le problème que PAIWorld adresse est concret : les robots de manipulation utilisent typiquement plusieurs caméras simultanées (vue égocentrique, eye-to-hand, poignet), mais les modèles de monde existants se contentent de concaténer les tokens de chaque vue sans raisonnement géométrique, générant dérive d'objet entre vues, incohérence de profondeur et désalignement de texture. Ces artefacts dégradent l'entraînement de politiques dans les simulateurs et amplifient le sim-to-real gap, problème central pour tout industriel cherchant à transférer des comportements entraînés en simulation vers des robots physiques. En établissant un canal explicite de communication inter-vues combiné à un prior géométrique 3D, PAIWorld vise à améliorer la fidélité des simulateurs utilisés pour le post-entraînement de politiques multi-vues et la planification basée sur des modèles (model-based planning). Les world foundation models appliqués à la robotique constituent un axe de recherche en forte croissance en 2026, porté notamment par des travaux comme UniSim et Genie 2, ainsi que par les approches VLA (Vision-Language-Action) qui cherchent à intégrer simulation et apprentissage de politiques. L'AgiBot-Challenge2026, structuré autour de tâches de manipulation dextère, joue un rôle de référence communautaire croissant pour ces systèmes. Il s'agit d'une prépublication scientifique sans partenariat commercial ni déploiement industriel annoncé : les suites logiques restent l'évaluation sur des benchmarks de transfert sim-to-real avec des plateformes physiques et l'intégration dans des world action models complets.

RecherchePaper
1 source
SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente
2319arXiv cs.RO 

SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente

Une équipe de chercheurs a publié fin juin 2026 SC3-Eval (arXiv:2606.18610), un cadre d'évaluation des politiques de manipulation robotique basé sur la génération vidéo cohérente. Le principe : plutôt que de rouler une politique en conditions réelles, un modèle fondamental vidéo pré-entraîné simule les trajectoires du robot et prédit si la tâche aboutit. SC3-Eval repose sur trois mécanismes de cohérence complémentaires. La cohérence dynamique avant-inverse entraîne simultanément le modèle à prédire les images à partir des actions et à récupérer les actions à partir des images, ancrant les rollouts à un espace d'action physiquement plausible. La cohérence multi-vue oblige le modèle à reconstruire chaque caméra depuis les autres, maintenant la cohérence spatiale sur de longs épisodes. Enfin, à l'inférence, un signal d'incertitude par chunk d'actions interrompt les rollouts dont les images générées divergent des actions demandées. Évalué sur sept politiques vision-langage-action (VLA) réelles, SC3-Eval atteint une corrélation de Pearson de 0,929 avec les résultats terrain et un MMRV de 0,119, surpassant trois baselines vidéo existantes. Ce résultat a une portée pratique immédiate : évaluer une politique de manipulation en conditions réelles est coûteux, lent et difficile à paralléliser. Un corrélat simulé à 0,929 constitue un substitut crédible pour filtrer les candidats politiques avant déploiement physique, réduisant potentiellement les cycles d'itération de plusieurs semaines à quelques heures. Fait notable, SC3-Eval reproduit fidèlement les modes d'échec observés en réel, permettant un diagnostic fin au niveau tâche plutôt qu'un classement agrégé, ce qui est plus actionnable pour un intégrateur. Le cadre se généralise par ailleurs à des tâches hors distribution d'entraînement, un point critique pour les équipes qui développent des politiques généralistes. Ce travail s'inscrit dans la vague d'adoption des modèles VLA commerciaux et de recherche, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix, OpenVLA, dont l'évaluation standardisée reste un goulot d'étranglement reconnu. Les approches alternatives passent par des simulateurs physiques classiques (MuJoCo, Isaac Sim) ou des rollouts réels coûteux ; les world models vidéo comme UniSim ou IRASim avaient amorcé cette direction mais se heurtaient à la dérive autorégressiveet à l'incohérence multi-caméras que SC3-Eval adresse directement. Le code et les données ne sont pas encore publiés au moment de la préprint, ce qui limite l'adoption immédiate. La prochaine étape logique sera de valider la méthode sur des plateformes humanoïdes à plus haute dimensionnalité, où le coût d'évaluation réelle est encore plus prohibitif.

RechercheOpinion
1 source
R2BC : apprentissage par imitation multi-agents à partir de démonstrations d'un agent unique
2320arXiv cs.RO 

R2BC : apprentissage par imitation multi-agents à partir de démonstrations d'un agent unique

Des chercheurs ont publié sur arXiv en octobre 2024 (arXiv:2510.18085v2) une méthode baptisée R2BC (Round-Robin Behavior Cloning), conçue pour entraîner des systèmes multi-robots à partir de démonstrations réalisées par un seul opérateur humain. Le principe : l'humain téléopère un robot à la fois, de façon séquentielle en "round-robin", sans jamais avoir à contrôler plusieurs agents simultanément ni à fournir des démonstrations dans l'espace d'action conjoint. La méthode a été évaluée sur quatre tâches simulées multi-agents, puis déployée sur deux tâches physiques avec des démonstrations humaines réelles. Résultat : R2BC atteint, voire dépasse dans certains cas, les performances d'une approche oracle de behavior cloning entraînée sur des démonstrations synchronisées privilégiées, c'est-à-dire des données idéales rarement disponibles en pratique. L'intérêt de R2BC tient à son approche de la collecte de données d'imitation learning. En robotique collaborative multi-bras ou en manipulation industrielle coordonnée, constituer des démonstrations synchronisées entre plusieurs agents représente un goulot d'étranglement logistique majeur : cela exige plusieurs opérateurs, une coordination temporelle précise, et multiplie les coûts d'instrumentation. R2BC supprime cette contrainte en permettant à un seul technicien de construire progressivement un dataset multi-agent, ce qui rend la méthode directement applicable aux déploiements à budget contraint. Que R2BC tienne la comparaison face à un oracle entraîné sur des données idéales constitue une validation empirique solide, même si les tâches physiques testées restent relativement simples et que les détails sur les configurations matérielles ne sont pas communiqués dans le préprint. L'imitation learning par clonage comportemental s'est imposé comme une voie centrale pour l'apprentissage robot depuis les travaux fondateurs de DAgger (Ross et al., 2011) et, plus récemment, avec les architectures VLA (Vision-Language-Action) portées notamment par Physical Intelligence (pi0) et Google DeepMind. Son extension au multi-agent reste néanmoins peu explorée : la plupart des travaux existants supposent des démonstrations conjointes ou une coordination centralisée, là où des méthodes de renforcement multi-agent comme MAPPO ou QMIX opèrent sans contrainte de collecte humaine. R2BC occupe ce blanc de la littérature avec une approche pragmatique. Les suites naturelles seraient de tester la méthode sur des équipes de robots plus nombreuses, dans des environnements dynamiques proches des standards industriels, et d'évaluer sa robustesse sur des tâches longue-horizon.

RecherchePaper
1 source
VEGA : apprentissage de VLA de navigation depuis des vidéos égocentriques réelles avec supervision géométrique
2321arXiv cs.RO 

VEGA : apprentissage de VLA de navigation depuis des vidéos égocentriques réelles avec supervision géométrique

Une équipe de chercheurs a publié sur arXiv (juin 2026) VEGA, une méthode pour entraîner des modèles de navigation de type VLA (Vision-Language-Action) à partir de vidéos égocentrées non étiquetées issues d'internet. Le principe : reconstruire la géométrie locale d'une scène à partir de vidéo monoculaire, puis générer des trajectoires obstacles-aware conditionnées sur des objectifs de navigation exprimés en texte, image ou waypoints spatiaux. Cette distribution de trajectoires sert ensuite à entraîner une politique de navigation par flow-matching. Les auteurs publient également VEGA-Bench, un benchmark de 250 000 scènes et environ 5 millions d'objectifs de navigation couplés à leur géométrie de scène, conçu pour évaluer la progression vers l'objectif, l'évitement de collisions et le dégagement autour des obstacles. Sur ce benchmark, VEGA réduit les collisions de 33,0 % et améliore le dégagement d'obstacles de 17,9 % par rapport au meilleur baseline. En conditions réelles, les gains sont plus marqués : au moins +150 % de taux de succès, -66,7 % de collisions et +60 % d'amélioration du dégagement. Ce travail s'attaque à un verrou structurel de la navigation robotique : comment tirer parti de la masse de vidéos égocentrées disponibles sur internet sans disposer d'annotations de trajectoires ni de données de reward. La clé de VEGA est d'utiliser la géométrie reconstruite exclusivement à l'entraînement, ce qui permet de distiller une planification obstacle-aware directement dans une politique visuelle, sans que la géométrie soit nécessaire à l'inférence. C'est un argument concret en faveur de la scalabilité des VLA de navigation, un domaine où le fossé démo-réalité reste prononcé. Les chiffres en conditions réelles sont significatifs, bien que les auteurs ne précisent pas la taille exacte ni la variété des environnements de test, ce qui limite la portée des conclusions sur la généralisation. La navigation en langage naturel par VLA s'inscrit dans une compétition active entre approches : les travaux de Google DeepMind sur RT-2 et NavIQ, les efforts d'Physical Intelligence (pi) avec Pi-0, ou encore GR00T N2 de NVIDIA explorent des axes proches. VEGA se distingue par l'angle supervision géométrique à partir de vidéos brutes, sans nécessiter de données en simulateur ni d'annotation humaine. Le code et le benchmark seront rendus publics à la publication, ce qui permettra à la communauté de valider les résultats de manière indépendante, étape indispensable avant tout usage industriel.

RechercheOpinion
1 source
Récupérer, Découvrir, Planifier : apprendre des compétences et des concepts à partir des échecs des robots
2322arXiv cs.RO 

Récupérer, Découvrir, Planifier : apprendre des compétences et des concepts à partir des échecs des robots

Des chercheurs ont publié le 18 juin 2026 sur arXiv (2606.18328) un article présentant ReSYNC, pour Recovery-Driven Synthesis of Relational Concepts, un système d'apprentissage robotique capable d'extraire automatiquement des abstractions conceptuelles à partir de ses propres erreurs. Le principe repose sur un double cycle d'apprentissage incrémental : une phase d'apprentissage de compétences, où le robot utilise le renforcement (RL) pour récupérer d'échecs observés durant l'entraînement, et une phase d'apprentissage de concepts, où il construit et raffine des prédicats relationnels, c'est-à-dire des règles symboliques décrivant les états du monde pertinents pour éviter ces mêmes échecs. Testé sur quatre domaines simulés incluant des tâches de manipulation non préhensile (pousser, faire glisser des objets sans saisie ferme), ReSYNC surpasse les méthodes de référence de plus de 50 % sur des problèmes à horizon long et non vus à l'entraînement. Un transfert sim-to-réel est également démontré, avec exécution de comportements de manipulation en conditions physiques réelles. L'enjeu industriel central que pointe ce travail est l'inefficacité structurelle du RL classique face à la diversité des pannes : entraîner une politique distincte pour chaque mode d'échec ne passe pas à l'échelle. ReSYNC propose une alternative en transformant des récupérations locales, apprises sur des tâches spécifiques, en capacité d'évitement global sur des scénarios inédits. Pour les intégrateurs industriels ou les équipes de robotique mobile, cela suggère un chemin vers des robots capables de se "réparer" conceptuellement sans intervention humaine entre chaque environnement de déploiement. Le transfert sim-to-réel reste cependant présenté sur des tâches de manipulation relativement contraintes, et les vidéos de démonstration sélectionnées dans un preprint ne permettent pas encore d'évaluer la robustesse sur des cycles de production réels. ReSYNC s'inscrit dans un courant de recherche qui tente de réconcilier planification symbolique classique (TAMP, PDDL) et apprentissage par renforcement, un problème ouvert depuis plus d'une décennie. Des approches concurrentes incluent les méthodes guidées par LLM pour la génération de prédicats (Code as Policies, SayCan) ainsi que les travaux sur la découverte automatique de prédicats en TAMP (LEGO, GROOT). Ce qui distingue ReSYNC est son ancrage explicite dans l'expérience d'échec plutôt que dans des démonstrations d'expert. Le code et les environnements de simulation ne semblent pas encore publics au moment de la soumission, et aucun partenaire industriel ni calendrier de déploiement n'est mentionné, ce qui classe ce travail comme une contribution académique prometteuse plutôt qu'un produit opérationnel.

RecherchePaper
1 source
ZiMPedance : modélisation et contrôle ZMP intégrant l'impédance pour robots quadrupèdes transportant des charges
2323arXiv cs.RO 

ZiMPedance : modélisation et contrôle ZMP intégrant l'impédance pour robots quadrupèdes transportant des charges

Des chercheurs ont publié une nouvelle méthode de contrôle pour quadrupèdes transportant des charges via des bras passifs à ressort, baptisée ZiMPedance. Le problème central : lorsqu'un quadrupède porte une charge suspendue à un bras passif (ressort et amortisseur, sans actionnement propre), la dynamique de cette interface génère des forces oscillatoires susceptibles de déstabiliser la locomotion. Les auteurs dérivent une formulation étendue du Zero Moment Point (ZMP), critère classique de stabilité en robotique de marche, intégrant explicitement les paramètres de raideur, d'amortissement et de masse de la charge. Cette formulation est ensuite incorporée dans un contrôleur prédictif (MPC) basé sur un modèle Single Rigid Body Dynamics augmenté des sous-systèmes passifs. En simulation, la méthode réduit les violations de stabilité par un facteur 10, de 7,0 % à 0,7 %, et abaisse l'effort en force de réaction au sol horizontale de 15 % par rapport à un contrôleur de référence. Les tests matériels ont utilisé une charge de 2 kg : le robot maintient une locomotion stable sous perturbations de type traction-relâchement là où le contrôleur nominal échoue. L'enjeu industriel est direct. Les bras passifs à ressort constituent une solution attractive pour équiper les quadrupèdes de capacités de transport sans alourdir la plateforme ni multiplier les actionneurs, contrairement aux manipulateurs actifs, plus lourds et plus coûteux. Le phénomène identifié ici, la résonance entre les configurations sous-amorties et les harmoniques de locomotion, représente un obstacle réel au déploiement en environnements non contrôlés. ZiMPedance démontre qu'il est possible de compenser ces effets par la modélisation plutôt que par le sur-actionnement, une approche directement transposable pour des cas d'usage logistiques, d'inspection industrielle ou de livraison de colis. Le même modèle permet en outre un suivi de position de l'effecteur via la dynamique passive, sans actionner le bras, ce qui ouvre des possibilités de contrôle indirect à faible coût énergétique. Ce travail s'inscrit dans la continuité des avancées MPC pour robots à pattes, un axe de recherche structurant depuis les développements autour de MIT Cheetah et ANYmal (ANYbotics). Dans le segment commercial, Boston Dynamics équipe Spot d'un bras actif à six degrés de liberté, Unitree propose des configurations payload sur ses quadrupèdes B1 et B2, et des acteurs européens comme Wandercraft ou Enchanted Tools explorent des architectures complémentaires pour la manipulation embarquée. Publié en preprint sur arXiv sous l'identifiant 2606.18883, ce travail n'a pas encore été soumis à révision par les pairs : les gains annoncés restent à valider en conditions de charge variable et sur terrain non structuré, hors cadre simulé.

RecherchePaper
1 source
HALOMI : apprentissage de la loco-manipulation humanoïde avec perception active à partir de démonstrations humaines
2324arXiv cs.RO 

HALOMI : apprentissage de la loco-manipulation humanoïde avec perception active à partir de démonstrations humaines

Une équipe de chercheurs vient de publier sur arXiv (réf. 2606.18772) HALOMI, un framework permettant à un humanoïde d'apprendre la "loco-manipulation" -- navigation et manipulation d'objets combinées -- à partir de démonstrations humaines captées en conditions réelles. Le système étend l'Universal Manipulation Interface (UMI) avec une perception égocentrique double : caméras en vue subjective (ego-view) et au niveau du poignet (wrist-view), enregistrant simultanément les trajectoires tête-mains de l'opérateur. La validation s'effectue sur le Unitree G1, humanoïde équipé d'un cou motorisé, sur cinq catégories de tâches réelles : navigation, préhension, manipulation bimane, coordination corps entier, et comportements dynamiques incluant lancer d'objets et accroupissement profond. HALOMI atteint un taux de réussite moyen de 85 % sur les trois tâches évaluées quantitativement. Ce résultat cible l'un des obstacles fondamentaux du retargeting humain-humanoïde : au-delà du sim-to-real gap, il existe un "human-to-humanoid gap" dans la perception égocentrique et l'exécution motrice. HALOMI l'attaque sur deux fronts : un alignement de la vue subjective, et une adaptation de trajectoire dite "controller-aware" qui intègre les contraintes dynamiques propres au robot. Le contrôleur de suivi tête-main opère dans un espace latent appris (manifold contraint), ce qui le rend plus robuste face aux cibles hors distribution -- écueil classique du retargeting direct. Le 85 % est à nuancer : les tâches qualitatives comme le lancer dynamique n'ont pas de métriques publiées, et les conditions expérimentales exactes (nombre d'essais, variabilité de scène) restent non précisées dans le papier. HALOMI s'inscrit dans la tendance qui exploite les démonstrations humaines pour réduire le coût de collecte de données sur robot, dans la lignée directe d'UMI (Stanford, 2023), et en parallèle des approches Vision-Language-Action comme Pi-Zero (Physical Intelligence) ou GR00T N2 (NVIDIA). La particularité ici est l'accent mis sur la perception active : le cou motorisé du G1 est un élément fonctionnel du pipeline, pas un détail cosmétique. Le Unitree G1, commercialisé autour de 16 000 dollars, s'est imposé comme banc de test académique commun depuis 2024. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans le papier : HALOMI reste pour l'heure une contribution de recherche, sans annonce de commercialisation.

RechercheOpinion
1 source
Adaptateur de réseau de neurones inversible pour la correspondance de flux en une étape dans la manipulation robotique
2325arXiv cs.RO 

Adaptateur de réseau de neurones inversible pour la correspondance de flux en une étape dans la manipulation robotique

Des chercheurs ont soumis fin juin 2026 sur arXiv (2606.19194) un adaptateur neuronal invertible pour la manipulation robotique dextère. La méthode repose sur un flow matching contraint dans un espace latent invertible, ce qui ramène la génération d'actions à une seule passe d'inférence, contre de multiples étapes pour les politiques de flow matching itératif classiques. Conditionné sur des entrées visuelles, linguistiques et proprioceptives, l'adaptateur réduit la latence moyenne des modèles VLA de 110 ms à 61 ms, soit un gain de 44 %, sans dégradation mesurée de la précision sur les benchmarks de manipulation testés. Cette réduction n'est pas marginale : à 110 ms par cycle, un VLA plafonne à moins de 10 Hz, fréquence insuffisante pour les tâches de manipulation en boucle fermée nécessitant une haute réactivité. Descendre à 61 ms rapproche ces modèles de conditions d'utilisation industrielle réelle, notamment pour des effecteurs devant s'adapter à une variabilité de pièces ou de positions. Point distinctif de l'approche : elle préserve la stabilité de la prédiction d'actions là où les méthodes de distillation one-step existantes, comme les consistency models ou certaines variantes DDIM, introduisent généralement une dégradation de précision. Les résultats sur benchmarks de simulation se situent à parité ou au-dessus de l'état de l'art sur un large éventail de tâches. Le flow matching s'est imposé en robotique embarquée via des modèles comme Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, qui ont démontré que la latence itérative restait un goulot d'étranglement à l'inférence. Le problème du passage à une seule étape est documenté depuis les travaux sur Consistency Policy ; l'approche proposée ici le contourne par l'invertibilité de l'espace latent plutôt que par distillation directe. Il convient de noter que l'article est un preprint non relu par les pairs et que les conditions des expériences réelles (type de robot, nature des tâches, variabilité de scènes) ne figurent pas dans l'abstract disponible, ce qui limite la portée des conclusions. Une validation sur des architectures VLA open-source telles qu'OpenVLA ou Octo constituerait la suite logique pour la communauté.

RechercheOpinion
1 source
Voir malgré l'occlusion : correction cinématique déterministe du bras pour la téléopération robotique
2326arXiv cs.RO 

Voir malgré l'occlusion : correction cinématique déterministe du bras pour la téléopération robotique

Des chercheurs ont publié sur arXiv (référence 2606.19240) une méthode baptisée AKC (Arm Kinematic Correction) pour corriger les erreurs de profondeur lors de la télé-opération de robots via une unique caméra RGB-D sans marqueurs. Le problème ciblé est l'auto-occlusion : quand un bras humain masque partiellement ses propres articulations, les estimations de profondeur se dégradent et le suivi de mouvement devient peu fiable. La méthode repose sur une contrainte géométrique simple, les longueurs de bras sont constantes, et applique le théorème de Pythagore pour reconstruire de manière déterministe la profondeur des articulations cachées à partir de la position du poignet et des longueurs d'avant-bras prédéfinies, sans modèle probabiliste ni ajustement de paramètres. La validation a été conduite contre un système Vicon sur des séquences statiques et dynamiques, mesurées par RMSE et corrélation de Pearson, avec une démonstration de télé-opération par mappage de mouvement en simulation et sur robot physique réel. L'intérêt opérationnel tient d'abord au coût d'entrée : une seule caméra RGB-D grand public remplace un rig Vicon à plusieurs milliers d'euros avec calibration lourde. Le caractère déterministe de l'AKC est un argument concret pour les intégrateurs : pas de phase d'entraînement, pas de poids à régler, pas de risque de mauvaise généralisation. Les résultats montrent que la méthode maintient la cohérence anatomique du squelette sous occultation sévère prolongée, même couplée à des filtres temporels peu robustes, ce qui correspond précisément aux conditions réelles de déploiement. Pour les équipes développant du learning from demonstration ou des interfaces homme-robot légères, c'est un signal que les pipelines bas coût commencent à atteindre un seuil de fiabilité exploitable en production. La télé-opération markerless est un terrain actif depuis que les robots humanoïdes et les bras manipulateurs apprenant par imitation ont pris de l'ampleur. Les approches concurrentes incluent les systèmes multi-caméras, les gants haptiques et les méthodes probabilistes comme les filtres particulaires, plus expressives mais coûteuses à calibrer. L'AKC se positionne comme une couche de correction légère, applicable par-dessus n'importe quel pipeline de pose estimation existant. Il s'agit d'un preprint académique sans partenariat industriel annoncé ; les suites naturelles seraient une intégration dans des frameworks comme ALOHA ou UMI, qui reposent précisément sur ce type de capture de mouvement à bas coût.

RecherchePaper
1 source
Allocation de tâches et planification du mouvement en environnements dynamiques encombrés via CBBA et graphes d'ensembles convexes
2327arXiv cs.RO 

Allocation de tâches et planification du mouvement en environnements dynamiques encombrés via CBBA et graphes d'ensembles convexes

Une équipe de chercheurs a publié sur arXiv (référence 2506.18516) un système de planification combinant deux algorithmes complémentaires pour coordonner des agents mobiles dans des environnements encombrés et dynamiques : le CBBA (Consensus-Based Bundle Algorithm) pour l'allocation distribuée des tâches, et les GCS (Graphs of Convex Sets) pour l'optimisation des trajectoires. L'approche repose sur un espace de configuration en 4D (3D spatial plus axe temporel), ce qui permet de modéliser simultanément la géométrie de l'environnement et le timing des rendez-vous mobiles. Les agents doivent non seulement se répartir les tâches, mais également estimer précisément quand et où ils pourront les atteindre, compte tenu des obstacles et des autres agents. Les résultats sont démontrés exclusivement en simulation, avec des scénarios incluant des tâches statiques et des objectifs de rendez-vous dynamiques. L'apport technique principal réside dans le couplage explicite entre allocation et planification, deux sous-problèmes généralement traités séparément dans la littérature sur les systèmes multi-robots. En pratique, la plupart des architectures industrielles de type AMR (Autonomous Mobile Robot) utilisent un planificateur de chemin découplé du système de dispatch, ce qui introduit des erreurs d'estimation temporelle et des conflits de ressources. En intégrant les GCS dans la boucle CBBA, le système produit des enchères basées sur des trajectoires réellement faisables plutôt que sur des heuristiques de distance euclidienne. Pour un intégrateur ou un décideur B2B, cela signifie potentiellement moins de recalculs coûteux en exécution et une meilleure fiabilité des estimations de temps de cycle dans des entrepôts ou ateliers denses. Il faut néanmoins noter que les GCS, bien que performants en optimisation convexe, restent computationnellement lourds à grande échelle, et que l'article ne fournit pas de données de timing comparatives. Les GCS ont été popularisés principalement par les travaux de Tobia Marcucci et Russ Tedrake au MIT via la librairie Drake, avec des applications initiales en manipulation et locomotion. Le CBBA est issu des travaux du MIT Lincoln Laboratory (Choi et al., 2009) et reste une référence en coordination décentralisée pour drones et robots terrestres. Cette combinaison s'inscrit dans un effort plus large pour combler le fossé entre planification géométrique et coordination multi-agent, un problème actif dans des labos comme Stanford ASL, CMU Robotics Institute, ou côté français l'INRIA et le LAAS-CNRS. Les prochaines étapes naturelles seraient une validation sur matériel réel, une évaluation de la scalabilité au-delà d'une dizaine d'agents, et une comparaison quantitative avec des approches basées sur MILP ou MAPF (Multi-Agent Path Finding).

RecherchePaper
1 source
C-ARC : le clustering adaptatif continu pour capteurs LiDAR non répétitifs
2328arXiv cs.RO 

C-ARC : le clustering adaptatif continu pour capteurs LiDAR non répétitifs

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.18948) C-ARC, un framework open source de clustering de nuages de points conçu pour les LiDAR non répétitifs à prismes de Risley, tels que le Livox Mid-360 et le Livox Avia. Ces capteurs génèrent des trajectoires en courbes de Rhodonée avec des distributions de points non uniformes et sans cycle de rotation défini, rendant inopérant le clustering classique par scan lines développé pour les LiDAR mécaniques répétitifs. C-ARC, implémenté en C++17 single-threaded, produit une sortie de clustering en temps réel à 20 Hz sur matériel grand public, via un graphe dual persistant sur fenêtre glissante. Un mécanisme adaptatif de résolution de grille, calibré à l'initialisation par boucle de contrôle exponentielle, équilibre le compromis sparsité-collision sans connaissance préalable du patron de scan. Pour les équipes SLAM et de tracking multi-objet en robotique mobile, ce framework comble un manque concret : les LiDAR non répétitifs restaient hors scope des stacks de perception temps réel faute d'algorithme adapté. Le découplage insertion haute fréquence / récupération de clusters à la demande est critique pour limiter la latence dans les pipelines de cartographie et de suivi d'objets. Le mécanisme adaptatif améliore par ailleurs la qualité de clustering des méthodes à grille existantes sur données non répétitives, ce qui ouvre une voie d'intégration sans refonte complète du stack de perception. Les auteurs identifient explicitement une limitation : l'occupancy de cellule non bornée pose problème sur les capteurs à pattern de scan fortement concentré, cas du Livox Avia. Livox, filiale de DJI, domine le segment des LiDAR non répétitifs avec ses capteurs Mid-360 (couverture hémisphérique) et Avia, face aux solutions mécaniques traditionnelles de Velodyne, Ouster et Hesai. Leur attractivité tarifaire a favorisé leur adoption dans les AMR et robots de livraison, mais sans algorithme de clustering natif adapté à leurs spécificités optiques. C-ARC s'insère au niveau du preprocessing bas niveau, en amont des modules de détection et de SLAM. Les approches alternatives par deep learning offrent davantage de robustesse aux distributions irrégulières, mais restent généralement moins adaptées aux contraintes embarquées temps réel. Les auteurs indiquent une prochaine évaluation sur des datasets plus diversifiés et évoquent une extension multi-capteurs.

RecherchePaper
1 source
Commande prédictive par modèle basée sur MuJoCo via dérivées d'espaces affines : robustesse et efficacité
2329arXiv cs.RO 

Commande prédictive par modèle basée sur MuJoCo via dérivées d'espaces affines : robustesse et efficacité

Des chercheurs ont publié sur arXiv (2512.21109v2) une méthode d'optimisation du contrôle prédictif par modèle (MPC) dans MuJoCo, le simulateur physique open source de DeepMind, largement utilisé en robotique. Le coeur de la contribution est l'intégration de WASP (Web of Affine Spaces), une approche de calcul de dérivées, comme remplacement direct de la différentiation finie (FD) dans la bibliothèque MJPC (MuJoCo MPC). Les expériences montrent un gain de vitesse allant jusqu'à 2x par rapport au backend FD lorsque WASP est couplé à des planificateurs basés sur les dérivées, notamment iLQG (iterative Linear-Quadratic-Gaussian). Les tests couvrent plusieurs morphologies de robots avec des systèmes à grand nombre de degrés de liberté (DOF), contexte dans lequel FD devient particulièrement coûteux. L'implémentation est publiée en open source et s'intègre sans modification d'architecture dans MJPC existant. L'enjeu est technique mais concret : la différentiation finie est historiquement le goulot d'étranglement du MPC en temps réel sur des systèmes complexes, car elle nécessite de nombreuses évaluations du simulateur pour estimer les gradients. WASP contourne ce problème en réutilisant les informations de calculs de dérivées précédents, ce qui est particulièrement adapté aux mises à jour itératives et incrémentales du MPC. En pratique, cela signifie qu'un contrôleur MPC peut fonctionner à des fréquences plus élevées ou sur des robots avec davantage de degrés de liberté sans augmenter le budget computationnel, un facteur déterminant pour le déploiement sur matériel réel. Les auteurs rapportent également que WASP surpasse les planificateurs stochastiques par échantillonnage de MJPC sur les tâches d'évaluation, en fiabilité et en efficacité, ce qui renforce l'argument en faveur des méthodes basées sur les gradients lorsque ceux-ci sont calculables de façon robuste. MJPC est l'implémentation de référence du MPC sur MuJoCo, et MuJoCo lui-même est devenu le simulateur standard dans la recherche en locomotion et manipulation depuis son acquisition par DeepMind en 2021 et son passage en open source. La différentiation finie y était utilisée faute de meilleures alternatives efficaces pour des simulateurs de contact. WASP a été introduit récemment comme méthode générique de calcul de dérivées approximées en séquence, et ce papier constitue sa première intégration documentée dans un framework MPC robotique établi. Les concurrents directs sur le terrain du MPC différentiable incluent des approches comme Dojo ou MJX (version JAX de MuJoCo permettant la différentiation automatique), mais WASP se positionne comme solution sans réécriture du simulateur sous-jacent. Les prochaines étapes probables sont l'évaluation sur du matériel réel et l'extension à des scènes de contact plus complexes, qui restent le cas limite critique pour tout simulateur physique.

RecherchePaper
1 source
GCNGrasp-VP : planification de vue guidée par les affordances pour une préhension efficace orientée tâche
2330arXiv cs.RO 

GCNGrasp-VP : planification de vue guidée par les affordances pour une préhension efficace orientée tâche

Une équipe de recherche publie ce mois-ci sur arXiv (référence 2606.19091) GCNGrasp-VP, un framework destiné à améliorer la saisie orientée tâche en robotique de manipulation, en particulier lorsque l'objet cible est partiellement masqué. Le système repose sur deux composants : GCNGrasp-v2, un modèle de préhension qui évalue simultanément la qualité d'une prise et prédit un champ d'affordance en temps constant, et Affordance-VP, un planificateur de points de vue qui utilise ce champ d'affordance comme métrique de gain d'information pour repositionner la caméra du robot vers les zones fonctionnellement pertinentes. Les auteurs rapportent une validation en environnement réel sur des scénarios mono-objet, avec une latence de calcul annoncée à l'échelle de la milliseconde et une correction de point de vue obtenue en un seul déplacement caméra. Le code et les modèles sont rendus publics sur GitHub. L'intérêt technique de cette approche réside dans la dissociation entre perception active et reconstruction de scène. Les méthodes existantes de view planning s'appuient généralement sur une reconstruction 3D complète avant de décider où observer, ce qui introduit une latence incompatible avec les contraintes de cycle industriel. GCNGrasp-VP contourne ce goulot en substituant la carte d'affordance à l'incertitude géométrique comme critère d'exploration, ce qui réduit le nombre d'ajustements nécessaires à un seul dans les tests publiés. Pour les intégrateurs travaillant sur des cellules de picking ou d'assemblage, c'est un angle pertinent : gérer les occlusions partielles sans recourir à un système de vision multi-caméras fixe ou à une reconstruction volumétrique coûteuse. Ce travail s'inscrit dans une tendance plus large vers les modèles de préhension sémantiquement informés, où la notion d'affordance, popularisée par des travaux comme GCNGrasp original et les approches VLA (Vision-Language-Action) de type pi-zero ou GR00T, commence à descendre au niveau de la planification perceptuelle. La contribution reste pour l'instant un preprint non peer-reviewed, validé sur des scénarios mono-objet en laboratoire. Les benchmarks sur des configurations multi-objets avec occlusions sévères, ou dans un contexte industriel réel, n'ont pas encore été publiés. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné.

IA physiquePaper
1 source
Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision
2331arXiv cs.RO 

Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision

Des chercheurs ont publié le 23 juin 2026 une étude comparative systématique (arXiv:2606.18594) évaluant quatre types d'espaces d'action en apprentissage par renforcement (RL) pour la manipulation robotique visuelle : l'incrément de pose, la vitesse de pose, l'incrément de position articulaire, et la vitesse articulaire. Les politiques ont été entraînées en simulation puis déployées sur robot réel via transfert sim-to-réel, sur deux tâches benchmark : la saisie d'objet et la poussée d'objet. Résultat principal : l'espace d'action en vitesse articulaire (joint velocity) surpasse les trois autres alternatives, aussi bien en fluidité de mouvement qu'en performance finale sur les deux tâches testées. Ce résultat a une portée pratique directe pour les ingénieurs qui conçoivent des systèmes de manipulation autonome. Le choix de l'espace d'action est une décision d'architecture souvent sous-documentée dans la littérature RL appliquée, et les praticiens se retrouvent fréquemment à tâtonner empiriquement. En démontrant que la vitesse articulaire favorise à la fois la sécurité (mouvements plus lisses, moins de à-coups) et la performance sur des tâches visuelles, l'étude fournit une recommandation actionnable. Elle confirme aussi que le gap sim-to-réel dépend non seulement de la politique apprise, mais de la représentation même des actions, un levier souvent négligé dans les pipelines de transfert. Pour les intégrateurs travaillant avec des bras industriels ou des cobots, cette granularité de contrôle peut directement influer sur la durée de vie mécanique et la robustesse opérationnelle. L'étude s'inscrit dans un courant de recherche croissant sur la robustesse du transfert sim-to-réel pour la manipulation visuelle, aux côtés de travaux sur les politiques visuomotrices à base de transformeurs (VLA) comme pi-0 de Physical Intelligence ou les approches diffusion-policy popularisées par Columbia et Toyota Research Institute. Contrairement à ces méthodes qui s'intéressent à l'architecture du modèle, ce papier intervient en amont, au niveau du signal de commande lui-même. Les auteurs annoncent des recommandations pratiques pour le choix d'espace d'action selon le contexte (simulation seule ou déploiement réel), ce qui en fait une référence méthodologique utile pour les équipes démarrant un projet RL sur hardware.

RecherchePaper
1 source
Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D
2332arXiv cs.RO 

Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D

Des chercheurs ont publié le 19 juin 2026 sur arXiv (référence 2606.19340) un framework zero-shot pour la manipulation dextre à longue séquence, capable d'exécuter des tâches en plusieurs étapes sur des objets inconnus sans entraînement spécifique. Le système prend en entrée des instructions en langage naturel et des images RGB multi-vues calibrées, sans capteur de profondeur, et utilise un modèle vision-langage (VLM) pour générer des points-clés 2D dans un référentiel de vue de référence. Ces points sont ensuite reconstruits en 3D par fusion multi-vues combinant triangulation et une technique de "ray voting" : le système parcourt le rayon optique de la caméra principale pour identifier les candidats géométriquement cohérents dans les vues adjacentes. Les points-clés 3D obtenus supportent deux modes d'exécution : saisie-dépose directe et utilisation d'outils via la récupération d'une trajectoire outil stockée à 6 degrés de liberté (6DoF), alignée sur la configuration de scène courante. Un module bras-main génère ensuite les paires grasping-mouvement faisables. Les expériences réelles montrent que le système surpasse des baselines RGB-D vue unique et des VLA fine-tunés en précision de grounding 3D et en fiabilité d'exécution. L'enjeu central est la flexibilité de déploiement : un système zero-shot qui surpasse des VLA (Vision-Language-Action models) fine-tunés sur données spécifiques remet en question l'hypothèse dominante selon laquelle la manipulation dextre en environnement réel exige obligatoirement de larges datasets annotés et un réentraînement par tâche. Pour les intégrateurs industriels, cela signifie potentiellement des cycles de mise en production raccourcis, sans collecte systématique de démonstrations téléopérées pour chaque nouvel objet ou configuration. La boucle fermée de vérification d'état et de replanification (closed-loop replan) est particulièrement significative : elle distingue ce travail des approches open-loop qui accumulent les erreurs sur des séquences longues, un problème récurrent dans les démos de manipulation non supervisées. L'absence de capteur de profondeur réduit par ailleurs les contraintes matérielles à l'intégration sur des cellules robotiques existantes. Ce travail s'inscrit dans la tension croissante entre deux paradigmes : les VLA de bout-en-bout, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA de Stanford, qui nécessitent supervision et données massives, et les approches modulaires exploitant les capacités de raisonnement de VLM existants sans réentraînement. Depuis 2023, les VLA dominent les benchmarks de manipulation dextre, mais leur coût en données et leur manque de généralisation zero-shot à de nouveaux objets freinent les déploiements industriels à grande échelle. À noter : ce preprint ne mentionne pas d'affiliation institutionnelle dans l'abstract disponible, ce qui limite l'évaluation de la maturité des résultats, et n'a pas encore été soumis à peer review. Aucun acteur européen n'est impliqué. Les suites naturelles seraient une validation sur les benchmarks standardisés DROID ou Open X-Embodiment, et une comparaison formelle avec les versions récentes de Pi-0 et GR00T N2 pour situer précisément les gains annoncés.

RechercheOpinion
1 source
Guidage d'objets linéaires flexibles en milieu plan par deux mains robotiques via les solutions d'élastica d'Euler
2333arXiv cs.RO 

Guidage d'objets linéaires flexibles en milieu plan par deux mains robotiques via les solutions d'élastica d'Euler

Une équipe de recherche a publié sur arXiv (référence 2501.02874, cinquième version) un cadre mathématique pour la manipulation robotique d'objets linéaires flexibles, câbles, fils électriques, aliments frais, dans des environnements plans par deux mains robotiques. L'objet est modélisé comme une tige élastique non extensible, et sa forme est décrite par les solutions d'Euler, appelées "elastica" : des équations en forme fermée qui calculent la courbure de la tige en fonction des positions et tangentes aux deux points de saisie. Les robots font varier les positions d'accroche tout en maintenant des tangentes égales aux deux extrémités. À partir de ce modèle, les auteurs dérivent des critères analytiques explicites pour trois propriétés critiques : l'absence d'auto-intersection, la stabilité mécanique de la configuration, et l'évitement d'obstacles dans un environnement parsemé de quelques obstacles. Un schéma de planification complet est implémenté et validé sur des exemples détaillés. Ce travail s'attaque à un problème ouvert de longue date en robotique industrielle : la manipulation d'objets linéaires déformables (DLO, deformable linear objects). Le câblage en assemblage automobile ou électronique, la manutention alimentaire en agro-industrie, le routage de tuyaux flexibles, autant de tâches à forte valeur ajoutée où les robots échouent en production. L'apport central ici est l'approche en forme fermée : contrairement aux méthodes basées sur la simulation par éléments finis (FEM) ou sur l'apprentissage, elle offre des garanties déterministes et un temps de calcul compatible avec la planification en temps réel. Pour un intégrateur ou un COO industriel, cela signifie potentiellement des systèmes vérifiables formellement, sans dépendance à un modèle appris fragile. Le problème de manipulation des DLO est étudié depuis les années 1990, avec des approches allant de la simulation physique aux représentations neuronales apprises par des groupes comme ETH Zurich, MIT CSAIL ou Stanford. Les elastica d'Euler sont un outil classique de mécanique des poutres, théorisé au XVIIIe siècle, ici réactivé dans un cadre de contrôle optimal. La version 5 du preprint suggère une itération substantielle depuis la soumission initiale de janvier 2025. Les auteurs ne mentionnent pas de validation sur robot physique au-delà des exemples simulés, ce qui constitue la limite principale à surveiller avant toute intégration industrielle. L'extension naturelle serait un passage en environnements 3D et des tests sur plateforme réelle.

RecherchePaper
1 source
STORM : représentation par slots centrée objet et sensible à la tâche pour la manipulation robotique
2334arXiv cs.RO 

STORM : représentation par slots centrée objet et sensible à la tâche pour la manipulation robotique

Des chercheurs ont publié STORM (Slot-based Task-aware Object-centric Representation for robotic Manipulation), un module d'adaptation léger conçu pour augmenter les modèles visuels de fondation figés avec des représentations centrées sur les objets. Plutôt que de réentraîner de grands backbones visuels, coûteux en calcul et en données étiquetées, STORM insère un ensemble restreint de "slots", des vecteurs appris qui capturent chaque objet de la scène de manière distincte. L'entraînement se déroule en deux phases : un préentraînement visuo-sémantique qui stabilise les slots via des embeddings de langage, puis une adaptation conjointe avec la politique de manipulation. Les expériences, menées sur des benchmarks de découverte d'objets et des tâches de manipulation simulée, montrent des gains de robustesse face aux distracteurs visuels et une meilleure performance de contrôle par rapport à l'utilisation directe des features figées ou à l'entraînement end-to-end de représentations object-centriques. L'enjeu est structurel pour la robotique de manipulation. Les modèles visuels de fondation comme DINOv2 ou SigLIP fournissent des features perceptuelles puissantes, mais leurs représentations denses traitent la scène comme une grille de pixels sans distinguer explicitement les objets. Pour une tâche du type "saisir la boîte rouge parmi plusieurs objets", cette absence de structure oblige le réseau de politique à apprendre lui-même la décomposition de la scène, ce qui nuit à la généralisation hors distribution. STORM contourne ce problème sans toucher au backbone. Le résultat valide l'hypothèse que l'adaptation multi-phase (stabilisation sémantique d'abord, alignement tâche ensuite) évite la dégénérescence des slots, phénomène où plusieurs slots capturent le même objet ou des régions non pertinentes pour la tâche. La ligne de recherche sur les représentations object-centriques remonte à Slot Attention (Locatello et al., 2020, DeepMind) et à MONet. L'originalité de STORM est d'ancrer ces slots dans la sémantique linguistique et de les greffer sur des fondations pré-entraînées plutôt que de repartir de zéro. Dans un écosystème où les VLA (Vision-Language-Action models) comme pi0 de Physical Intelligence ou OpenVLA cherchent à intégrer langage et action de bout en bout, STORM propose une alternative modulaire et économe. Les résultats restent limités à la simulation, ce qui laisse entière la question du sim-to-real gap. Les prochaines étapes logiques incluent la validation sur robots physiques et le test face à des perturbations visuelles plus agressives que les benchmarks actuels.

RecherchePaper
1 source
TurboMap : cartographie locale accélérée par GPU pour le SLAM visuel
2335arXiv cs.RO 

TurboMap : cartographie locale accélérée par GPU pour le SLAM visuel

Des chercheurs ont publié sur arXiv (arXiv:2511.02036v4) TurboMap, un backend de cartographie locale accéléré par GPU pour les systèmes de SLAM visuel temps réel. Le principal apport est une refonte architecturale du pipeline de cartographie locale : la recherche de correspondances de points-clés est parallélisée sur GPU, la fusion de points de carte est redessinée pour l'exécution parallèle, l'élagage des keyframes redondantes est optimisé côté CPU, et un solveur de Bundle Adjustment local rapide sur GPU est intégré. Pour limiter les coûts de transfert de données entre CPU et GPU, goulot d'étranglement classique de ces architectures hybrides, les auteurs introduisent un stockage persistant des keyframes directement en mémoire GPU. Sur les benchmarks standards EuRoC et TUM-VI, TurboMap atteint des accélérations moyennes de respectivement 1,3x et 1,6x sur la phase de cartographie locale, sans dégradation de la précision du SLAM. Ces gains sont mesurés sur jeux de données de référence en conditions contrôlées : les performances en environnements industriels non structurés restent à valider. Ces gains de latence ont une portée directe pour les intégrateurs de systèmes autonomes. En SLAM visuel, la cartographie locale doit respecter des contraintes temporelles strictes sous peine de dégrader la qualité de la carte et de provoquer des pertes de tracking, un échec critique pour un robot mobile, un drone ou un véhicule autonome. Une accélération de 1,3 à 1,6x sur cette étape permet soit d'opérer à fréquence plus élevée, soit de relâcher les contraintes matérielles pour réduire le coût embarqué. Le travail démontre surtout que la parallélisation GPU efficace du SLAM n'est pas bloquée par la puissance de calcul brute, mais par la synchronisation des états partagés et les transferts mémoire CPU-GPU : un résultat qui oriente les futurs travaux d'optimisation dans ce domaine. Le SLAM visuel est un champ de recherche mature, dominé par des systèmes comme ORB-SLAM3 (Université de Saragosse) et VINS-Mono (HKUST), sur lesquels TurboMap se greffe comme backend amélioré sans rupture architecturale. D'autres approches concurrentes comme GlORIE-SLAM ou GO-SLAM explorent des pipelines entièrement neuronaux, mais avec un coût computationnel souvent incompatible avec l'embarqué contraint. TurboMap se positionne ainsi comme une solution incrémentale et compatible avec les pipelines existants, ce qui facilite l'adoption. La prochaine étape naturelle serait la validation sur matériel embarqué comme la Jetson AGX d'NVIDIA et une intégration dans ROS 2 pour un déploiement industriel : aucune timeline ni partenariat industriel n'est annoncé à ce stade.

RecherchePaper
1 source
Plateforme d'IA incarnée évolutive pour le transfert réel-sim-réel de tâches de manipulation mobile domestique
2336arXiv cs.RO 

Plateforme d'IA incarnée évolutive pour le transfert réel-sim-réel de tâches de manipulation mobile domestique

Une équipe de chercheurs a publié sur arXiv (référence 2606.18646v1) les travaux autour de BestMan, une plateforme logicielle conçue pour boucler le cycle real-to-sim-to-real dans le domaine de la manipulation mobile en environnements domestiques. Le système s'articule autour de trois composants : un module de génération automatique de scènes (ASG) qui reconstruit des environnements simulés à partir d'observations réelles, une architecture d'apprentissage de compétences hybrides évaluable à grande échelle en simulation, et un middleware unifié baptisé HUM (Hardware-agnostic and Unified Middleware) assurant le déploiement sur des manipulateurs mobiles hétérogènes. Il s'agit d'une contribution académique sous forme de preprint, pas d'un produit commercialisé ni d'un déploiement industriel annoncé. L'enjeu central que traite BestMan est le fossé sim-to-real, l'un des verrous les plus persistants de la robotique d'intérieur. La manipulation mobile en environnement non-structuré, c'est-à-dire sur des surfaces encombrées, dans des cuisines ou des entrepôts domestiques sans balisage préalable, reste hors de portée des approches qui nécessitent une reconstruction manuelle et coûteuse des scènes de simulation. Le module ASG automatise cette étape, ce qui réduit le coût d'entrée pour les chercheurs souhaitant tester des stratégies de contrôle. Le middleware HUM, s'il tient ses promesses d'agnosticisme matériel, simplifierait le travail des intégrateurs qui opèrent des flottes de robots hétérogènes : une seule pipeline de simulation pour plusieurs plateformes physiques. L'article revendique des benchmarks standardisés, ce qui manquait cruellement dans le champ de la manipulation mobile, mais les métriques précises de performance (taux de succès, temps de cycle, généralisation à des objets inconnus) ne sont pas détaillées dans l'abstract. BestMan s'inscrit dans une vague de plateformes d'intelligence incarnée visant à industrialiser le pipeline simulation-réel : on pense à Isaac Sim de NVIDIA, à Genesis (plateforme de simulation physique open-source), ou encore aux travaux de Physical Intelligence (pi) autour de Pi-0 qui misent sur les VLA (vision-language-action models) pour généraliser sans retraining massif. Côté européen, des acteurs comme Enchanted Tools (Miroki) ou Wandercraft (Atalante) traitent des problèmes adjacents de transfert sim-réel mais sur des morphologies très différentes. L'équipe derrière BestMan ne précise pas de partenariats industriels ni de calendrier de mise à disposition publique de la plateforme : la prochaine étape logique serait une validation sur plusieurs familles de robots et une ouverture du code pour permettre des benchmarks communautaires comparables.

RecherchePaper
1 source
Adaptation mutuelle dans le co-transport humain-robot avec incertitude sur les préférences humaines
2337arXiv cs.RO 

Adaptation mutuelle dans le co-transport humain-robot avec incertitude sur les préférences humaines

Une équipe de chercheurs a publié en mars 2025 sur arXiv (référence 2503.08895) un cadre unifié de co-transport humain-robot fondé sur l'adaptation mutuelle, visant à résoudre un problème central de la robotique collaborative physique : comment un robot peut-il s'adapter en temps réel à un partenaire humain dont les préférences de trajectoire sont incertaines, et réciproquement ? L'article propose trois contributions distinctes. Plutôt que de fixer a priori les paramètres comportementaux du partenaire, les auteurs modélisent une distribution de probabilité sur l'ensemble des préférences possibles. Ils introduisent ensuite une mesure d'obstination (stubbornness) variant dans le temps, qui détermine dynamiquement si le robot doit mener la trajectoire ou céder la direction à l'humain lorsque celui-ci manifeste une préférence forte et persistante au-delà d'un seuil défini. Enfin, une stratégie d'optimisation de posture s'applique au niveau du contrôle bas-niveau pour compenser les comportements imprévisibles quand l'humain prend les commandes. Le cadre a été validé auprès de vingt participants, complété par des simulations comparatives. Ce travail adresse un verrou technique majeur pour les robots collaboratifs physiques en logistique, industrie et assistance à la personne : l'écart entre les modèles humains supposés et la variabilité réelle des opérateurs. En introduisant une modélisation probabiliste plutôt que déterministe des préférences, le framework évite le blocage classique des systèmes à paramètres fixes qui échouent dès que l'humain dévie du comportement anticipé. Pour un intégrateur ou un COO industriel, le signal concret est que des robots de co-manutention pourraient s'adapter à différents opérateurs sans reprogrammation, réduisant les coûts de déploiement multi-site. La bascule dynamique entre modes "robot meneur" et "humain meneur" offre par ailleurs une flexibilité opérationnelle utile dans des contextes où l'ergonomie ou la sécurité prime sur l'optimisation de trajectoire. Le co-transport physique humain-robot reste peu industrialisé comparé aux AMR ou aux cobots de type Universal Robots et FANUC CRX. Les approches antérieures à impédance variable ou fondées sur des modèles de jeu de Stackelberg avaient posé des bases théoriques, mais butaient sur la rigidité des hypothèses comportementales. Ce papier s'inscrit dans une tendance plus large à intégrer l'incertitude humaine dans la boucle de contrôle, direction explorée notamment par le MIT CSAIL et, en France, par l'INRIA au travers de travaux sur la planification collaborative. Les prochaines étapes probables incluent des validations en environnement industriel réel et l'extension à des tâches multi-étapes, où la gestion de l'obstination sur des horizons temporels plus longs constituera un défi supplémentaire.

RecherchePaper
1 source
ReSiReg : vers une sémantique spatialement cohérente pour les tâches robotiques guidées par le langage
2338arXiv cs.RO 

ReSiReg : vers une sémantique spatialement cohérente pour les tâches robotiques guidées par le langage

Des chercheurs ont déposé sur arXiv (2606.19088) ReSiReg, une méthode de reconstruction de features visant à corriger l'incohérence spatiale des embeddings denses produits par les Vision-Language Models (VLM) utilisés en robotique. Le constat de départ est documenté : les VLM de type ViT-B produisent des représentations sémantiques bruitées et spatialement incohérentes, ce qui compromet la localisation d'objets dans un espace 3D à partir d'instructions en langage naturel. ReSiReg regroupe les activations intermédiaires en prototypes visuels, dérive pour chacun des descripteurs linguistiques, puis reconstruit chaque patch comme un mélange pondéré de ces embeddings prototype. L'évaluation porte sur des benchmarks de segmentation sémantique ouverte (OVSS) et de cartographie 3D sur plusieurs backbones, complétée par des tests qualitatifs sur des scènes de manipulation réelle ; les auteurs proposent également un modèle compact à 25 millions de paramètres, contre 86M pour un ViT-B standard, avec des performances déclarées compétitives. Ce problème d'incohérence spatiale est un frein concret pour les intégrateurs : les pipelines VLA (Vision-Language-Action) doivent actuellement empiler des composants supplémentaires comme SAM, des filtres de profondeur et des post-traitements pour stabiliser les activations avant de les transmettre au contrôleur. Corriger le problème au niveau du feature lui-même simplifie cette chaîne, et le modèle 25M constitue un argument direct pour le déploiement embarqué sur hardware contraint. Nuance importante : les résultats qualitatifs illustrent des "activations plus cohérentes spatialement", mais sans métriques systématiques chiffrées permettant une comparaison directe avec l'existant. ReSiReg s'inscrit dans un effort plus large d'adaptation des VLM généralistes au contexte robotique, après des travaux comme LERF ou CLIP-Fields qui ancrent les embeddings linguistiques dans des représentations 3D. La méthode opère en amont, sur la représentation 2D dense, et se veut agnostique au backbone, à la différence de solutions comme OpenMask3D ou les approches Distilled Feature Fields. L'article est à l'état de preprint non révisé par les pairs ; le code est annoncé sur resireg.github.io. Les suites naturelles incluent une évaluation sur des benchmarks de manipulation de référence (RLBench, LIBERO) et une intégration dans des architectures VLA de bout en bout telles que Pi-0 ou OpenVLA.

IA physiqueOpinion
1 source
Glissement d'objets par manipulation des pieds sur un robot bipède à roues avec contrôle hiérarchique
2339arXiv cs.RO 

Glissement d'objets par manipulation des pieds sur un robot bipède à roues avec contrôle hiérarchique

Des chercheurs ont publié sur arXiv (arXiv:2606.19233, juin 2026) un framework de contrôle hiérarchique permettant à des robots bipèdes à roues d'effectuer des tâches de manipulation d'objets au sol à l'aide de leurs membres inférieurs motorisés, une capacité baptisée "pédimanipulation mobile". Le système repose sur un contrôleur prédictif non linéaire (NMPC) construit sur un modèle dynamique simplifié à trois corps rigides (TRB), intégrant explicitement le degré de liberté en roulis de hanche et plusieurs modes de contact roue-sol. En expérimentation réelle, le robot a récupéré un objet de 1 kg coincé sous un bureau et déplacé latéralement un objet de 4 kg sur une distance de 0,228 m via une motion de type "scooting". Deux primitives de mouvement ont été validées sur hardware : scooting (poussée frontale par rotation des roues) et lateral sliding (déplacement latéral par pas de côté). L'intérêt industriel de cette approche réside dans sa réutilisation du train roulant comme effecteur de manipulation, sans bras supplémentaire ni outil dédié. Le NMPC régule simultanément la locomotion et les forces d'interaction, ce qui signifie que le robot maintient son équilibre tout en exerçant un effort contrôlé sur l'objet, un problème de couplage non trivial. Le planificateur de trajectoire intègre les transitions adhérence-glissement (stick-slip) dans le contact sol-objet, un phénomène souvent ignoré dans les démos en simulation mais critique en conditions réelles. C'est un résultat concret qui réduit le demo-to-reality gap sur la manipulation au sol, habituellement dominée par les manipulateurs à bras. Les robots bipèdes à roues constituent une architecture émergente entre AMR classiques et humanoïdes complets : Agility Robotics (Digit), Boston Dynamics (Spot avec extension roues dans certaines configs), et des plateformes académiques comme le Cassie de l'Oregon State University ont popularisé cette morphologie. Ce travail s'inscrit dans un courant de recherche sur la pédimanipulation, utiliser les jambes comme manipulateurs, que l'on retrouve aussi sur quadrupèdes (ANYmal, Go2). La prochaine étape probable est l'extension à des objets non rigides ou à des surfaces non planes, ainsi que l'intégration de perception pour fermer la boucle en environnement non structuré.

RecherchePaper
1 source
EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets
2340arXiv cs.RO 

EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets

Une équipe de chercheurs a publié EffiNav, un framework de navigation robotique orientée-objet (Object Goal Navigation, ObjNav) qui fusionne perception de profondeur et modèles vision-langage pour améliorer l'efficacité des trajectoires d'exploration en environnement inconnu. La contribution, déposée en preprint sur arXiv (2606.18634) en juin 2026, évalue le système sur deux simulateurs de référence du domaine, HM3D (Habitat Matterport 3D) et OVON (Open-Vocabulary Object goal Navigation), puis le valide sur robots physiques en conditions réelles. Les auteurs l'étendent également à GOAT-BENCH, un benchmark de navigation avec mémoire augmentée, pour démontrer la généralisation du framework au-delà du protocole ObjNav standard. Sur les deux métriques habituelles du domaine, taux de succès (SR) et succès pondéré par longueur de chemin (SPL), EffiNav égale ou dépasse les baselines récentes, sans que le preprint ne communique de valeurs numériques absolues permettant une comparaison chiffrée directe. L'apport principal porte moins sur le taux de réussite brut que sur le SPL, qui pénalise les trajets inutilement longs. C'est précisément là que les approches actuelles divergent : les modèles entraînés end-to-end, y compris certains VLA (Vision-Language-Action), peinent à généraliser à de nouveaux environnements, tandis que les frameworks modulaires sans apprentissage accumulent des allers-retours redondants et revisitent des zones déjà explorées. EffiNav prétend adresser ces deux pathologies simultanément en combinant une estimation de la profondeur pour la représentation géométrique de l'espace et un modèle vision-langage pour l'interprétation sémantique. Pour les intégrateurs de robots de service ou les décideurs B2B, l'efficacité de trajectoire est directement liée au temps disponible pour les tâches secondaires, donc à la rentabilité opérationnelle d'un déploiement en entrepôt ou en environnement indoor. Le champ ObjNav s'est structuré autour de l'écosystème Habitat de Meta AI Research, qui fournit les simulateurs HM3D et OVON utilisés ici. Les approches concurrentes incluent des pipelines modulaires à cartographie explicite comme SemExp ou OpenFMNav, et des VLA appliqués à la navigation. EffiNav se positionne comme un framework hybride ne nécessitant ni encodeurs supplémentaires lourds ni réentraînement complet par domaine. Aucune timeline commerciale ni partenariat industriel n'est mentionné dans le preprint ; la prochaine étape naturelle serait une validation sur des plateformes AMR variées pour confirmer le transfert sim-to-real sur des morphologies autres que celles testées.

RecherchePaper
1 source
Planification de trajets robotiques adaptée à la congestion en environnements encombrés
2341arXiv cs.RO 

Planification de trajets robotiques adaptée à la congestion en environnements encombrés

Des chercheurs ont publié sur arXiv (réf. 2606.19031, juin 2026) un planificateur de tournées probabiliste pour robots mobiles autonomes (AMR) en espaces publics encombrés. Le système vise à guider un robot de service, qu'il soit guide en centre commercial, livreur en entrepôt de préparation de commandes ou médiateur muséal, à travers une séquence de points de passage en tenant compte du comportement stochastique des foules. L'approche repose sur des cartes CLiFF (Circular Linear Flow Field), des modèles statistiques appris qui prédisent les trajectoires piétonnes à partir d'une observation initiale. Ces prédictions alimentent un processus de décision markovien (MDP) résolu en ligne, autorisant un recalcul d'itinéraire à chaque nouvelle observation de passants. La validation s'appuie sur un jeu de données réel collecté dans un centre commercial. Le problème est concret et régulièrement sous-estimé dans les déploiements AMR : les manoeuvres d'évitement de collision déclenchées par la présence humaine dégradent les temps de cycle de manière non linéaire, particulièrement dans les espaces à densité variable selon l'heure de la journée. Traiter la foule comme un processus stochastique temporel plutôt que comme un simple bruit à filtrer représente un changement d'approche pertinent pour les intégrateurs opérant en logistique retail ou en accueil public. La contribution d'ingénierie centrale est la replanification en ligne sans recalcul global du MDP, ce qui conditionne l'utilisabilité réelle en environnement dynamique. A noter : les métriques de performance (gains de temps de cycle, taux de succès de tournée) ne sont pas quantifiées dans le résumé publié, et l'évaluation reste limitée à un seul site, ce qui limite la généralisation des conclusions. Les cartes CLiFF constituent un cadre existant de modélisation des flux piétons, ici couplé pour la première fois à un MDP online dans un contexte de planification multi-points de passage. La navigation sociale est un champ de recherche actif depuis une décennie, avec des approches concurrentes basées sur les modèles de force sociale, le protocole ORCA, ou des méthodes d'apprentissage profond sur trajectoires piétonnes (GNN, Transformer). Ce travail reste au stade de preprint académique, sans partenaire industriel ni déploiement commercial annoncé. La prochaine étape logique serait une validation multi-sites et une comparaison quantitative directe avec ces méthodes concurrentes, en particulier sur des géométries d'espaces plus complexes et des horizons temporels plus longs.

RecherchePaper
1 source
Alignement de surface par admittance pour l'inspection visuelle robotique supervisée par l'humain
2342arXiv cs.RO 

Alignement de surface par admittance pour l'inspection visuelle robotique supervisée par l'humain

Des chercheurs ont publié sur arXiv (référence 2606.18601) un pipeline de contrôle d'orientation en temps réel pour l'inspection visuelle robotique de précision, fondé sur un framework à admittance. Le système, validé sur un manipulateur à 6 degrés de liberté (DOF), combine les commandes d'un opérateur humain et l'alignement de surface piloté par perception. L'architecture modélise l'effecteur terminal comme une sphère virtuelle se déplaçant dans un milieu visqueux, produisant un système masse-amortisseur qui génère un mouvement conforme et synchronisé à partir des erreurs d'orientation et des entrées opérateur. La validation expérimentale atteint une erreur d'orientation finale moyenne de 0,4 degré en suivi de normale de surface, dans des conditions de bruit perceptuel et d'irrégularités géométriques. Ces résultats restent à ce stade des mesures de laboratoire, sans validation en environnement industriel réel documentée dans le papier. L'enjeu est concret pour les secteurs aérospatial, semi-conducteur et médical, où une anomalie de surface non détectée sur une pièce à haute valeur se traduit directement en rebut, retraitement ou défaillance terrain. Le problème central que ce travail adresse est architectural : la planification de trajectoire hors-ligne seule ne tient pas dès qu'un opérateur humain intervient en temps réel via télé-opération ou autonomie partagée, car les ajustements introduits rendent la trajectoire préplanifiée caduque. Le contrôleur proposé absorbe simultanément l'incertitude perceptuelle et les commandes humaines sans dégradation de la précision angulaire, ce qui représente une avancée sur les approches classiques qui traitent ces deux sources d'incertitude séparément. Le contrôle par admittance est un paradigme établi en robotique collaborative, où le robot cède aux forces extérieures de façon contrôlée plutôt que de les résister. Son application à l'inspection visuelle en boucle fermée avec opérateur dans la boucle reste un domaine de recherche actif, sans acteur dominant clairement identifié. Les approches concurrentes s'appuient généralement sur des capteurs de force/couple dédiés ou sur des corrections visuelles en open-loop. Aucun partenaire industriel ni pilote de déploiement n'est mentionné dans la publication, qui constitue une contribution académique orientée vers les intégrateurs systèmes cherchant une alternative aux pipelines d'inspection rigides. Les suites logiques seraient des essais sur surfaces gauches (non-développables) et la couplage avec des systèmes optiques haute résolution tels que profilomètres laser ou caméras de vision industrielle.

RecherchePaper
1 source
Jambe bioinspiré à haute mobilité pour robots miniatures
2343arXiv cs.RO 

Jambe bioinspiré à haute mobilité pour robots miniatures

Des chercheurs ont publié sur arXiv (référence 2606.18680, juin 2026) la conception d'un mécanisme de patte parallèle micro-échelle à quatre degrés de liberté (DoF), pesant seulement 18,9 grammes. Le système intègre deux liaisons sphériques à cinq barres combinées dans une configuration parallèle à quatre barres, permettant un mouvement spatial tridimensionnel. Une stratégie de conception concentrique a été adoptée pour simplifier la résolution analytique de la cinématique. L'effecteur terminal développe une force d'environ 0,5 N, avec un espace de travail dépassant 22 255 mm³. L'architecture parallèle choisie positionne tous les actionneurs sur le corps principal, ce qui réduit sensiblement l'inertie équivalente des parties mobiles par rapport aux structures de pattes haute-DoF classiques à actionneurs distaux. Ce travail s'attaque à un verrou bien identifié de la microrobotique : augmenter la mobilité d'une patte sans alourdir ni encombrer la structure, deux contraintes qui s'opposent directement dans les robots de moins de 50 grammes. Placer les actionneurs sur le corps central est une décision de conception non triviale qui améliore la réactivité dynamique et simplifie la gestion thermique, au prix d'une complexité de transmission plus élevée. La démonstration expérimentale d'une "excellente flexibilité de mouvement" reste à ce stade qualitative dans le papier, sans benchmarks comparatifs publiés face à d'autres mécanismes à DoF équivalent, ce qui limite l'évaluation objective des gains annoncés. La bio-inspiration par la locomotion des insectes est un axe de recherche actif depuis les travaux fondateurs sur le robot RHex (2001) et les hexapodes de type Weiss. Dans le segment des robots légers bio-inspirés sub-100g, ce mécanisme se positionne face à des approches concurrentes comme les pattes à câbles de l'ETH Zurich ou les structures en matériaux flexibles du Harvard Microrobotics Lab. Aucun prototype complet ni déploiement terrain n'est mentionné : il s'agit d'un mécanisme de patte unique, validé en laboratoire, dont l'intégration dans un robot mobile complet constitue la prochaine étape logique mais non encore annoncée.

RecherchePaper
1 source
Actionnement sélectif de cellules unitaires en treillis pour la morphologie distribuée des robots souples
2344arXiv cs.RO 

Actionnement sélectif de cellules unitaires en treillis pour la morphologie distribuée des robots souples

Des chercheurs présentent, dans un preprint déposé sur arXiv le 18 juin 2026 (réf. 2606.18704), une cellule unitaire pneumatique monolithique qui intègre simultanément une géométrie de treillis à montants courbés et un actionneur soufflet bidirectionnel au sein d'un unique élément fabriqué d'un seul tenant. Contrairement à l'approche dominante dans laquelle les actionneurs sont insérés après coup dans des structures en treillis passives, cette conception réalise ce que les auteurs appellent une co-conception actionneur-treillis à l'échelle de la cellule unitaire. Les expérimentations portent sur des pavages de 1x1, 2x2 et 3x3 cellules, qui démontrent une génération de déplacement et de force scalable avec des performances cycliques répétables. Un réseau 3x3x3 produit des modes de déformation globaux distincts -- flexion contrôlée, préhension directionnelle -- sans aucune modification physique de l'architecture matérielle : seul le schéma de pressurisation sélective des cellules change. L'équipe démontre également un déplacement rampant obtenu en couplant cellules actives et passives, la locomotion émergeant d'une déformation asymétrique. Ce résultat reformule le problème de contrôle de la morphologie en robotique souple : plutôt que de concevoir un effecteur par comportement cible, un même substrat matériel peut générer des comportements multiples via la programmation du champ d'actuation spatial. Pour les intégrateurs industriels et les concepteurs d'effecteurs adaptatifs, cela signifie qu'une pièce monolithique pourrait remplacer plusieurs modules distincts, réduisant les points de défaillance et la complexité d'assemblage. La reproductibilité cyclique observée est un signal positif pour une éventuelle industrialisation, même si les auteurs restent dans un cadre de caractérisation laboratoire -- aucune donnée de durée de vie à grande échelle ni de comparaison charge utile/force en conditions réelles n'est fournie. La robotique souple sur structures en treillis s'est développée principalement pour adapter la compliance locale et guider la déformation dans des applications médicales, de manipulation douce ou d'exploration en environnements non structurés. Les approches concurrentes incluent les robots à câbles, les alliages à mémoire de forme, les actionneurs diélectriques élastomères (DEA) et les structures pneumatiques modulaires type PneuNet -- chacune avec ses compromis sur la vitesse, la force et la scalabilité. Ce travail positionne les treillis pneumatiques monolithiques comme une quatrième voie, avec l'avantage d'une fabrication continue. Aucune entreprise ni partenaire industriel n'est mentionné ; les prochaines étapes suggérées par les auteurs incluent le passage à des réseaux plus grands et l'exploration d'algorithmes de planification du champ d'actuation pour des tâches de manipulation complexes.

RecherchePaper
1 source
SRL : modèle SLIP et apprentissage par renforcement pour des sauts robotiques agiles
2345arXiv cs.RO 

SRL : modèle SLIP et apprentissage par renforcement pour des sauts robotiques agiles

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.18625) un framework hybride baptisé SRL (Spring-loaded Reinforcement Learning), conçu pour améliorer la capacité de saut des robots mobiles sur terrains variés. L'approche fusionne les signaux de contrôle feedforward issus du modèle SLIP (Spring-Loaded Inverted Pendulum, pendule à masse-ressort inversé) avec une boucle de rétroaction en temps réel pilotée par apprentissage par renforcement. Les résultats expérimentaux, obtenus en simulation sur robots bipèdes et quadrupèdes, font état d'une erreur de suivi de position inférieure à 0,1 m et d'une erreur de suivi de vitesse contenue dans un intervalle de ±3 % par rapport aux valeurs cibles. Les auteurs annoncent également une réduction significative du temps d'entraînement par rapport à la méthode RL pure utilisée comme baseline. Des validations sim-to-sim et sim-to-real sont présentées sur des scénarios de saut au sol et en escalier. L'intérêt industriel du saut robotique est réel dans les domaines de la logistique entrepôt et de la recherche et sauvetage, où franchir des obstacles sans infrastructure dédiée représente un avantage opérationnel concret. Le verrou que SRL cherche à lever est connu : le modèle SLIP fournit une dynamique physiquement cohérente mais se dégrade sur terrain irrégulier, faute de modéliser correctement les contacts et la compliance articulaire ; l'RL seul compense cette limitation mais au prix d'une exploration non guidée et coûteuse en données. La combinaison des deux réduit ce coût d'exploration tout en conservant la robustesse adaptative. Il convient toutefois de noter que l'article est une prépublication non encore évaluée par les pairs, et que les métriques de performance sont issues de simulations, la validation sim-to-real reposant sur des environnements de test dont l'amplitude n'est pas précisée dans le résumé. Le modèle SLIP est un outil analytique classique en biomécanique locomotrice, largement exploité depuis les travaux de Raibert des années 1980 pour modéliser la course et le saut des mammifères. Côté concurrents, Boston Dynamics (Spot, Atlas), Unitree Robotics (Go2, H1) et Agility Robotics (Digit) développent des capacités de franchissement d'obstacles, mais leurs approches combinent généralement MPC (Model Predictive Control) et apprentissage sans revendiquer explicitement l'intégration SLIP-RL. SRL se positionne donc sur un créneau de recherche fondamentale qui devra encore démontrer sa transposabilité à des plateformes hardware commerciales avant d'intéresser des intégrateurs industriels.

RecherchePaper
1 source
Alibaba et ByteDance redoublent d'efforts sur l'IA incarnée : l'apport des géants d'internet à la robotique
2346Pandaily 

Alibaba et ByteDance redoublent d'efforts sur l'IA incarnée : l'apport des géants d'internet à la robotique

Le 16 juin 2026, Alibaba a lancé Qwen-Robot, sa première famille complète de modèles d'IA incarnée intégrée à la série Qwen. Elle regroupe trois composants distincts : Qwen-RobotManip pour la manipulation physique, Qwen-RobotNav pour la navigation autonome, et Qwen-RobotWorld comme modèle de monde, c'est-à-dire un moteur de raisonnement contextuel sur l'environnement physique. Ces modules peuvent être déployés séparément ou en coordination, selon le type de robot ciblé. Le positionnement d'Alibaba est explicitement logiciel : l'entreprise ne vise pas à construire des corps robotiques, mais à fournir le "cerveau intelligent" à des fabricants tiers. Simultanément, ByteDance a réorganisé ses efforts en robotique incarnée en élevant Seed Robotics au rang de division stratégique principale, désormais sous la supervision de Zhou Chang, responsable multi-modal du groupe. ByteDance a déjà produit plus de 1 000 robots, majoritairement des robots mobiles à roues pour la logistique en entrepôt et en usine, et compte parmi ses clients externes SF Express et BYD Electronics. Ce double mouvement illustre un changement structurel dans la course aux humanoïdes et à la robotique généraliste : les géants de l'internet entrent dans le secteur non par la mécanique, mais par la donnée et l'intelligence. La valeur qu'ils apportent repose sur trois piliers. D'abord, leurs grands modèles de langage compressent le temps d'adaptation à de nouvelles tâches : là où un ingénieur robotique traditionnel passerait plusieurs semaines à reprogrammer un bras ou un AGV pour un nouveau scénario, une approche VLA (vision-language-action) peut réduire cette itération à quelques jours. Ensuite, leur infrastructure opérationnelle génère des données d'entraînement à une échelle inaccessible aux startups : le réseau de livraison instantanée de Meituan, les entrepôts de JD Logistics, les chaînes d'approvisionnement e-commerce de ByteDance accumulent chaque jour des millions d'interactions physiques réelles. Enfin, et c'est peut-être le facteur le plus sous-estimé, ces entreprises sont leurs propres premiers clients. JD a validé ses robots logistiques dans ses propres entrepôts "Asia No.1" avant de les commercialiser. ByteDance fait circuler ses AMR sur de vraies routes opérationnelles avant de les vendre. Ce raccourci entre laboratoire et déploiement à l'échelle est ce qui manque le plus aux startups hardware-first. Pour autant, les analystes du secteur rappellent que l'avantage logiciel ne dissout pas les contraintes physiques. Les composants critiques comme les actionneurs, les capteurs de force ou les joints à haute précision restent des goulots d'étranglement de supply chain qui ne s'effacent pas parce qu'un géant tech entre dans la pièce. Alibaba et ByteDance font face à une concurrence à deux niveaux : d'un côté les acteurs hardware-first américains comme Figure AI, 1X, Boston Dynamics ou Agility Robotics qui avancent en parallèle sur la couche IA ; de l'autre les constructeurs chinois comme Unitree ou Fourier Intelligence qui maîtrisent déjà la chaîne de fabrication. La prochaine étape pour évaluer ces annonces sera de mesurer si les modèles Qwen-Robot passent l'épreuve du déploiement industriel répété en dehors des environnements contrôlés d'Alibaba, ce qui reste à ce stade une démonstration en cours, pas un produit livré.

Chine/AsieOpinion
1 source
L'Europe développe un bras robotique capable de voir, toucher et manipuler des échantillons pour les missions lunaires
2347Interesting Engineering 

L'Europe développe un bras robotique capable de voir, toucher et manipuler des échantillons pour les missions lunaires

L'Agence spatiale européenne (ESA) et l'entreprise aérospatiale italienne Leonardo finalisent l'intégration du Sample Transfer Arm (STA), un bras robotique de 2,4 mètres d'extension doté de sept degrés de liberté, actuellement assemblé dans les installations de Leonardo à Nerviano, près de Milan. Conçu à l'origine pour le programme Mars Sample Return conjoint NASA-ESA, le STA devait transférer les échantillons martiens collectés par le rover Perseverance en vue de leur retour sur Terre. L'avenir incertain de cette mission a conduit l'ESA à repositionner la technologie vers des applications lunaires et d'exploration plus larges. Le bras embarque des caméras, des capteurs de force et de couple en trois dimensions, des codeurs de position dans chaque articulation, et une unité électronique autonome faisant office de centre de contrôle. Sa pince en bout de bras offre une précision au millimètre. Les équipes entrent maintenant dans la phase de tests en environnement spatial simulé, prévue dans les prochaines semaines. Ce bras illustre concrètement la montée en maturité des systèmes robotiques à perception multimodale pour l'espace : la combinaison vision embarquée, retour haptique (capteur force-couple 6 axes) et contrôle de position en boucle fermée permet une manipulation semi-autonome sans intervention humaine en temps réel, ce qui est critique pour des missions où la latence de communication rend le télé-opérage direct impraticable. Pour les décideurs du secteur spatial institutionnel, le STA représente un démonstrateur crédible d'un bras polyvalent qui pourrait supporter aussi bien la collecte d'échantillons géologiques que l'assistance aux astronautes lors de séjours prolongés sur la Lune. La question du passage du laboratoire à un déploiement opérationnel reste ouverte : aucune mission concrète avec timeline précise n'est annoncée à ce stade, et les tests en cours à Nerviano devront valider les performances avant toute intégration sur un engin spatial réel. Le STA s'inscrit dans une dynamique européenne de consolidation des compétences robotiques spatiales face à une concurrence américaine (NASA, JPL) et émergente (Chine, CNSA). Le consortium industriel qui porte le projet reflète la géographie habituelle de l'industrie spatiale européenne : Leonardo en chef de file, GMV et AVS (Espagne) pour les logiciels et systèmes, Maxon (Suisse) pour les actionneurs de précision, 3DPlus (France) pour l'électronique résistante aux radiations, et COMOTI (Roumanie), avec des fournisseurs danois, grecs et allemands. La présence de 3DPlus, spécialiste français des composants électroniques durcis pour l'espace, mérite d'être notée dans ce contexte de souveraineté technologique. La prochaine étape critique sera la validation en conditions simulées de lancement et d'atterrissage, les mécanismes structurels du bras devant absorber les charges dynamiques sans dégrader la précision de positionnement acquise au sol.

FR/EU ecosystemeOpinion
1 source
Construction et test d'un actionneur robotique DIY
2348Hackaday Robots Hacks 

Construction et test d'un actionneur robotique DIY

Brandon Lai, maker indépendant, a publié les résultats de sa deuxième version d'actionneur rotatif, conçu pour son projet personnel de robot humanoïde. Les spécifications visées : 40 à 60 tr/min pour un couple de 20 Nm en sortie, avec une heure de fonctionnement continu. La conception s'inspire d'un article de recherche du MIT, avec une substitution structurelle majeure : réducteur cycloïdal en lieu et place du planétaire d'origine, dans l'espoir d'une meilleure densité de couple et d'un jeu mécanique réduit (backlash). Le moteur repose sur un stator bobiné à la main autour d'un noyau standard du commerce, complété par des pièces usinées CNC et des composants imprimés en 3D pour le carter. Les tests ont mis en évidence deux limitations concrètes : seulement 7 Nm de couple en sortie, bridé par la source d'alimentation de laboratoire incapable de fournir le courant nécessaire, et un backlash excessif dans le réducteur cycloïdal, attribué à des tolérances de fabrication insuffisantes. Coût total : 400 dollars, largement au-dessus du budget initial. L'écart de facteur 3 entre le couple mesuré et l'objectif illustre une tension bien connue des développeurs d'actionneurs : les performances annoncées sur papier dépendent autant de la chaîne d'alimentation que de la mécanique elle-même. Plus significatif pour la communauté robotique, le réducteur cycloïdal, réputé supérieur au planétaire pour la réduction du backlash, a produit l'effet inverse ici, rappelant que le choix d'architecture ne remplace pas la précision de fabrication. Pour les intégrateurs et ingénieurs en robotique, ce retour d'expérience chiffré, avec tolérances insuffisantes et dépassement budgétaire inclus, a plus de valeur informative que les vidéos de démonstration sélectionnées habituellement diffusées par les équipes commerciales. Lai prévoit une prochaine révision pour corriger ces points, et les fichiers CAD sont accessibles publiquement. Ce projet illustre la difficulté de répliquer en amateur des actionneurs que des acteurs comme Figure AI (Figure 02 et 03), Agility Robotics (Digit) ou 1X Technologies développent avec des équipes spécialisées et des budgets de plusieurs dizaines de millions de dollars. La publication ouverte de données techniques incluant les itérations ratées reste une contribution utile à l'écosystème DIY humanoïde, même si les performances actuelles restent très loin des seuils nécessaires à une application industrielle réelle.

HumanoïdesTuto
1 source
Les robots humanoïdes à l'épreuve des tâches de finition de surface
2349Robotics Business Review 

Les robots humanoïdes à l'épreuve des tâches de finition de surface

Dans les applications de traitement de surface, qu'il s'agisse de ponçage, polissage, sablage, meulage, revêtement ou peinture, les conditions de travail sont parmi les plus pénibles de l'industrie manufacturière : exposition aux poussières, vibrations prolongées, postures contraignantes. Depuis l'essor des robots humanoïdes, la question revient régulièrement dans les cercles industriels : ces plateformes bipèdes à mains articulées pourraient-elles automatiser le traitement de grandes pièces, là où un bras fixe ne suffit pas à couvrir toute la surface ? L'analyse systématique des composants d'un humanoïde face aux exigences réelles de ces procédés aboutit à une réponse sans ambiguïté : non. Les jambes, peu efficaces sur les sols plats d'usine et incompatibles avec un câblage nécessaire pour alimenter les outils de process, n'apportent aucune valeur par rapport à des rails au sol ou à une base mobile dédiée. Les mains multi-doigts, coûteuses et conçues pour la manipulation d'objets, offrent une prise insuffisante pour tenir un disque de meulage à haute vitesse : un connecteur direct outil-bras est plus robuste et moins onéreux. Les caméras intégrées dans la tête d'un humanoïde sont trop rapprochées pour une couverture de scène efficace ; des capteurs positionnés dans la cellule ou au plus près de l'outil sont systématiquement plus performants. Seuls les bras doubles présentent un intérêt réel, mais leur espacement optimal sur une grande pièce est fondamentalement différent de la morphologie humanoïde. L'argument économique souvent avancé pour justifier l'humanoïde, celui des économies d'échelle, ne résiste pas à l'examen. Une cellule de traitement de surface bien conçue repose sur des bras industriels polyvalents, des rails, des caméras et des capteurs d'effort, soit des composants déjà produits en grandes séries et bénéficiant pleinement des effets de volume. L'humanoïde n'est pas nécessaire pour accéder à ces économies. Plus fondamentalement, les robots industriels actuels opèrent à des vitesses quatre à cinq fois supérieures aux capacités humaines, avec des forces d'application significativement plus élevées, et leur fiabilité dans des environnements abrasifs et contraignants est éprouvée depuis des décennies. Dans une logique de réduction des temps de cycle et d'amélioration du débit, le robot industriel configuré dans la bonne géométrie spatiale reste la solution dominante, et l'analyse ne relève aucun avantage compensatoire de la morphologie humanoïde dans ces cas d'usage précis. Cette conclusion intervient dans un contexte de forte pression médiatique autour des humanoïdes : Figure, Tesla Optimus, Agility Robotics, Boston Dynamics Atlas ou encore 1X accumulent les démonstrateurs et les levées de fonds, avec le narratif que la forme humaine permettrait de déployer des robots dans n'importe quel environnement conçu pour l'humain, y compris l'usine. Les acteurs traditionnels du robot industriel, FANUC, KUKA, ABB ou Universal Robots, répondent implicitement avec des configurations duales sur base mobile sans prétention bipède. Le vrai terrain de jeu des humanoïdes reste les environnements non structurés, la logistique de dernière rangée ou les tâches générales en entrepôt, là où la polyvalence morphologique compense le déficit de performance brute. Pour les process de surface en milieu manufacturier, le débat semble tranché en faveur des solutions spécialisées, un verdict que les pilotes industriels des prochaines années auront la charge de confirmer ou d'infirmer à l'échelle.

IndustrielOpinion
1 source
Alibaba dévoile des cerveaux IA conçus pour équiper la prochaine génération de robots
2350Interesting Engineering 

Alibaba dévoile des cerveaux IA conçus pour équiper la prochaine génération de robots

Alibaba a annoncé en juin 2026 le lancement de la suite Qwen-Robot, sa première famille de modèles d'IA dite "embodied", développée par son Tongyi Lab et actuellement en phase de pilote avec des clients entreprise d'Alibaba Cloud. La suite repose sur trois modèles spécialisés : Qwen-RobotNav pour la navigation et le suivi de cibles, Qwen-RobotManip pour la manipulation d'objets physiques, et Qwen-RobotWorld pour la modélisation de l'environnement et la prédiction des conséquences d'actions. Le groupe a également publié Qwen-RobotClaw, un framework d'agents qui expose les modèles Qwen-Robot comme outils accessibles à des agents LLM, ainsi que Chat2Robot, une plateforme open-source en navigateur pour tester des interactions avec des robots physiques. Sur le plan des performances déclarées, Qwen-RobotManip a été entraîné sur plus de 38 000 heures de données open-source et a obtenu sur le benchmark RoboChallenge un process score de 59,83 avec un taux de succès de tâches de 45 % dans la catégorie "généraliste". La démonstration de navigation a mis en scène un quadrupède Unitree Go2 équipé d'un NVIDIA Jetson Thor et d'une seule caméra basse résolution, atteignant une latence d'inférence de 196 millisecondes dans un appartement inconnu, sans carte préchargée. Ces résultats méritent d'être lus avec prudence : un taux de succès de 45 % sur un benchmark réel, s'il est confirmé en conditions non contrôlées, reste modeste mais significatif pour un modèle généraliste. Le vrai signal industriel n'est pas le score brut, c'est l'approche architecturale : au lieu de fusionner indifféremment données de navigation, bras robotiques, caméras et véhicules autonomes, Alibaba a opté pour une spécialisation par modalité, évitant les conflits d'apprentissage que génère le mélange hétérogène de données physiques. Pour les intégrateurs et décideurs B2B, la disponibilité via Alibaba Cloud en pilote marque un premier pas vers la commercialisation d'une couche d'IA robotique as-a-service, potentiellement utilisable sur du matériel tiers sans pipeline de training propriétaire. Alibaba entre dans une course déjà engagée par plusieurs acteurs de premier plan. Aux États-Unis, Google DeepMind fait avancer Gemini Robotics sur des architectures Vision-Language-Action (VLA) similaires, tandis que Physical Intelligence (Pi-0), Figure AI (Figure 03) et Boston Dynamics misent sur des pipelines de données propriétaires et des déploiements industriels réels. NVIDIA pousse son framework GR00T N2 comme socle hardware-logiciel pour l'humanoid. Côté chinois, Unitree et Agibot ont déjà des robots en production, mais sans la couche LLM intégrée qu'Alibaba apporte. L'open-sourcing de Chat2Robot et les pilotes cloud suggèrent une stratégie d'écosystème : capter les développeurs et intégrateurs autour des modèles Qwen-Robot avant que le marché des robots généraux ne se consolide, probablement d'ici 2027-2028 selon les timelines annoncées par les principaux concurrents.

IA physiqueOpinion
1 source