Aller au contenu principal

Actualités robotique — page 46

4 740 articles au fil, du plus récent au plus ancien.

Estimation d'état proprioceptive invariante pour robots humanoïdes sur sol non inertiel
2251arXiv cs.RO 

Estimation d'état proprioceptive invariante pour robots humanoïdes sur sol non inertiel

Des chercheurs proposent sur arXiv (2606.19512) un filtre de Kalman étendu invariant (InEKF) pour estimer en temps réel l'état d'un robot humanoïde se déplaçant sur un sol en mouvement, sans aucun capteur externe. L'approche exploite uniquement les IMU montées aux pieds et la cinématique du robot pour estimer la position et la vitesse de la base dans le référentiel d'un sol non-inertiel, qu'il tangue, oscille ou pivote. Testée sur le robot Digit d'Agility Robotics en station debout avec tangage et oscillation latérale, puis en marche sur un sol en rotation uni-axiale, la méthode affiche une accélération de 96 % du taux de convergence et une réduction de 80 % des erreurs de position face aux InEKF classiques. En déplacement, l'erreur moyenne reste inférieure à 9 cm pour une erreur initiale pouvant atteindre 1 mètre. L'intérêt est immédiat pour tout déploiement hors sol fixe : bateaux, véhicules logistiques, quais portuaires, plateformes vibrantes d'usine. Reposer entièrement sur la proprioception embarquée supprime la dépendance aux systèmes de localisation externe (LIDAR, caméras, motion capture) souvent absents ou peu fiables dans ces contextes. L'analyse formelle d'observabilité démontre les conditions sous lesquelles position et vitesse relatives demeurent estimables malgré l'accélération du sol, ce qui dépasse le simple résultat empirique. Les expériences ont été conduites en conditions physiques réelles plutôt qu'en simulation seule, ce qui renforce la validité des métriques, même si les scénarios restent relativement contrôlés (mono-axial, uni-directionnel). Digit est développé par Agility Robotics, spin-off de l'Oregon State University rachetée par Amazon, qui déploie l'humanoïde dans des entrepôts logistiques. La méthode InEKF pour humanoïdes s'inscrit dans un corpus académique centré sur les groupes de Lie appliqués à l'estimation en robotique de terrain. Dans la course commerciale, Tesla (Optimus), Figure (Figure 03), Boston Dynamics (Atlas) et Unitree (H1, G1) investissent massivement dans la locomotion en milieux variés, mais le sol non-inertiel demeure un angle mort des pipelines de contrôle actuels. Ce preprint est vraisemblablement soumis à IROS 2026 ou ICRA 2027 et ne représente pas encore une capacité déployée en production.

RecherchePaper
1 source
Apporte ma tasse ! Personnalisation des modèles vision-langage-action par prompting visuel attentionnel
2252arXiv cs.RO 

Apporte ma tasse ! Personnalisation des modèles vision-langage-action par prompting visuel attentionnel

Des chercheurs ont publié en décembre 2024 (arXiv:2512.20014) une méthode appelée Visual Attentive Prompting (VAP), conçue pour permettre aux modèles Vision-Language-Action (VLA) de répondre à des consignes personnalisées du type "apporte ma tasse". Le problème adressé est précis : un VLA classique, même performant sur des instructions génériques, échoue à identifier un objet spécifique parmi plusieurs visuellement identiques sans avoir été entraîné sur cet objet. VAP fonctionne sans ré-entraînement (training-free), c'est son argument central. Il prend quelques images de référence de l'objet cible, effectue une détection en vocabulaire ouvert dans la scène, compare les embeddings visuels pour localiser l'instance correcte, puis injecte cette localisation directement dans le flux d'entrée du VLA : surlignage de l'objet et réécriture de l'instruction. Les auteurs ont construit deux benchmarks en simulation (Personalized-SIMPLER et Personalized-VLABench) et un benchmark réel sur table pour valider l'approche sur plusieurs robots et tâches. VAP surpasse les politiques génériques et les baselines par apprentissage de tokens, à la fois en taux de succès global et en taux de manipulation du bon objet. L'enjeu industriel derrière ce travail est la personnalisation au niveau de l'instance, un verrou jusqu'ici sous-traité dans la recherche VLA. Pour un intégrateur ou un COO déployant des robots en environnement résidentiel ou hospitalier, la capacité à distinguer "la tasse de Paul" de "la tasse de Marie" sans pipeline d'apprentissage dédié par utilisateur représente un gain opérationnel significatif. VAP démontre que l'attention sélective top-down, couplée à une mémoire visuelle non-paramétrique, peut combler l'écart entre compréhension sémantique et contrôle au niveau de l'instance, un problème que les approches fondées sur le langage seul ne résolvent pas. L'absence de ré-entraînement est un avantage de déploiement réel, même si les benchmarks restent à l'échelle tabletop, loin de la chaîne logistique. Ce travail s'inscrit dans la dynamique post-RT-2 et post-OpenVLA : les VLA généralistes (π0 de Physical Intelligence, GR00T N2 de NVIDIA, ou encore les approches Octo et RoboFlamingo) excellent sur des distributions larges mais restent aveugles à la sémantique d'instance. VAP propose une surcouche légère compatible avec n'importe quel VLA gelé, ce qui le positionne comme un adaptateur potentiel pour des systèmes existants plutôt qu'un modèle concurrent. Les prochaines étapes naturelles incluent des tests hors tabletop (manipulation mobile, environnements encombrés), l'évaluation à plus grande échelle d'objets personnels, et l'intégration dans des frameworks open-source comme LeRobot d'Hugging Face. Aucun partenariat industriel ni timeline de commercialisation n'est mentionné dans la publication.

IA physiqueOpinion
1 source
Coordination par dépliage profond
2253arXiv cs.RO 

Coordination par dépliage profond

Des chercheurs ont présenté Deep Coordinator, un framework de deep-unfolding (arXiv:2606.19920) qui automatise le réglage des hyperparamètres d'ADMM-DDP, un solveur distribué populaire pour la planification de trajectoires multi-robots. L'architecture déroule un nombre fixe d'itérations de l'algorithme en couches d'un réseau de neurones, des fonctions apprenables calculant dynamiquement les hyperparamètres suivants à partir de l'état courant de l'optimiseur. Sur des simulations de flottes de voitures et de quadrotors, Deep Coordinator produit des trajectoires de qualité équivalente entre 6,18 et 9,44 fois plus vite que les solveurs conventionnels, et maintient ces gains sur des flottes jusqu'à 8 fois plus grandes que celles vues à l'entraînement. L'intérêt industriel est direct : l'optimisation distribuée est scalable et structurellement transparente, mais son calibrage fin par configuration freine systématiquement l'adoption. Deep Coordinator serait le premier framework de deep-unfolding à adapter les paramètres de pénalité d'un optimiseur non-convexe en temps-solve. Les auteurs signalent en outre que l'approche supervisée classique produit des solutions dégénérées dans ce contexte, et proposent un schéma d'apprentissage non supervisé. Pour les opérateurs de flottes denses (entrepôts, inspection par drone), une accélération d'un facteur 6 à 9 sur la planification collaborative ouvre la voie à des déploiements temps réel difficiles à atteindre avec les solveurs actuels. Le deep-unfolding hybride structure algorithmique classique et apprentissage profond en mappant les itérations d'un solveur en couches de réseau de neurones. ADMM est un standard de l'optimisation distribuée depuis Boyd et al. (2011), très utilisé pour la coordination multi-robot. Les concurrents directs incluent le Multi-Agent Reinforcement Learning (MARL) et le MPC centralisé, dont les limites de scalabilité ou de généralisation sont documentées. La bonne généralisation à des systèmes 8x plus grands est prometteuse, mais les résultats restent simulés ; une validation sur hardware réel, notamment en environnements dynamiques, sera l'étape déterminante pour confirmer la valeur opérationnelle du framework.

RecherchePaper
1 source
Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences
2254arXiv cs.RO 

Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences

Une équipe de recherche propose FAFM (Frequency-Aware Flow Matching), une méthode de génération d'actions robotiques présentée en préprint arXiv (2606.20135, juin 2026), qui reformule le problème du flow matching pour la manipulation robotique dans le domaine fréquentiel. Le principe : plutôt que de prédire directement des séquences d'actions discrètes (des "chunks"), FAFM applique une transformée en cosinus discrète (DCT) sur ces séquences pour les convertir en coefficients fréquentiels, effectue le flow matching sur ces coefficients, puis reconstruit des actions continues via expansion en base cosinus. Pour garantir la cohérence temporelle, la méthode ajoute une contrainte de type Sobolev sur la dérivée temporelle du premier ordre, ce qui pénalise les changements brusques et atténue les erreurs hautes fréquences. L'approche s'applique sans paramètres réseau supplémentaires, aussi bien aux politiques de flow matching autonomes qu'aux modèles vision-langage-action (VLA). Les résultats sont validés sur les benchmarks LapGym, LIBERO et évitement d'obstacles, ainsi qu'en déploiement réel sur un bras Franka. L'intérêt industriel est direct : la fragmentation des fréquences de contrôle est un problème concret lors de l'agrégation de données de démonstration provenant de robots différents (certains à 10 Hz, d'autres à 50 Hz), et les méthodes actuelles de diffusion policy ou de flow matching standard y sont explicitement vulnérables. Les actions temporellement incohérentes qui en résultent dégradent la stabilité du contrôle en boucle fermée, un facteur bloquant pour le déploiement en production. Le fait que FAFM améliore simultanément le taux de succès, la fluidité du mouvement, la robustesse aux biais mécaniques et la vitesse de convergence sans modifier l'architecture existante est une proposition de valeur claire pour les intégrateurs : pas de refonte du pipeline, pas de surcoût computationnel. La compatibilité avec les VLA est également notable, car ces modèles dominent les annonces récentes (pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) et souffrent précisément de ce type d'artefacts temporels à l'inférence. Le flow matching s'est imposé ces dix-huit derniers mois comme alternative crédible à la diffusion policy (Chi et al., 2023, Columbia), avec des temps d'inférence plus courts et une meilleure expressivité multimodale. Les travaux récents de Physical Intelligence (pi-0, pi-0.5) et de Figure AI ont largement adopté ce paradigme pour leurs politiques générales. FAFM s'inscrit dans une tendance de raffinement de ces fondations plutôt que de rupture : on optimise la stabilité et la généralisation inter-fréquences, deux verrous identifiés lors des premiers déploiements industriels à grande échelle. La validation sur Franka reste modeste en termes de diversité de tâches, et le code est disponible sous revue anonyme, ce qui signifie que la méthode n'est pas encore auditée par la communauté. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes multi-articulées et sur des datasets hétérogènes à grande échelle, là où la question des fréquences mixtes est la plus aiguë.

RecherchePaper
1 source
Une démonstration vaut mille trajectoires : augmentation vue-action pour les politiques visuomotrices
2255arXiv cs.RO 

Une démonstration vaut mille trajectoires : augmentation vue-action pour les politiques visuomotrices

Une équipe de chercheurs a publié en juin 2026 (arXiv:2606.19586) un cadre d'augmentation de données baptisé Action-View Augmentation, conçu pour améliorer la robustesse des politiques visuomotrices dans les tâches de manipulation robotique. Le système repose sur un préhenseur parallèle portable équipé d'une unique caméra fisheye montée en configuration eye-in-hand, capable de capturer des démonstrations réelles en milieu non contrôlé. À partir d'une seule démonstration humaine, le framework génère automatiquement des séquences d'images fisheye visuellement réalistes ainsi que des trajectoires d'actions physiquement cohérentes. Pour reconstruire et éditer la scène 3D en y introduisant des objets inédits, les auteurs ont développé une nouvelle formulation de Gaussian Splatting adaptée aux champs de vision larges des optiques fisheye. Une optimisation de trajectoire produit ensuite des chemins fluides, sans collision et compatibles avec le rendu de nouvelles vues caméra. Les expériences menées en simulation et en environnement réel montrent une amélioration du taux de succès sur plusieurs tâches de manipulation, aussi bien dans des scènes identiques qu'en présence d'obstacles requérant un évitement de collision. L'enjeu central est la fragilité des politiques visuomotrices actuelles face aux observations hors-distribution : une légère variation de configuration initiale ou un obstacle imprévu suffit à provoquer un échec d'exécution catastrophique. Collecter suffisamment de données pour couvrir ces variations est coûteux et chronophage, ce qui constitue l'un des principaux freins à l'industrialisation de la manipulation robotique. Le titre du papier résume l'ambition : multiplier artificiellement la valeur d'une seule démonstration réelle pour entraîner des politiques plus robustes. L'adaptation du Gaussian Splatting aux optiques fisheye, jusqu'ici peu traitée dans la littérature robotique, élargit le champ d'application à des setups matériels légers et peu coûteux. Ce type d'approche répond directement au problème du sim-to-real gap en générant des données synthétiques ancrées dans une scène réelle reconstruite, plutôt qu'en simulateurs déconnectés du terrain. Ce travail s'inscrit dans la dynamique des politiques de manipulation end-to-end, où des systèmes comme pi-0 de Physical Intelligence ou les architectures à diffusion (Diffusion Policy, ACT) ont prouvé que l'imitation de démonstrations humaines peut générer des comportements complexes, mais restent gourmands en données. Le Gaussian Splatting, popularisé à partir de 2023, s'est progressivement imposé en robotique grâce à sa capacité à synthétiser des vues nouvelles de haute qualité à partir de captures réelles. L'approche eye-in-hand à caméra fisheye se distingue des setups multi-capteurs fixes, réduisant le matériel embarqué à un seul composant. Aucun déploiement industriel n'est annoncé à ce stade : il s'agit exclusivement d'un résultat académique, sans partenariat industriel déclaré ni timeline commerciale. Les prochaines étapes naturelles concerneraient l'évaluation à plus grande échelle et l'intégration dans des pipelines de fine-tuning pour des politiques de type VLA (Vision-Language-Action).

RecherchePaper
1 source
ImageWAM : les modèles action-monde ont-ils vraiment besoin de génération vidéo, ou seulement d'édition d'images ?
2256arXiv cs.RO 

ImageWAM : les modèles action-monde ont-ils vraiment besoin de génération vidéo, ou seulement d'édition d'images ?

Une équipe de chercheurs publie ImageWAM sur arXiv le 19 juin 2026 (arXiv:2606.19531), un cadre WAM (World Action Model) qui substitue la génération vidéo par l'édition d'images pour prédire les actions robotiques. L'argument central : les WAMs vidéo génèrent des tokens denses sur plusieurs trames futures, consomment de la capacité sur des détails sans rapport avec l'action, et propagent des erreurs lors des prédictions à longue portée. ImageWAM réoriente des modèles d'édition d'image préentraînés pour modéliser uniquement la transformation visuelle entre état courant et état cible. À l'inférence, le système ne décode pas la frame cible : il conditionne un expert d'action par flow-matching sur les caches KV produits pendant le débruitage de l'image éditée. Résultats mesurés : FLOPs réduits à 1/6 et latence à 1/4 par rapport aux WAMs vidéo, avec des performances supérieures aux baselines VLA standard et aux WAMs concurrents, sur simulateur comme en conditions réelles, sans préentraînement additionnel de la politique. Pour la communauté robotique, le résultat questionne une hypothèse fondamentale : la génération vidéo serait indispensable pour que le modèle "comprenne" le monde et déduise des actions pertinentes. ImageWAM montre que l'édition d'image constitue un prior mieux calibré, car elle cible les différences visuelles liées à l'action plutôt que la reconstruction temporelle complète d'une séquence. Les analyses d'attention confirment que les caches se focalisent sur les régions de changement pertinentes pour la tâche, pas sur le fond statique. Pour un intégrateur industriel, l'implication est directe : cycles d'inférence plus rapides et potentiellement matériel embarqué moins coûteux, sans sacrifice de performance selon les expériences rapportées. Les WAMs s'inscrivent dans la continuité des VLAs (Visual Language Action models), qui combinent perception visuelle, langage naturel et contrôle moteur dans un pipeline unifié. Des modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent sur des représentations visuelles denses pour généraliser les comportements robotiques entre tâches. ImageWAM se positionne comme une alternative frugale, réutilisant des capacités d'édition d'image préentraînées sans nécessiter de préentraînement vidéo de grande échelle. Le papier reste pour l'instant dans le domaine expérimental : aucun déploiement industriel ni partenaire terrain n'est mentionné. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes ou de manipulation industrielle, précisément les environnements où la latence d'inférence constitue un critère de qualification déterminant.

RechercheOpinion
1 source
VFILC : extrapolations de fréquence précises en apprentissage par imitation via ILC à fréquence d'échantillonnage
2257arXiv cs.RO 

VFILC : extrapolations de fréquence précises en apprentissage par imitation via ILC à fréquence d'échantillonnage

Des chercheurs présentent dans un preprint arXiv (2606.20056) VFILC, une méthode d'apprentissage par imitation pour robots qui résout le problème de l'extrapolation en fréquence de mouvement. Les approches classiques à base de réseaux de neurones pour les mouvements à vitesse variable se limitaient à interpoler dans la plage d'entraînement ou produisaient des trajectoires imprévisibles au-delà. VFILC combine VFIL (Variable-Frequency Imitation Learning), qui couple la fréquence d'échantillonnage du modèle à la fréquence de mouvement souhaitée, avec une commande par apprentissage itératif (ILC) dotée d'un terme feedforward et d'un terme feedback correcteur. Sur trois tâches de manipulation, les résultats montrent une réduction des erreurs de fréquence de 81 % sur une tâche d'essuyage et de 50 % sur une tâche de secouage, comparé à VFIL seul, lorsque le robot opère au double de la vitesse moyenne présente dans les données d'entraînement. Sur une tâche de malaxage riche en contacts, où la friction complexe perturbe le mouvement même en régime interpolé, VFILC améliore la précision de 27 % par rapport à VFIL seul. L'enjeu est la programmabilité par démonstration à des allures variables, cas courant en robotique manufacturière : adapter la cadence d'une tâche apprise sans recollecter de nouvelles démonstrations. Le fait que le composant ILC feedback corrige les erreurs de fréquence sans déstabiliser le comportement global est significatif pour les tâches à contact (essuyage, assemblage par insertion), où la dynamique réelle diverge du modèle nominal. Les réductions annoncées sont concrètes, mais les auteurs ne précisent pas le contexte de charge ni la durée des cycles, ce qui limite la comparabilité directe avec d'autres benchmarks de manipulation publiés. L'apprentissage par imitation est une approche de plus en plus adoptée pour programmer les robots manipulateurs sans modèle explicite, popularisée par des méthodes comme ACT (Action Chunking with Transformers, Stanford) ou Diffusion Policy. La gestion des vitesses variables y reste un angle mort : la plupart des méthodes supposent une fréquence de contrôle fixe. VFIL avait ouvert la voie en couplant fréquence d'échantillonnage et fréquence de mouvement, mais souffrait de son architecture en boucle ouverte. VFILC apporte la boucle de correction manquante via l'ILC, technique bien établie en contrôle industriel (presses, robots de soudage à répétition). La prochaine étape logique serait l'intégration dans des pipelines VLA (Vision-Language-Action) pour adapter dynamiquement la cadence sur commande en langage naturel, une direction que Physical Intelligence, CMU et ETH Zurich explorent activement.

RecherchePaper
1 source
Fail-RAG : un cadre fondé sur la RAG pour l'identification des défaillances des robots
2258arXiv cs.RO 

Fail-RAG : un cadre fondé sur la RAG pour l'identification des défaillances des robots

Des chercheurs ont publié sur arXiv (2606.19598, juin 2026) Fail-RAG, un framework de détection automatique de pannes pour robots industriels combinant RAG (Retrieval Augmented Generation) et modèles vision-langage (VLM). Le principe : des images de défaillances et leurs métadonnées contextuelles sont indexées dans une base vectorielle ; lors d'un incident, le système calcule la similarité entre l'événement observé et les entrées de cette base, puis soumet les cas les plus proches à un VLM qui analyse la situation en suivant un gabarit d'instructions structuré. Les expériences ont porté sur cinq types d'opérations courantes en logistique entrepôt, testées à la fois en simulation et en environnement physique, sur des bras robotiques fixes et un manipulateur mobile. Résultat mesuré : +25 points de précision en moyenne par rapport à l'utilisation directe d'un VLM généraliste sans couche RAG. Le gain de 25 points est significatif dans un contexte où les VLM "out-of-the-shelf" peinent à fiabiliser la détection de pannes en conditions réelles, notamment face à la diversité des échecs possibles dans des environnements dynamiques. Les méthodes à base de règles (classiques en automatisation industrielle) se révèlent fragiles dès que les tâches ou l'environnement évoluent, un problème structurel dans les entrepôts à forte variabilité. Fail-RAG répond à ce défaut en construisant une mémoire des défaillances passées plutôt qu'en codant des règles figées, ce qui le rend potentiellement plus robuste aux variantes nouvelles. C'est une approche pertinente pour les intégrateurs cherchant à réduire les arrêts non planifiés sans avoir à réentraîner un modèle complet à chaque nouveau type d'incident. Le contexte académique de ce travail est celui de la montée des robots généralistes et de l'IA incarnée dans les contextes manufacturiers, portée notamment par la pénurie de main-d'oeuvre en logistique. La recherche sur la détection de pannes par vision reste un chantier ouvert : des acteurs comme Boston Dynamics, Intrinsic (Google) ou les labos universitaires travaillant sur des VLA (Vision-Language-Action models) s'intéressent à des approches similaires de résilience autonome. Fail-RAG reste à ce stade un prototype de recherche avec validation expérimentale limitée en termes de diversité de scènes et d'équipements. Les prochaines étapes naturelles seraient un déploiement pilote chez un opérateur logistique et une évaluation sur des robots mobiles autonomes (AMR) à plus large échelle.

IA physiquePaper
1 source
One-to-Two Acting : un cadre pour étendre les actions d'un agent mono-bras à deux bras
2259arXiv cs.RO 

One-to-Two Acting : un cadre pour étendre les actions d'un agent mono-bras à deux bras

Des chercheurs ont publié le 24 juin 2026 sur arXiv (2606.19897) ExS2D, un framework hiérarchique permettant à un robot bras unique d'exécuter des tâches bimanuelle sans aucune démonstration en configuration deux bras. Le système décompose d'abord des instructions textuelles en sous-tâches structurées, en capturant explicitement les dépendances temporelles entre elles. Un module de grounding traduit ensuite chaque sous-tâche en actions exécutables via une cartographie guidée par l'observation. Enfin, un coordinateur basé sur un grand modèle de langage multimodal (MLLM) orchestre l'allocation des actions entre les deux bras et planifie les trajectoires sans collision. En simulation, ExS2D réduit le nombre moyen d'étapes d'exécution de 54,4 % tout en maintenant un taux de succès comparable au baseline mono-bras. Des expériences sur robot réel portant sur quatre tâches distinctes confirment la fiabilité du système, entraîné uniquement sur quelques échantillons mono-bras en régime few-shot. L'enjeu principal ici est le coût de collecte des données bimanuelles, qui constitue l'un des principaux freins à la manipulation duale en robotique industrielle et service. Les systèmes comme ALOHA ou les plateformes de télé-opération bimanuelle nécessitent des configurations spécialisées et des opérateurs formés, rendant le passage à l'échelle difficile. ExS2D contourne ce goulot d'étranglement en réutilisant des démonstrations mono-bras existantes, potentiellement déjà disponibles dans les parcs robotiques en production. La réduction de 54,4 % des étapes d'exécution représente un gain de débit concret pour des lignes d'assemblage ou de tri, bien que les conditions expérimentales exactes (vitesse, complexité des objets, variabilité de la scène) ne soient pas détaillées dans l'abstract, ce qui invite à nuancer cette métrique avant toute extrapolation industrielle. La manipulation bimanuelle attire des investissements croissants de la part d'acteurs comme Figure AI (Figure 03), Physical Intelligence (pi0) ou Apptronik, tous confrontés au même problème de données. La tendance actuelle est d'utiliser des VLA (Vision-Language-Action models) entraînés sur de vastes corpus de démonstrations humaines, mais la collecte bimanuelle reste coûteuse même pour ces acteurs. ExS2D s'inscrit dans une direction complémentaire, celle du transfer learning structural depuis des données mono-bras, une approche qui pourrait intéresser les intégrateurs travaillant sur des cellules robotiques existantes en mono-bras. Il s'agit pour l'instant d'un travail académique sans déploiement commercial annoncé ; la prochaine étape logique serait une validation sur des tâches industrielles plus complexes et avec une plus grande variabilité d'objets.

RecherchePaper
1 source
VOiLA : planification en ligne vectorisée avec modèle de diffusion pour agents POMDP
2260arXiv cs.RO 

VOiLA : planification en ligne vectorisée avec modèle de diffusion pour agents POMDP

Des chercheurs ont soumis sur arXiv (réf. 2606.19729) VOiLA, un framework de planification robotique qui apprend des modèles POMDP génériques via diffusion conditionnelle pour planifier sous incertitude partielle, sans nécessiter de modèles physiques codés manuellement. Les diffusion samplers sont distillés en générateurs feedforward compacts intégrés au planificateur VOPP, exploitant la parallélisation GPU pour réduire le coût d'échantillonnage de près de mille fois. Sur trois benchmarks standards, VOiLA atteint des performances égales ou supérieures à Recurrent Soft Actor Critic (RSAC) avec moins de 10 % de ses données d'entraînement. Sur robot physique, les modèles appris exclusivement en simulation permettent de réussir 10 tâches sur 10 en conditions réelles. Le résultat le plus saillant est ce taux de succès sim-to-real de 100 % : les modèles, entraînés sans aucune donnée réelle, fonctionnent en conditions physiques sans dégradation, validant directement la robustesse du transfert simulation-réalité. La frugalité en données est tout aussi notable : surpasser RSAC avec moins d'un dixième de ses données d'entraînement suggère que la structure imposée par les modèles de diffusion compense efficacement le manque de supervision. La généralisation à des configurations d'environnement inédites, documentée sur benchmarks, renforce la crédibilité de l'approche pour des déploiements industriels à conditions variables, là où les agents RL classiques montrent souvent leurs limites. La planification POMDP est un cadre théorique solide pour les agents en environnement partiellement observable, mais son adoption pratique a longtemps été freinée par la difficulté de construire des modèles fidèles. Les approches model-based comme DreamerV3 ou RSSM apprennent ces modèles sans intégrer de planification en ligne explicite calculable en temps réel. VOiLA comble ce fossé en combinant l'expressivité de la diffusion et la rapidité de la distillation pour rendre le POMDP tractable sur GPU, face à des concurrents directs comme RSAC, les planificateurs Monte Carlo Tree Search et les frameworks VLA. Aucun acteur français ou européen n'est impliqué dans ce travail, bien que des laboratoires comme l'INRIA ou le LAAS-CNRS pourraient directement exploiter ces résultats ; aucun partenariat industriel ni timeline de déploiement n'est annoncé dans ce preprint.

RecherchePaper
1 source
Pose6DAug : substitution d'objets multi-vues physiquement plausible pour l'augmentation de données en robotique
2261arXiv cs.RO 

Pose6DAug : substitution d'objets multi-vues physiquement plausible pour l'augmentation de données en robotique

Des chercheurs ont publié sur arXiv (réf. 2606.20118) une méthode baptisée Pose6DAug, un framework d'augmentation de données conçu pour améliorer la robustesse des politiques de type Vision-Language-Action (VLA) face à des objets qu'elles n'ont jamais manipulés lors de l'entraînement. Sans collecter un seul épisode de télé-opération supplémentaire, la méthode exploite les démonstrations réussies existantes pour en générer automatiquement de nouvelles, ciblées sur les modes d'échec détectés. Le principe : identifier les cas où la politique échoue sur un objet inconnu, puis remplacer l'objet manipulé dans les épisodes réussis par cet objet cible, tout en conservant la trajectoire d'action d'origine. Pour garantir la cohérence physique et multi-vue, le remplacement n'opère pas en 2D comme le ferait un inpainting vidéo classique, mais directement en 3D : l'objet cible est ancré via un mesh 3D piloté par une trajectoire de pose 6D cohérente temporellement, ce qui permet des rendus géométriquement consistants sur toutes les caméras, y compris sous occultations et angles egocentriques. En fine-tuning un VLA sur ces données augmentées, les auteurs mesurent un gain de 16,5 % de taux de succès sur objets hors-distribution par rapport au meilleur baselin existant, sans dégradation sur les objets connus. Ce résultat est important parce qu'il attaque directement le principal verrou à la mise à l'échelle des VLAs dans des environnements industriels réels : la généralisation à de nouveaux objets exige aujourd'hui des cycles coûteux de collecte de démonstrations humaines pour chaque nouveau cas. Pose6DAug transforme un épisode réussi en source de données synthétiques ciblées, ce qui pourrait réduire drastiquement le coût de déploiement continu des politiques robotiques. La méthode apporte aussi une réponse concrète au débat sur la cohérence sim-to-real : l'augmentation 2D par édition vidéo crée des incohérences entre vues qui dégradent l'apprentissage, tandis que l'approche 3D physiquement ancrée les élimine, validant l'hypothèse que la plausibilité géométrique est déterminante pour l'efficacité des augmentations. Le contexte de ce travail est celui de l'explosion des VLAs généralistes, portée par des modèles comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA ou encore Octo, tous confrontés au même problème de distribution shift sur de nouveaux objets. Les approches concurrentes, domain randomization ou collecte de nouvelles démonstrations, peinent à passer à l'échelle industrielle. Pose6DAug se positionne comme une brique de fine-tuning continu et automatique, activable dès qu'un mode d'échec est détecté en production. Les auteurs n'annoncent pas de déploiement terrain ni de partenariat industriel dans cette version preprint ; il s'agit d'une publication de recherche, sans produit commercialisé à ce stade.

IA physiqueOpinion
1 source
Apprentissage de la navigation au dernier mètre par catégorie à partir de démonstrations RGB d'une instance unique
2262arXiv cs.RO 

Apprentissage de la navigation au dernier mètre par catégorie à partir de démonstrations RGB d'une instance unique

Des chercheurs du RPM Lab de l'Université du Minnesota présentent dans un preprint arXiv (2512.11173v3) un framework d'imitation learning pour la navigation au "dernier mètre" d'un robot manipulateur mobile quadrupède. L'enjeu : positionner la base du robot à quelques centimètres de l'objet cible avant toute action de manipulation, une phase où les systèmes RGB existants échouent, ne garantissant qu'une précision métrique insuffisante. Le système n'utilise que des caméras RGB embarquées et fonctionne avec trois entrées : des images objectif, des observations RGB multi-vues, et un prompt texte nommant l'objet cible. Un module de segmentation guidé par le langage et un décodeur de matrice de score spatial gèrent l'ancrage de l'objet et le raisonnement en pose relative. Entraîné sur une seule instance physique par catégorie, le système atteint 74,58 % de succès en edge-alignment (évaluation sur l'orientation réelle) et 89,42 % en object-alignment sur des instances et environnements inédits, y compris avec des conditions d'éclairage et de fond difficiles. Ce résultat comble un angle mort structurel de la manipulation mobile : les politiques de manipulation sont entraînées sur des configurations précises, et un positionnement approximatif suffit à les faire sortir de leur distribution d'entraînement, causant des échecs en chaîne à l'exécution. Supprimer LiDAR, capteurs de profondeur et cartes préalables tout en conservant une précision centimétrique rend le pipeline nettement plus déployable sur des plateformes sans capteurs premium. La généralisation catégorielle (une seule démonstration réelle, des dizaines d'instances inconnues) réduit massivement le coût de collecte de données, un verrou majeur pour la manipulation hors environnement contrôlé. Ce travail s'inscrit dans la dynamique des VLA (Vision-Language-Action) qui cherchent à unifier perception, langage et action dans des politiques généralisables. Les acteurs dominants sur la manipulation mobile incluent Physical Intelligence (Pi-0), Figure AI et les équipes académiques de Stanford et CMU, qui investissent massivement dans la collecte de données téléopérées à grande échelle. L'approche ici contraste délibérément : une seule démonstration par catégorie plutôt que des milliers d'épisodes. Ce résultat reste un démonstrateur académique sans déploiement industriel annoncé ni partenaire B2B identifié, mais une page projet avec des démonstrations visuelles est disponible en ligne.

IA physiqueActu
1 source
Co-VLA : modélisation structurée des actions intégrant la coordination pour systèmes VLA bi-bras
2263arXiv cs.RO 

Co-VLA : modélisation structurée des actions intégrant la coordination pour systèmes VLA bi-bras

Des chercheurs ont publié Co-VLA (arXiv:2606.20285), un framework de manipulation bimanurale qui intègre des priors structurels explicites dans les modèles VLA (Vision-Language-Action). L'architecture remplace la tête d'action monolithique habituelle par un Structured Action Expert (SAE) couplé à un Latent-Aware Controller (LAC) opérant au niveau des commandes articulaires. Le SAE décompose la représentation latente en une composante partagée encodant l'intent de coordination au niveau de la tâche, et des résidus par bras capturant les ajustements d'exécution propres à chaque effecteur. Les résultats expérimentaux, en simulation et sur banc réel, montrent un gain de 27 points de taux de succès sur les tâches à coordination serrée, un doublement des performances hors-distribution (de 13 % à 27 %), et une réduction du temps d'exécution allant jusqu'à 25 % face aux baselines monolithiques. L'enjeu central est de rendre fiable et interprétable la coordination bimanurale dans des scénarios industriellement contraints : assemblage à force symétrique, manipulation d'objets déformables, chaînes de montage à deux bras. Les VLA actuels comme Pi-0 ou GR00T N2 montrent que la coordination émergente fonctionne sur des tâches simples, mais échoue à garantir la stabilité quand les contraintes d'exécution sont critiques. Co-VLA répond à cette limite sans requérir de contrôle en force ni en impédance : le LAC module en temps réel la synchronisation, l'asymétrie et les contraintes de sécurité tout en restant compatible avec les pipelines de contrôle standard, ce qui abaisse la barrière d'intégration pour les équipementiers. Le doublement des performances OOD est l'indicateur le plus stratégique, suggérant que la structure explicite améliore la robustesse hors-distribution, un critère décisif pour les déploiements industriels réels. Le domaine des VLA pour la manipulation s'est accéléré depuis 2023, porté par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui ont repoussé les limites de la généralisation en manipulation mono et bimanurale. Co-VLA s'inscrit dans une tendance qui réintroduit de la structure explicite dans l'apprentissage end-to-end, une tension classique entre approches connexionnistes et symboliques qui refait surface à l'ère des grands modèles de fondation. Aucun partenaire industriel ni timeline de commercialisation n'est mentionné dans l'abstract : il s'agit d'un preprint de recherche académique, sans robot identifié ni déploiement annoncé à ce stade.

RechercheOpinion
1 source
Étude comparative sur l'agilité, l'efficacité et l'absorption des chocs des robots bipèdes à orteils actifs
2264arXiv cs.RO 

Étude comparative sur l'agilité, l'efficacité et l'absorption des chocs des robots bipèdes à orteils actifs

Des chercheurs ont publié sur arXiv en juin 2026 (2606.19699) une étude comparative portant sur un robot bipède à 14 degrés de liberté (DOF) équipé d'orteils actifs, conçus pour reproduire les caractéristiques humaines de légèreté, fort couple et robustesse. Pour évaluer objectivement l'apport des orteils, l'équipe a développé un environnement de simulation haute fidélité modélisant avec précision les actionneurs réels à transmissions couplées et la consommation électrique effective. Une fonction de récompense minimale en apprentissage par renforcement (RL) a été appliquée de manière identique aux deux configurations -- avec et sans orteils actifs -- pour garantir une comparaison équitable. À une vitesse de marche de 1,33 m/s, la configuration avec orteils réduit le coût de transport (CoT) de 17,5 % et la force de réaction au sol (GRF) lors de l'attaque du talon de 5,0 %. Sur les tests d'agilité, la déviation moyenne par rapport à la trajectoire cible chute de 25,0 % et la déviation maximale de 34,0 %. Ces résultats, bien qu'issus uniquement de simulation, apportent une validation quantitative rigoureuse là où la littérature précédente se contentait souvent de démonstrations qualitatives. La réduction du CoT est directement pertinente pour les déploiements industriels, où l'autonomie énergétique conditionne la durée des cycles opérationnels. La diminution du GRF au talon suggère par ailleurs une meilleure durabilité mécanique à long terme, un paramètre critique pour les intégrateurs industriels qui dimensionnent la maintenance préventive. La progression sur les métriques d'agilité confirme une hypothèse souvent avancée mais rarement chiffrée : les orteils contribuent significativement au contrôle dynamique en virage et sur trajectoires complexes, au-delà de la simple marche en ligne droite. Le débat sur l'utilité des orteils dans la robotique humanoïde est ancien. La majorité des plateformes commerciales actuelles -- Figure 02/03, Optimus Gen 2 ou Atlas de Boston Dynamics -- optent pour des pieds plats ou semi-rigides, privilégiant la simplicité mécanique et la robustesse. Des travaux antérieurs sur des robots comme ASIMO ou Cassie avaient exploré des pieds articulés sans aboutir à un consensus sur le gain réel. Cette étude repositionne la question en proposant un cadre d'évaluation reproductible et des métriques comparables. La prochaine étape critique sera la validation sim-to-real : les gains simulés tiennent rarement à l'identique sur hardware, notamment en raison du jeu mécanique et des effets de compliance non modélisés. Aucun déploiement physique ni partenaire industriel n'est annoncé à ce stade.

RecherchePaper
1 source
CoMo : apprendre le mouvement latent continu depuis des vidéos internet pour un apprentissage robotique à grande échelle
2265arXiv cs.RO 

CoMo : apprendre le mouvement latent continu depuis des vidéos internet pour un apprentissage robotique à grande échelle

Des chercheurs ont publié sur arXiv (référence 2505.17006, version 3) une méthode baptisée CoMo, pour "Continuous Motion", conçue pour extraire automatiquement des représentations continues du mouvement à partir de vidéos issues d'Internet, et les réutiliser comme étiquettes d'action pour entraîner des politiques robotiques. CoMo repose sur deux mécanismes distincts : une différence temporelle précoce (Td) appliquée en amont de l'encodeur pour rendre plus difficile l'apprentissage par raccourcis visuels (les modèles ont tendance à coder l'arrière-plan statique plutôt que le mouvement lui-même), et un apprentissage contrastif temporel (Tcl) qui construit des paires positives avec un décalage temporel réduit vers le futur, et des paires négatives en inversant la direction du temps. Le résultat est un espace latent continu, entraîné sur des vidéos à grande échelle, capable de générer des pseudo-étiquettes d'action pour des vidéos jamais vues en phase d'inférence. Des expériences en simulation et en conditions réelles montrent des gains de performance par rapport aux approches discrètes, aussi bien avec des architectures diffusion que autorégressives. L'enjeu industriel est direct : l'un des goulots d'étranglement du robot learning est la rareté des démonstrations téléopérées, coûteuses à collecter. Si une méthode peut extraire un signal d'action utilisable depuis des vidéos YouTube ou des caméras industrielles non étiquetées, elle réduit mécaniquement le coût de constitution des datasets. La contribution principale de CoMo face aux méthodes discrètes par quantification vectorielle (VQ) est de supprimer la perte d'information liée à la projection dans un codebook de petite taille, et surtout de combler le fossé de distribution entre un espace discret de tokens visuels et un espace d'actions continues à valeurs réelles, fossé qui pénalise l'apprentissage conjoint d'une politique unifiée. La généralisation zéro-shot annoncée est la prétention la plus forte : elle signifie que CoMo pourrait étiqueter des vidéos de nouveaux environnements ou tâches sans ré-entraînement, ce qui reste à valider sur des benchmarks standardisés ; l'abstract ne cite pas de métriques numériques précises. Ce travail s'inscrit dans un axe de recherche très actif depuis 2023, qui cherche à exploiter Internet comme source de supervision pour les robots, aux côtés de méthodes comme RT-2 de Google DeepMind, Pi-0 de Physical Intelligence, ou encore les travaux sur les VLA (Vision-Language-Action models) d'UC Berkeley et du MIT. Les approches discrètes concurrentes (type GROOT ou méthodes VQ-VAE appliquées à la vidéo) souffrent précisément des limitations que CoMo prétend résoudre. La prochaine étape naturelle serait une validation sur des benchmarks robotiques communautaires comme RLBench, LIBERO ou BridgeData V2, et un test à l'échelle de données réellement "internet-scale" pour confirmer si la généralisation zéro-shot tient face à la diversité des distributions visuelles du monde réel.

RecherchePaper
1 source
MirrorDuo : apprentissage visuo-moteur cohérent par paires de démonstrations en miroir
2266arXiv cs.RO 

MirrorDuo : apprentissage visuo-moteur cohérent par paires de démonstrations en miroir

Une équipe de chercheurs publie MirrorDuo (arXiv:2606.20048, juin 2026), une méthode d'apprentissage par imitation qui exploite la symétrie par réflexion pour doubler virtuellement les données d'entraînement sans collecte supplémentaire. Le principe est géométrique : pour chaque démonstration capturée via caméra RGB, le système génère automatiquement son équivalent en miroir, transformant simultanément l'image, les données proprioceptives et les tuples d'action en espace 6-DOF (six degrés de liberté du préhenseur). Les auteurs résument l'idée en une formule : "collect one, get one for free". La méthode s'intègre soit comme stratégie d'augmentation de données dans des pipelines existants, notamment le clonage comportemental standard et la diffusion policy, soit comme prior structurel pour des réseaux de politique réflexion-équivariants. L'enjeu pratique est direct : le coût de collecte de démonstrations diversifiées reste l'un des principaux freins au déploiement de robots manipulateurs en milieu industriel. MirrorDuo apporte un gain de performance mesurable à budget de données constant, particulièrement lorsque les démonstrations sont distribuées de façon équilibrée des deux côtés de l'espace de travail. Mieux : lorsque les démonstrations sont concentrées d'un seul côté, la méthode permet un transfert de compétence vers le côté symétrique avec seulement zéro à cinq démonstrations dans la configuration cible. C'est un résultat significatif dans un domaine où la généralisation inter-configuration reste coûteuse et fragile. Cela dit, les auteurs ne fournissent pas de métriques absolues de taux de succès dans le résumé, ce qui rend difficile d'évaluer l'ampleur réelle du gain sans lire les expériences complètes. Cette approche s'inscrit dans une tendance plus large visant à maximiser l'extraction d'information depuis un volume limité de démonstrations humaines. Les méthodes concurrentes incluent l'augmentation classique par transformation géométrique 2D, l'apprentissage en simulation avec transfert sim-to-real, et les architectures équivariantes déjà explorées pour des tâches planaires. MirrorDuo étend ce raisonnement au cas 6-DOF en espace 3D, ce qui est techniquement plus exigeant. L'article ne mentionne pas de partenaires industriels ni de calendrier de déploiement, et les validations restent confinées à des environnements de laboratoire contrôlés. La prochaine étape logique serait une évaluation sur des morphologies robotiques variées et des scènes non contraintes, là où la symétrie de l'espace de travail est moins garantie.

RecherchePaper
1 source
DADP : politique de diffusion adaptative au domaine
2267arXiv cs.RO 

DADP : politique de diffusion adaptative au domaine

Des chercheurs ont publié le 19 juin 2026 la troisième version de DADP (Domain Adaptive Diffusion Policy), un framework de contrôle robotique conçu pour généraliser à des dynamiques physiques inconnues sans nécessiter de réentraînement. Le problème central adressé est la capacité d'une politique apprise en simulation ou dans un environnement donné à fonctionner dans un autre contexte aux propriétés mécaniques différentes, friction, masse, compliance des articulations, ce que l'on appelle l'adaptation zéro-shot. Les auteurs identifient un défaut structurel dans les approches existantes de domain representation learning : lorsqu'un modèle extrait sa représentation du domaine à partir d'un contexte temporel adjacent à l'étape courante, il mélange involontairement des informations statiques (les constantes du domaine physique) avec des propriétés dynamiques transitoires (la vitesse ou la posture instantanée). DADP répond par deux contributions techniques : d'abord le Lagged Context Dynamical Prediction, qui conditionne l'estimation d'état futur sur un contexte historique décalé dans le temps, augmenter ce délai force le modèle à filtrer les propriétés transitoires et à extraire uniquement les invariants du domaine, sans supervision explicite. Ensuite, les représentations de domaine ainsi disentangled sont injectées directement dans le processus génératif du diffusion model, en biaisant la distribution a priori et en reformulant la cible de diffusion. Les résultats sur des benchmarks de locomotion et de manipulation dépassent les méthodes antérieures sur ces axes combinés. L'intérêt pour les intégrateurs robotiques et les équipes R&D est double. Premièrement, DADP aborde directement le sim-to-real gap en proposant une séparation non supervisée entre ce qui appartient à la physique du robot (masse, friction) et ce qui relève de la trajectoire en cours, une distinction que les approches précédentes laissaient au réseau à résoudre implicitement, avec des résultats fragiles. Deuxièmement, l'injection de la représentation domaine dans le processus de diffusion plutôt qu'en simple conditionnement de politique représente un changement architectural notable : cela signifie que la politique génère des actions dont la distribution est intrinsèquement calibrée sur le domaine courant, et non pas simplement corrigée a posteriori. Pour les équipes travaillant sur des déploiements multi-sites ou sur des flottes hétérogènes de manipulateurs industriels, cela ouvre une voie pour réduire le coût de calibration par site. Il convient de nuancer : les benchmarks présentés restent des environnements simulés standardisés (MuJoCo-type), et aucune validation hardware sur un robot physique n'est revendiquée dans l'abstract, un gap classique entre publication académique et déploiement terrain. DADP s'inscrit dans un courant de recherche actif qui cherche à combiner les diffusion policies, popularisées par les travaux de Chi et al. (2023) sur le Diffusion Policy et désormais intégrées dans des systèmes comme pi-zéro de Physical Intelligence ou les pipelines GR00T de NVIDIA, avec des mécanismes d'adaptation contextuelle au domaine physique. Les approches concurrentes incluent les méthodes de domain randomization (entraînement sur une large distribution de dynamiques) et les architectures méta-RL comme PEARL ou MAML, qui supposent un accès à quelques épisodes d'adaptation. DADP se positionne en zéro-shot sans rollouts d'adaptation, ce qui est une contrainte opérationnelle réaliste pour des déploiements industriels où le temps de mise en service est limité. La présence d'un site de visualisation dédié (outsider86.github.io/DomainAdaptiveDiffusionPolicy) et l'itération en version 3 suggèrent une réponse active à la communauté ; une validation expérimentale sur hardware physique constituerait la prochaine étape logique pour ancrer ces résultats dans la réalité industrielle.

RecherchePaper
1 source
MemoryWAM : modélisation monde-action efficace avec mémoire persistante
2268arXiv cs.RO 

MemoryWAM : modélisation monde-action efficace avec mémoire persistante

La manipulation robotique longue durée exige une mémoire procédurale que la majorité des modèles actuels ne possèdent pas. MemoryWAM, un modèle monde-action (WAM, world action model) présenté en préprint arXiv (réf. 2506.20562, juin 2026), propose une architecture de mémoire hybride pour combler ce manque. Le système repose sur trois niveaux : des trames récentes pour le contexte immédiat, des trames ancres positionnées aux frontières d'événements clés de la séquence, et des gist tokens, des représentations compressées résumant l'historique long terme. Un mécanisme d'attention sur mesure permet d'interroger simultanément ces trois niveaux, conjuguant précision à court terme et cohérence à long terme. Les auteurs reportent des performances supérieures aux baselines VLA (vision-language-action) et WAM sur des tâches de manipulation à long horizon, en simulation et en environnement réel, avec une latence d'inférence et une consommation mémoire GPU réduites. Le verrou adressé est structurel : les WAM actuels choisissent entre fenêtre d'observation bornée, efficace mais aveugle au passé, et historique complet, précis mais dont le coût en temps et en VRAM croit avec la longueur de la séquence. Dans les environnements non-markoviens, c'est-à-dire lorsque la décision optimale dépend d'événements situés hors de la fenêtre courante, situation fréquente dans les tâches d'assemblage ou de pick-and-place multi-étapes, ce compromis devient rédhibitoire. La stratégie des gist tokens propose une alternative : comprimer sélectivement plutôt que stocker exhaustivement, ce qui maintient des performances d'inférence compatibles avec un déploiement embarqué. Pour les intégrateurs robotiques et les équipes R&D industrielles, l'enjeu est double : des robots capables de réagir à un historique long sans multiplier les ressources GPU, et une voie vers des VLA plus robustes hors des conditions de laboratoire. Les modèles monde-action s'inscrivent dans une lignée qui cherche à dépasser les VLA purs en ajoutant une modélisation dynamique visuelle, la prédiction de frames futures servant de signal de supervision auxiliaire. Des travaux comme UniSim ou DreamerV3 ont exploré cette direction en contexte général ; MemoryWAM l'applique spécifiquement à la manipulation longue durée. Ses concurrents directs incluent des VLA à contexte court tels que Pi-0 de Physical Intelligence, OpenVLA ou RoboFlamingo, qui peinent sur les séquences avec dépendances temporelles distantes. Le papier reste un preprint sans code ni poids publiés, et ses benchmarks proviennent de protocoles internes, ce qui limite la portée immédiate pour les praticiens. Une comparaison sur des jeux de données standardisés comme LIBERO ou RLBench sera nécessaire pour évaluer la généralisation réelle de l'approche. Ni partenariat industriel ni calendrier de déploiement ne sont mentionnés.

IA physiqueOpinion
1 source
SWAP : modèle du monde symétrique équivariant pour le parkour robotique agile
2269arXiv cs.RO 

SWAP : modèle du monde symétrique équivariant pour le parkour robotique agile

Des chercheurs ont publié sur arXiv le 19 juin 2026 un preprint décrivant SWAP (Symmetric World-model for Agile Parkour), un cadre d'apprentissage par renforcement pour la locomotion agile de robots quadrupèdes. L'approche couple un modèle du monde latent, qui permet des prédictions proactives sur le terrain à venir, avec un principe d'équivariance par symétrie gauche-droite intégré simultanément dans le modèle du monde et dans les réseaux acteur-critique. En tests réels, le robot associé au framework franchit un fossé de 2,13 mètres d'un saut et escalade une plateforme de 1,63 mètre. Les auteurs présentent ces résultats comme des records pour le parkour quadrupède, affirmation non encore validée de façon indépendante. Le système démontre également une généralisation robuste à des environnements extérieurs et à des terrains miroirs non vus lors de l'entraînement, sans ré-entraînement (zero-shot transfer). L'enjeu central est l'efficacité d'apprentissage. Les modèles du monde purement pilotés par les données encodent les interactions symétriques gauche-droite comme des patterns indépendants, gonflant inutilement la complexité d'apprentissage et empêchant la capture des régularités géométriques du terrain. En intégrant l'équivariance comme prior structurel, SWAP réduit cette redondance et rend l'espace latent plus compact pour la politique en aval. Pour les équipes de recherche appliquée, le résultat le plus notable reste le transfert zero-shot vers des terrains inédits : si confirmé sur d'autres plateformes matérielles, cela réduirait le besoin de données de fine-tuning spécifiques à chaque déploiement, un verrou important dans le sim-to-real actuel pour la locomotion agile. Le parkour quadrupède est devenu un benchmark de facto depuis les travaux d'ETH Zurich sur ANYmal et le papier Parkour Learning de 2023, suivis par Carnegie Mellon University, qui ont progressivement montré que des politiques entraînées en simulation pouvaient généraliser à des obstacles physiques complexes. L'usage de modèles du monde latents pour la locomotion reste une piste plus récente par rapport aux pipelines classiques de RL bout-en-bout, et SWAP se positionne à l'intersection de ces deux axes. Le preprint ne mentionne ni le nom précis du robot utilisé ni l'institution d'origine des auteurs, deux détails qui limiteront la reproductibilité jusqu'à la publication complète en conférence. Aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade.

RecherchePaper
1 source
VibeCheck : détection tactile acoustique active pour la manipulation riche en contacts
2270arXiv cs.RO 

VibeCheck : détection tactile acoustique active pour la manipulation riche en contacts

Des chercheurs du ROAM Lab présentent VibeCheck, un préhenseur de robot équipé de deux doigts piézoélectriques : l'un émet une vibration acoustique à travers l'objet saisi, l'autre la reçoit. Cette configuration de captation acoustique active permet d'extraire, en temps réel, des informations sur l'état de l'objet, ses propriétés matérielles, la position de saisie, la pose de structures internes, et la nature des contacts extrinsèques que l'objet entretient avec son environnement. Le système a été validé sur un bras UR5, en prenant le retour acoustique comme unique feedback sensoriel, sur la tâche d'insertion de goupille (peg insertion), un benchmark classique de manipulation dite contact-riche. Les travaux sont disponibles sur arXiv (2504.15535v2). L'intérêt principal de cette approche est d'offrir une modalité sensorielle tactile qui ne repose ni sur la vision (contrairement à GelSight ou DIGIT), ni sur un capteur force-couple classique, souvent coûteux et fragile. Le fait d'inférer le type de contact extrinsèque uniquement par signature acoustique, et d'en dériver une politique d'imitation learning robuste aux prédictions imparfaites du classificateur, suggère une voie sérieuse vers des manipulateurs capables de réagir à des contacts non planifiés sans percevoir explicitement la scène. La résilience de la politique à l'imperfection du signal est un point notable : elle a été entraînée sur un modèle de transition simulé calibré sur les performances réelles du capteur, ce qui réduit partiellement le sim-to-real gap habituel dans ce type de pipelines. L'acoustique active en robotique n'est pas nouvelle, des travaux comme SonicSense ou les approches vibrotactiles en exploration de matériaux existent depuis plusieurs années, mais son intégration dans un préhenseur commercialement plausible (doigts piézoélectriques standard) pour des tâches longue-durée reste rare. Côté concurrence, les capteurs vision-based (GelSight de MIT, DIGIT de Meta/CMU) dominent la recherche en tactile, tandis que des startups comme Touchlab ou Xela Robotics misent sur d'autres modalités. VibeCheck se distingue par sa capacité à fonctionner à travers l'objet, pas seulement à sa surface. Les prochaines étapes probables incluent l'extension à des géométries d'objets variées et l'intégration à des systèmes multi-modaux combinant acoustique et vision.

RecherchePaper
1 source
ForEnt : un jeu de données multimodal pour caractériser le piégeage des robots quadrupèdes en milieu forestier
2271arXiv cs.RO 

ForEnt : un jeu de données multimodal pour caractériser le piégeage des robots quadrupèdes en milieu forestier

Des chercheurs ont publié ForEnt, un dataset multimodal destiné à caractériser les encastrements de robots quadrupèdes en milieu forestier. Collecté avec le Unitree Go2, un quadrupède d'entrée de gamme, sur huit sites du Southampton Common Woodlands au Royaume-Uni, le jeu de données couvre 1,7 km de traversées réparties en 11 séquences, au cours desquelles 69 événements d'encastrement ont été enregistrés. Un encastrement désigne une situation où les pattes du robot se retrouvent piégées dans des lianes, des racines ou d'autres végétaux, provoquant une perte de stabilité et un risque de chute. ForEnt combine des flux temporellement synchronisés : images RGB-D, nuages de points LiDAR, données proprioceptives et vidéo en vue tierce-personne. Chaque événement est labellisé, ce qui en fait un benchmark reproductible pour évaluer des stratégies de détection d'encastrement. Les robots quadrupèdes sont de plus en plus déployés pour la surveillance écologique en forêt, mais leur autonomie est régulièrement interrompue par ces incidents mécaniques, qui nécessitent une intervention humaine et risquent d'endommager le matériel. L'absence d'un dataset dédié à ces modes de défaillance spécifiques freinait le développement d'algorithmes robustes. ForEnt comble ce manque : une base de données multimodale structurée permet désormais d'entraîner et d'évaluer des méthodes de détection in situ. Pour les chercheurs en navigation autonome, c'est une brique essentielle pour que des robots identifient proactivement les zones à risque et adaptent leur locomotion, condition nécessaire à des déploiements sans supervision prolongée dans des environnements non structurés. Le Unitree Go2 est l'un des quadrupèdes les plus accessibles du marché (environ 2 700 dollars), ce qui explique son adoption croissante en recherche académique. La robotique forestière reste un segment de niche mais en expansion, porté par des besoins croissants en monitoring environnemental : inventaires d'espèces, suivi d'incendies, cartographie de biodiversité. Les plateformes plus robustes comme Boston Dynamics Spot ou ANYbotics ANYmal restent hors de portée budgétaire pour la plupart des équipes académiques, ce qui rend les travaux sur des systèmes low-cost d'autant plus stratégiques. Les suites naturelles de ForEnt incluent l'entraînement de modèles de détection en temps réel et leur intégration dans des politiques de locomotion adaptative.

RecherchePaper
1 source
CTS-MoE : adaptation implicite au terrain par mélange d'experts pour la locomotion perceptive
2272arXiv cs.RO 

CTS-MoE : adaptation implicite au terrain par mélange d'experts pour la locomotion perceptive

Une équipe de recherche a publié en juin 2026 sur arXiv (ref. 2606.19633) une architecture baptisée CTS-MoE, conçue pour permettre à des robots quadrupèdes de traverser des terrains discontinus -- escaliers, trouées, obstacles -- sans recourir à un classifieur de terrain explicite. Le système repose sur un acteur à mélange dense d'experts (Mixture-of-Experts, MoE) dont le routage est piloté par la perception sensorielle, couplé à un multi-critique avec têtes de valeur spécifiques à chaque tâche pour éviter les interférences lors de l'entraînement. L'apprentissage s'effectue en bout-en-bout via un schéma enseignant-étudiant concurrent en une seule étape, sans distillation séquentielle, et les étiquettes de tâche ne sont utilisées qu'à l'entraînement. Les expériences ont été conduites sur un Unitree Go1 en simulation et sur matériel réel, sur des terrains vus et inédits. Ce travail s'attaque à une tension fondamentale du reinforcement learning multi-tâche appliqué à la locomotion : partager les comportements communs tout en évitant que des récompenses conflictuelles n'effacent la spécialisation acquise. Les approches monolithiques classiques sacrifient la spécialisation par terrain, tandis que les hiérarchies de sous-politiques peinent à généraliser lors des transitions entre environnements. CTS-MoE contourne les deux écueils en composant dynamiquement des experts partagés au runtime, guidé uniquement par la perception, sans sélecteur de haut niveau. Les résultats montrent une réduction de l'erreur de suivi de trajectoire et des taux de succès supérieurs aux baselines monolithiques -- bien que, s'agissant d'un preprint non encore évalué par les pairs, ces métriques restent à confirmer sur des benchmarks indépendants. La locomotion perceptive sur terrain complexe est un sous-domaine actif depuis les travaux d'ETH Zurich sur ANYmal (2020-2023) et ceux de CMU et Berkeley sur les quadrupèdes Unitree. L'usage des architectures MoE en robotique reste marginal par rapport à leur adoption massive en LLM (DeepSeek-MoE, Mixtral), et CTS-MoE est l'une des premières applications directes à la politique de locomotion avec validation hardware. Unitree, fabricant chinois du Go1, propose cette plateforme comme référence académique à moins de 3 500 USD, ce qui élargit la reproductibilité. Les concurrents directs en navigation sur terrain difficile incluent Boston Dynamics (Spot), ANYbotics et les laboratoires universitaires équipés d'ANYmal. Un site projet est disponible à cts-moe.github.io ; aucune timeline de déploiement industriel n'est annoncée.

RecherchePaper
1 source
RoboSSM : apprentissage par imitation contextuel et extensible via les modèles à espace d'états
2273arXiv cs.RO 

RoboSSM : apprentissage par imitation contextuel et extensible via les modèles à espace d'états

Des chercheurs ont publié sur arXiv (réf. 2509.19658v2) RoboSSM, une architecture d'apprentissage par imitation en contexte (ICIL, pour in-context imitation learning) qui remplace les Transformers par des modèles à espace d'état (SSM, state-space models), et plus précisément par Longhorn, un SSM récent présenté comme état de l'art. L'apprentissage par imitation en contexte permet à un robot d'apprendre une nouvelle tâche à partir d'une poignée de démonstrations fournies à l'inférence, sans aucune mise à jour des paramètres du modèle. Les expériences ont été conduites sur le benchmark LIBERO, référence standard pour l'évaluation des politiques robotiques multi-tâches, et montrent que RoboSSM dépasse les méthodes ICIL à base de Transformers sur les tâches non vues à l'entraînement ainsi que sur les tâches à horizon long. L'enjeu est architectural : les Transformers ont une complexité quadratique en fonction de la longueur du contexte, ce qui les pénalise dès que le prompt contient de nombreuses démonstrations ou des séquences longues. Les SSM, eux, offrent une inférence en temps linéaire et une capacité d'extrapolation à des contextes plus longs que ceux vus à l'entraînement, deux propriétés directement utiles pour l'ICIL en conditions réelles, où l'on peut vouloir fournir cinq ou dix démonstrations plutôt qu'une seule. Les auteurs affirment démontrer pour la première fois qu'un SSM peut servir de colonne vertébrale efficace et scalable pour l'ICIL. Les résultats restent toutefois confinés au simulateur LIBERO ; aucun transfert sim-to-real ni déploiement industriel n'est documenté dans ce travail. L'ICIL s'est imposée ces deux dernières années comme alternative aux politiques entraînées tâche par tâche, portée notamment par des travaux comme ICRT ou HPT, tous basés sur des Transformers. RoboSSM s'inscrit dans une tendance plus large de remplacement des Transformers par des SSM (famille Mamba, Longhorn) dans les pipelines séquentiels, tendance déjà observée en NLP et en vision. Le code est publié sur GitHub, ce qui ouvre la voie à une reproduction communautaire. Les prochaines étapes attendues sont une validation sur robot physique et une comparaison à l'échelle avec des VLA (vision-language-action) de plus grande taille.

RecherchePaper
1 source
DiffusionVS : un cadre génératif pour l'asservissement visuel robuste basé sur la politique de diffusion
2274arXiv cs.RO 

DiffusionVS : un cadre génératif pour l'asservissement visuel robuste basé sur la politique de diffusion

DiffusionVS, déposé sur arXiv (2506.19397) en juin 2026, propose un cadre génératif pour le visual servoing robotique fondé sur la Diffusion Policy. Le système prend en entrée les coordonnées normalisées des coins de marqueurs visuels observés par la caméra embarquée, et génère des commandes de vitesse caméra via un processus de débruitage conditionnel. Pour contourner les limitations de généralisation propres aux modèles entraînés sur jeux de données statiques, les auteurs adoptent un paradigme d'entraînement en ligne : le modèle collecte continuellement de nouvelles expériences interactives pour diversifier sa distribution d'apprentissage. Les résultats rapportés atteignent un taux de succès de quasi 100% en simulation et 93% en expériences physiques réelles. Le visual servoing par régression classique souffre de deux problèmes structurels : le jitter de trajectoire causé par des mappings mono-étape sensibles au bruit, et l'accumulation d'erreurs lors de distribution shifts en cours de trajectoire. La Diffusion Policy adresse ces deux points simultanément. En prédisant des séquences d'actions plutôt que des commandes isolées, elle maintient la cohérence temporelle. L'augmentation implicite de données inhérente au processus de débruitage renforce par ailleurs la robustesse aux perturbations. Ce qui est notable, au-delà des performances brutes, c'est la généricité démontrée du module : intégré à des architectures de visual servoing existantes, il améliore systématiquement leurs résultats, sans modification de leur pipeline de base. Cela valide le mécanisme diffusion comme composant réutilisable, pas seulement comme architecture ad hoc. La Diffusion Policy, popularisée par Chi et al. en 2023 (Columbia/MIT), s'est imposée en apprentissage par imitation pour la manipulation, puis adoptée par Physical Intelligence dans pi-0 et d'autres systèmes VLA. Son application au visual servoing, problème classique de robotique de précision, était moins explorée. Les approches concurrentes restent dominées par la régression directe ou les contrôleurs IBVS/PBVS à base de features géométriques. La contribution principale ici est l'entraînement en ligne, qui contourne le problème de covariate shift sans nécessiter un dataset exhaustif pré-collecté, contrainte majeure en déploiement industriel. Les limites actuelles sont notables : le système repose sur des marqueurs visuels structurés (AprilTags), et les expériences physiques ne précisent pas le type de robot ni les conditions d'environnement, ce qui rend difficile l'évaluation de la maturité pour un déploiement réel.

RecherchePaper
1 source
Coupe robotique robuste et périodique de roche via contrôle par modèle virtuel
2275arXiv cs.RO 

Coupe robotique robuste et périodique de roche via contrôle par modèle virtuel

Une équipe de chercheurs publie sur arXiv (2508.02604, version 3) un contrôleur destiné à la découpe robotique de légumes par mouvement "rock-chop" rythmique, sans trajectoire préprogrammée ni connaissance précise des propriétés mécaniques du matériau. L'approche repose sur un contrôleur à modèle virtuel (VMC) utilisant des mécanismes virtuels commutés : le mouvement émerge de l'interaction entre la dynamique du robot, l'environnement et des forces virtuelles calculées en temps réel. Validé sur un bras Franka Research 3, le système atteint une précision inférieure au millimètre pour des tranches de 1 à 6 mm d'épaisseur sur cinq légumes distincts, à un rythme d'environ une coupe par seconde. Le contrôleur maintient ses performances malgré des variations de forme du couteau et de hauteur de planche à découper, et a été transposé avec succès sur un bras humanoïde différent sans retuning majeur. Ce résultat pointe vers un verrou longtemps ouvert en manipulation robotique de contact : la découpe cumule des forces d'interaction élevées et imprévisibles, des matériaux aux propriétés variables, et des exigences de précision sub-millimétrique que les approches classiques peinent à concilier. Les méthodes habituelles s'appuient soit sur des trajectoires rigides préprogrammées, soit sur des modèles d'apprentissage intensifs en données. Le VMC proposé exploite à la place la physique du système elle-même pour stabiliser un mouvement périodique, dont la convergence est démontrée théoriquement et pas seulement empiriquement. La portabilité sur un second effecteur sans recalibration constitue un signal de généralisation platform-agnostic, qui intéresse directement les intégrateurs industriels souhaitant mutualiser leur contrôleur sur plusieurs modèles de robots. La découpe automatisée reste un verrou industriel, notamment en agroalimentaire, où des acteurs comme Miso Robotics proposent des solutions dédiées mais peu flexibles. Ce preprint (v3, non encore soumis à revue à comité de lecture) ne rapporte que des expériences de laboratoire sur cinq légumes en conditions contrôlées, sans déploiement industriel mentionné. Aucune comparaison avec des approches par apprentissage (imitation learning, VLA) n'est réalisée, ce qui limite la mise en perspective des performances annoncées. Les suites naturelles seraient une validation sur ligne réelle et une soumission à une conférence de référence (ICRA, IROS, CoRL) pour établir la reproductibilité externe.

RecherchePaper
1 source
DF-ExpEnse : exploration filtrée par diffusion pour un affinage économe en données
2276arXiv cs.RO 

DF-ExpEnse : exploration filtrée par diffusion pour un affinage économe en données

Des chercheurs présentent DF-ExpEnse, une méthode d'exploration publiée en juin 2026 sur arXiv (preprint 2606.19656) qui vise à améliorer l'efficacité en termes d'échantillons lors du fine-tuning de politiques de contrôle génératives pré-entraînées. La technique s'appuie sur les capacités de modélisation multimodale de la politique générative, typiquement une politique de diffusion, pour construire un ensemble de candidats d'actions expressif et évaluable efficacement. Un ensemble de critiques (ensemble of critics) sélectionne ensuite l'action qui équilibre la qualité d'exécution avec un fort intérêt exploratoire. En contexte de flotte robotique, DF-ExpEnse intègre un mécanisme de communication inter-agents permettant une exploration collaborative distribuée. Les expériences portent sur des tâches de manipulation et de locomotion, et montrent des gains constants en efficacité d'échantillonnage par rapport au fine-tuning par défaut et à d'autres schémas de sélection d'action. L'efficacité en termes d'échantillons est l'un des verrous principaux du fine-tuning par renforcement de politiques robotiques génératives : chaque interaction avec l'environnement réel est coûteuse, lente et potentiellement dangereuse. En améliorant la qualité des données collectées en ligne, DF-ExpEnse réduit le nombre d'épisodes nécessaires pour atteindre un niveau de performance cible, ce qui représente un gain opérationnel concret dans des contextes industriels. L'aspect flotte est particulièrement pertinent pour des déploiements à l'échelle : l'exploration collaborative entre robots permet d'amortir le coût d'exploration sur un parc entier, plutôt que de le répéter agent par agent. La méthode étant compatible avec les stratégies de fine-tuning RL existantes, son intégration dans des pipelines déjà établis reste relativement directe. Ce travail s'inscrit dans un courant de recherche actif autour du fine-tuning de politiques de diffusion robotiques, domaine structuré ces dernières années par des travaux comme Diffusion Policy (Chi et al., 2023), Pi-0 de Physical Intelligence, ou DPPO. Le passage de l'entraînement offline à l'adaptation online en conditions réelles reste l'un des axes les plus disputés de la robotique apprise, avec des groupes à Stanford, Berkeley, CMU, et des entreprises comme Physical Intelligence ou Figure AI actifs sur des variantes de ce problème. DF-ExpEnse est pour l'heure un preprint non encore évalué par les pairs ; son site projet présente des démonstrations expérimentales, mais aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade.

RechercheActu
1 source
Générer des mains robotiques à partir de démonstrations humaines
2277arXiv cs.RO 

Générer des mains robotiques à partir de démonstrations humaines

Des chercheurs ont publié un framework de co-conception de mains robotiques guidé par les données (arXiv:2506.20549, juin 2025). Le problème visé est le co-design corps/contrôleur: optimiser simultanément la morphologie d'un effecteur et son contrôleur crée un espace combinatoire difficilement tractable. La solution exploite plus de 4 millions de frames de mouvements de bouts de doigts humains issus de manipulations quotidiennes pour optimiser des mains à structure arborescente, en utilisant une politique de contrôle minimale commune à la phase de recherche et à la phase opérationnelle: le suivi de position des fingertips par cinématique inverse (IK). Deux catégories de designs ont été produites: une main à 6 degrés de liberté (DoF) à usage général, et des mains spécialisées à 3 DoF équipées de joints "mimic" à quadrilatère articulé (four-bar spatial). Un acteur entraîné par apprentissage par renforcement (RL) accélère la recherche morphologique, réduisant le temps de calcul de plusieurs heures à quelques minutes; les structures finales sont fabriquées en impression 3D print-in-place, en une seule pièce articulée sans assemblage. En expériences réelles, la main 6-DoF dépasse des mains robotiques commerciales non identifiées sur la précision de suivi télé-opéré, tandis que les mains 3-DoF reproduisent des trajectoires structurées avec une complexité mécanique réduite. L'apport principal est la résolution d'un verrou de fond en co-design: en imposant la même politique IK simple pendant l'optimisation et après fabrication, les auteurs découplent la recherche morphologique de l'apprentissage d'un contrôleur complexe, rendant l'exploration de l'espace de design tractable à grande échelle. Ce résultat soutient une hypothèse émergente: des données massives de mouvement humain non conçues pour la robotique peuvent informer l'optimisation de l'embodiment physique d'un robot, et pas seulement son contrôleur. La comparaison avec des mains commerciales reste difficile à évaluer, le preprint ne précisant ni les références comparées ni les conditions d'évaluation; prudence sur ce point en l'absence de benchmark standardisé. Ce travail prolonge une tendance croissante qui vise à utiliser des données humaines non seulement pour entraîner des politiques robotiques (VLA, imitation learning), mais pour co-générer le hardware lui-même. Les approches concurrentes en evolutionary robotics et en simulation différentiable existent depuis des années mais restent coûteuses en calcul ou peu généralisables; l'originalité de cette contribution réside dans la décorrélation design/contrôle et dans l'usage du RL comme heuristique de recherche morphologique efficace. À ce stade, il s'agit d'un preprint non encore peer-reviewed, sans déploiement industriel ni partenaire commercial annoncé; les suites naturelles seraient une validation sur un spectre plus large de tâches de manipulation et une comparaison rigoureuse avec des benchmarks établis. Aucun acteur européen n'est impliqué dans ces travaux.

RecherchePaper
1 source
SCAN-Planner : planification locale anticollision pour la navigation guidée longue portée de quadrupèdes
2278arXiv cs.RO 

SCAN-Planner : planification locale anticollision pour la navigation guidée longue portée de quadrupèdes

Des chercheurs ont publié sur arXiv (référence 2606.19555) une lettre décrivant SCAN-Planner, un cadre de planification locale pour robots quadrupèdes destiné à la navigation longue portée en environnements non structurés. Le système s'attaque à trois familles de situations problématiques : les passages étroits, les scènes intérieures encombrées et les terrains 3D complexes à grande échelle. L'innovation centrale est un empreinte bicylindrique sensible au lacet (yaw-aware twin-cylinder footprint) qui modélise le corps allongé du quadrupède, par opposition aux approximations isotropiques classiques qui gonflent le robot comme une sphère ou un cylindre unique. Cette représentation permet une évaluation des collisions sur l'ensemble du corps via des requêtes éparses dans une carte d'occupation 3D gonflée. Le système intègre également une recherche A* projetée sur une surface d'adhérence au sol interpolée, avec suppression de gradient vertical pour contourner les obstacles horizontaux sans compromettre la stabilité verticale. Pour le déploiement à grande échelle, une carte glissante centrée sur le robot avec mécanisme de repli aux frontières assure un contrôle de collision local haute résolution et une récupération des impasses locales. Les expériences combinent simulation et terrain réel : couloirs encombrés, scènes 3D non structurées, franchissement d'escaliers et navigation longue portée. L'intérêt pour les intégrateurs et les équipes robotiques tient à deux points concrets. D'abord, la prise en compte explicite des surplombs et structures tridimensionnelles comble une lacune réelle des planificateurs à carte d'élévation 2.5D, qui échouent dès qu'un obstacle dépasse un plan horizontal unique. Ensuite, le mécanisme de carte glissante adresse le passage à l'échelle (large-scale deployment) sans exploser les besoins mémoire, un problème récurrent dans les déploiements industriels longue distance. L'approche valide aussi empiriquement que la modélisation fine du corps du robot améliore la navigation en espace contraint, là où les planificateurs conservateurs dilatent excessivement les marges de sécurité et bloquent le robot dans des passages praticables. Côté contexte, la planification locale pour quadrupèdes est un terrain dense : les plateformes Boston Dynamics Spot et ANYbotics ANYmal ont popularisé ces robots hors laboratoire, mais leurs planificateurs embarqués restent majoritairement propriétaires. Côté académique, les travaux récents s'appuient sur des représentations comme les cartes de distance euclidienne (ESDF) ou les réseaux de perception, avec des systèmes comme le locomotion controller de ANYmal-D ou les frameworks de navigation de l'ETH Zurich. SCAN-Planner se positionne comme une couche de planification locale agnostique au locomotion controller, compatible avec un guidage de route externe. Aucun déploiement industriel ni partenariat commercial n'est mentionné dans la publication actuelle, qui reste une contribution de recherche en cours d'évaluation par les pairs.

RecherchePaper
1 source
Graphes de scène 3D : défis ouverts et perspectives futures
2279arXiv cs.RO 

Graphes de scène 3D : défis ouverts et perspectives futures

Un article de synthèse intitulé "3D Scene Graphs: Open Challenges and Future Directions" (arXiv:2606.19383) vient d'être publié, proposant une revue unifiée et critique des graphes de scène 3D (3DSGs) pour l'IA spatiale. Les 3DSGs sont des représentations qui combinent un ancrage géométrique avec des abstractions sémantiques et relationnelles de l'environnement: en clair, une carte structurée où les objets, leurs propriétés et leurs relations spatiales sont encodés dans un graphe hiérarchique. Le survey couvre leurs applications dans la manipulation robotique, la navigation autonome, la planification de tâches et la compréhension de scène. Les auteurs formalisent une définition commune, analysent les choix de modélisation (attributs de noeuds et d'arêtes, structure hiérarchique, représentations dynamiques, extensions tenant compte des affordances), puis examinent les pipelines de construction à partir de données sensorielles brutes et les stratégies d'évaluation, de la qualité intrinsèque du graphe jusqu'aux performances applicatives. Un site compagnon est disponible à https://3dscenegraphs.com/. Ce survey arrive à un moment critique pour la robotique déployée en milieu industriel réel. Le constat central est celui d'une fragmentation dommageable: les différentes communautés (vision par ordinateur, robotique cognitive, planification symbolique) ont développé des formalismes incompatibles, des pipelines de construction distincts et des protocoles d'évaluation hétérogènes, ce qui rend la comparaison des méthodes quasi impossible et freine l'identification des hypothèses communes. Pour un intégrateur ou un décideur B2B, cela signifie concrètement qu'aucune solution 3DSG n'est encore directement transposable d'un système à l'autre sans retravailler la couche de représentation. Le survey ne prétend pas résoudre ce problème, mais pose les bases pour qu'une normalisation émerge, ce qui est un prérequis à un déploiement robuste en production. Les graphes de scène 3D ont gagné en popularité avec l'essor des architectures de type Vision-Language-Action (VLA) et des modèles de fondation pour la robotique, qui nécessitent des représentations du monde à la fois compactes et manipulables symboliquement. Des travaux comme ScanScribe, Hydra (MIT SPARK Lab) ou SceneGraphFusion ont posé des jalons distincts, sans consensus de facto. Les prochaines étapes identifiées par les auteurs incluent la gestion des scènes dynamiques et longue durée, l'évaluation task-level standardisée et l'intégration avec des planificateurs LLM. Le champ est encore exploratoire, mais il constitue un verrou clé pour les systèmes robotiques qui doivent raisonner sur leur environnement au-delà de la simple détection d'objets.

RecherchePaper
1 source
TASC : contrôle partagé adapté à la tâche pour la télémanipulation relationnelle
2280arXiv cs.RO 

TASC : contrôle partagé adapté à la tâche pour la télémanipulation relationnelle

Des chercheurs ont présenté TASC (Task-Aware Shared Control), un cadre de contrôle partagé pour la télémanipulation relationnelle, publié en preprint sur arXiv (arXiv:2509.10416v2, soumis initialement en septembre 2025). Le système assiste un opérateur humain pilotant un bras robotique à distance lors de tâches impliquant des relations spatiales entre objets : insérer une fiche dans une prise, poser un objet sur un support, aligner des composants. TASC infère l'intention de l'utilisateur au niveau de la tâche à partir des seules commandes de mouvement brutes, sans templates de tâches prédéfinis. Il construit dynamiquement un graphe d'interactions à vocabulaire ouvert depuis l'entrée visuelle, puis utilise un modèle de vision-langage (VLM) pour prédire les contraintes spatiales guidant l'assistance durant la saisie et l'interaction avec les objets. Des expériences en simulation et en environnement réel montrent une meilleure efficacité des tâches et un effort opérateur réduit par rapport aux méthodes existantes. Le code est disponible en open source sur GitHub. Le résultat le plus significatif est la généralisation zéro-shot : TASC fonctionne sur des objets et des tâches jamais vus à l'entraînement, là où les frameworks concurrents reposent typiquement sur des templates figés ou des bases d'objets préenregistrées. En inférant l'intention depuis le mouvement seul, sans capteurs de force ni signaux d'intention explicites, le système abaisse la barrière d'intégration pour les applications industrielles et médicales où l'instrumentation supplémentaire est coûteuse ou impraticable. L'usage d'un VLM pour le raisonnement sur les contraintes spatiales s'inscrit dans la lignée des architectures VLA émergentes, en ciblant spécifiquement la couche de compréhension de scène sans requérir un pipeline de génération d'actions end-to-end complet. Le contrôle partagé pour la téléopération robotique est un champ actif depuis les années 1990, mais la généralisation à des tâches relationnelles ouvertes reste un problème non résolu. Les approches concurrentes s'appuient sur des affordances prédéfinies ou sur l'imitation par apprentissage profond, notamment dans les travaux des groupes de Chelsea Finn et Sergey Levine. TASC demeure une contribution académique sans partenariat industriel ni déploiement terrain annoncé. Les marchés cibles naturels incluent la chirurgie robotisée, l'assemblage de précision en microfabrication, et la téléopération en environnements dangereux. La validation logique suivante serait une évaluation sur des plateformes commerciales comme les bras Universal Robots ou Franka, avec des opérateurs réels hors contexte laboratoire.

RecherchePaper
1 source
3D-DLP : apprentissage auto-supervisé de représentations de scènes 3D centrées sur les objets
2281arXiv cs.RO 

3D-DLP : apprentissage auto-supervisé de représentations de scènes 3D centrées sur les objets

Une équipe de chercheurs publie 3D-DLP (3D Deep Latent Particles), un modèle d'apprentissage auto-supervisé de représentations de scène centré sur les objets. À partir d'entrées RGB-D (couleur et profondeur combinées) ou volumétriques en voxels, le modèle décompose une scène en un ensemble de particules latentes 3D, chacune encodant trois attributs distincts : la position 3D du keypoint, les dimensions de la bounding box et des descripteurs d'apparence visuelle. L'entraînement repose sur un objectif de reconstruction end-to-end sans annotations manuelles, en étendant le cadre Deep Latent Particles (DLP) au domaine 3D. Le modèle génère également des cartes de segmentation par particule, lisibles directement. Des expériences sur données simulées et réelles sont présentées dans le preprint arXiv 2606.19451, avec le code open source disponible à l'adresse eubooks3003.github.io/3d-dlp. Pour la manipulation robotique, l'apport principal est une représentation de scène à la fois structurée et compacte. Les benchmarks internes montrent une amélioration par rapport à deux types de baselines : celles qui manquent d'information 3D explicite, et celles qui utilisent des représentations 3D denses (nuages de points complets, volumes de voxels) sans structure centrée sur les objets. Cette dernière catégorie est coûteuse en mémoire à l'échelle, ce que 3D-DLP contourne via sa paramétrisation par particules. L'espace latent est également manipulable : modifier les positions des particules avant décodage permet de synthétiser de nouvelles configurations de scène, une propriété utile pour la planification ou la simulation contrefactuelle en robotique. Le modèle s'inscrit dans le courant de l'apprentissage centré sur les objets, en alternative aux approches monolithiques comme les NeRF ou les Gaussian Splatting pour la représentation 3D de scènes. Il entre aussi en dialogue avec les architectures VLA (Vision-Language-Action), qui peinent encore à intégrer une géométrie 3D explicite et structurée. À ce stade, 3D-DLP reste un preprint académique sans validation industrielle ni intégration dans un pipeline robotique commercial, et les métriques de performance ne sont pas quantifiées précisément au-delà d'une comparaison qualitative aux baselines.

RechercheActu
1 source
CoLI : une plateforme reproductible pour l'apprentissage des robots continuum par impression 3D monolithique et téléopération isomorphe
2282arXiv cs.RO 

CoLI : une plateforme reproductible pour l'apprentissage des robots continuum par impression 3D monolithique et téléopération isomorphe

Une équipe de chercheurs a publié sur arXiv (preprint arXiv:2606.20389, juin 2026) la plateforme CoLI, un robot continu open-source conçu pour abaisser les barrières à la recherche en robotique souple. L'architecture repose sur une fabrication par impression 3D multi-matériaux qui produit le bras comme une structure monolithique conforme, éliminant les étapes d'assemblage complexes qui freinaient jusqu'ici la reproductibilité des expériences. Le contrôle s'effectue via une interface de télé-opération isomorphe établissant une correspondance directe au niveau des actionneurs, ce qui supprime le besoin de modélisation cinématique explicite et garantit un mapping sans singularité. La plateforme intègre également la prise en charge de l'apprentissage par imitation pour le contrôle autonome. Les auteurs ont validé le système sur des tâches de manipulation, dont les résultats sont présentés dans le preprint. Le problème central que CoLI attaque est celui de la reproductibilité : dans la littérature sur les robots continus, les designs sont souvent trop spécifiques au laboratoire d'origine pour être dupliqués, ce qui rend la comparaison algorithmique quasiment impossible. En produisant le bras en une seule pièce imprimée et en éliminant la modélisation cinématique au profit d'un mapping actionneurs-actionneurs, la plateforme devient accessible aux équipes ML qui ne sont pas spécialistes de la mécanique des structures souples. C'est un changement de posture : au lieu d'exiger que les chercheurs maîtrisent la mécanique des continuums avant d'entraîner le moindre modèle, CoLI met la couche matérielle au service du pipeline d'apprentissage. La portée reste cependant à confirmer : le preprint ne fournit pas de métriques de cycle time ni de payload sous charge réelle, et les tâches de manipulation évaluées ne sont pas détaillées dans l'abstract. Les robots continus suscitent un intérêt croissant pour des applications en espaces confinés (chirurgie, inspection), mais le champ souffre d'un déficit de benchmarks communs comparable à ce que ImageNet a représenté pour la vision. CoLI s'inscrit dans une tendance plus large de plateformes open-source reproductibles, dans la lignée de projets comme Lerobot (Hugging Face) ou UFactory xArm pour les bras rigides. Côté positionnement, les robots continus n'ont pas encore de concurrent direct sur le segment "reproductible et learning-ready" : les acteurs industriels comme Festo (bionic cobot) ou Continuum Robotics Laboratory (Toronto) travaillent sur des designs propriétaires. Les prochaines étapes naturelles seraient la mise à disposition des fichiers de fabrication, la constitution d'un benchmark de tâches standardisées, et l'intégration avec des frameworks comme Lerobot ou ROS 2 pour accélérer l'adoption communautaire.

RecherchePaper
1 source
Belt-Finger : une pince souple à courroie abordable pour la manipulation dextérique en main
2283arXiv cs.RO 

Belt-Finger : une pince souple à courroie abordable pour la manipulation dextérique en main

Des chercheurs présentent Belt-Finger, un module de doigt à double courroie souple conçu comme une extension directe des préhenseurs parallèles standards. Le mécanisme ajoute trois degrés de liberté (DDL) en prise, soit translation, tangage (pitch) et roulis (roll), tout en conservant l'ouverture et la fermeture classiques du préhenseur. Couplé à un bras robotique, l'ensemble atteint 10 DDL contrôlables simultanément via une interface de télé-opération à matériel réduit. Les auteurs ont validé l'approche sur une batterie de tâches difficiles à travers trois pipelines distincts : un contrôleur prédictif par modèle (MPC) pour objets connus, un système de télé-opération temps réel, et des politiques entraînées par apprentissage. La conception est délibérément épurée, orientée vers la fabrication bon marché et l'intégration directe sur les cellules robotiques existantes. La preprint est disponible sur arXiv (2606.20193) et n'a pas encore subi de revue par les pairs. L'apport industriel est concret : les préhenseurs parallèles dominent le marché automatisé parce qu'ils sont simples, robustes et peu coûteux, mais leur incapacité à manipuler un objet en prise oblige le robot à effectuer de larges mouvements bras pour repositionner une pièce, ce qui consomme du temps de cycle et exclut les espaces confinés. Belt-Finger attaque ce verrou sans forcer une refonte d'installation. Pour un intégrateur, cela signifie potentiellement réduire les étapes de manipulation et les fixations auxiliaires dans une cellule sans changer de robot ni de contrôleur. La démonstration que des politiques entraînées fonctionnent avec ce mécanisme suggère également une compatibilité avec les pipelines d'apprentissage par imitation (Learning from Demonstration) en plein essor dans la recherche. Le problème de la dextérité en prise est central en robotique depuis des décennies. Les préhenseurs multi-doigts à haute DDL, comme ceux de Shadow Robotics, SCHUNK ou Robotiq, offrent plus de capacités mais restent coûteux, complexes à contrôler et fragiles en environnement industriel. Belt-Finger se positionne explicitement comme une voie intermédiaire : un upgrade, pas un remplacement. Le résumé ne mentionne ni institution, ni partenaire industriel, ni financement, ni timeline de commercialisation. Les prochaines étapes naturelles seraient une validation sur cycles répétés en conditions réelles et une comparaison quantitative de temps de cycle face à un préhenseur standard sur des tâches représentatives.

RecherchePaper
1 source
Tutorat bidirectionnel pour l'apprentissage moteur développemental en robotique : dynamiques co-développées et stabilité
2284arXiv cs.RO 

Tutorat bidirectionnel pour l'apprentissage moteur développemental en robotique : dynamiques co-développées et stabilité

Une équipe de chercheurs a publié sur arXiv (référence 2606.19728, juin 2026) une étude portant sur l'apprentissage moteur développemental des robots, inspirée de la manière dont les nourrissons acquièrent leurs compétences motrices via l'interaction avec leurs aidants. L'expérience centrale implique un robot humanoïde physique chargé d'une tâche de manipulation d'objets, soumis à deux protocoles distincts : d'abord une interaction humain-robot en temps réel, puis un tuteur IA doté d'un mécanisme d'intervention adaptatif conçu pour reproduire la même dynamique bidirectionnelle dans des conditions plus contrôlées. Le système d'apprentissage repose sur un réseau de neurones fondé sur le principe de l'énergie libre (free-energy principle, FEP), étendu par un mécanisme de rejeu génératif (générative replay) permettant un apprentissage stable séquence par séquence à partir d'épisodes tutorés uniques. L'hypothèse centrale, vérifiée dans les deux configurations, est que le tutorat bidirectionnel produit des comportements plus cohérents et une généralisation par étapes (stage-wise generalization), le robot requérant progressivement moins de guidage externe. Cela tranche avec le paradigme dominant de l'apprentissage par démonstration (learning from demonstration, LfD), où le robot reçoit passivement des flux de téléopération sans que ses expériences passées contraignent la dynamique d'interaction. Pour les intégrateurs et ingénieurs roboticiens, l'implication est concrète : les stratégies d'entraînement actuelles, largement fondées sur des démonstrations unidirectionnelles comme celles utilisées par Figure, Tesla Optimus ou Physical Intelligence, pourraient négliger un levier important de cohérence comportementale et de robustesse à la distribution. Ce travail s'inscrit dans la tradition de la robotique développementale, un champ qui emprunte aux sciences cognitives du développement pour concevoir des agents capables d'apprentissage progressif et socialement ancré. Il faut toutefois nuancer : il s'agit d'un preprint arXiv non encore évalué par les pairs, réalisé sur un robot unique dans des conditions expérimentales contrôlées, sans déploiement industriel ni partenariat commercial annoncé. La prochaine étape naturelle serait de tester la scalabilité du protocole sur plusieurs morphologies de robots et sur des tâches plus complexes, afin d'évaluer si la dynamique bidirectionnelle conserve ses avantages au-delà de la manipulation d'objets simples.

RecherchePaper
1 source
pdSTL : logique temporelle de signal probabiliste et différentiable pour les systèmes stochastiques
2285arXiv cs.RO 

pdSTL : logique temporelle de signal probabiliste et différentiable pour les systèmes stochastiques

Des chercheurs ont déposé en juin 2026 sur arXiv pdSTL (probabilistic differentiable Signal Temporal Logic), un cadre formel pour robots autonomes opérant dans des environnements stochastiques. Le système étend la Signal Temporal Logic (STL), formalisme standard pour spécifier des propriétés de sécurité et temporelles dans les systèmes dynamiques, en combinant deux capacités jusqu'ici dissociées : la différentiabilité permettant l'optimisation de trajectoires par gradient, et la sémantique probabiliste appliquée aux trajectoires de croyances (belief trajectories), c'est-à-dire la distribution d'états estimée à partir de capteurs bruités. pdSTL calcule des bornes de satisfaction conservatrices via des sémantiques à intervalles propagées compositionnellement, et formule l'évaluation de la robustesse temporelle comme un dépliage récurrent de style LSTM pour une surveillance en temps linéaire. Les expériences couvrent des scénarios simulés d'évitement d'obstacles et de changement de voie, ainsi que des vols réels avec le nano-drone Crazyflie de Bitcraze soumis à des perturbations aérodynamiques. L'apport central est de résoudre simultanément deux lacunes concurrentes des approches existantes. La STL différentiable déterministe (dSTL) permettait l'optimisation par gradient mais supposait des états connus avec certitude, ignorant le bruit de capteur et la dynamique stochastique. Les extensions probabilistes de la STL existantes offraient des garanties formelles mais sacrifiaient la différentiabilité, les rendant incompatibles avec les pipelines d'apprentissage modernes. pdSTL unifie les deux, et les auteurs rapportent qu'il surpasse significativement dSTL pour le maintien des marges de sécurité sous incertitude réelle. Pour un ingénieur robotique ou un intégrateur travaillant sur la navigation autonome, cette combinaison de garanties probabilistes formelles et d'optimisabilité par gradient constitue une brique potentielle pour des spécifications de sécurité certifiables en conditions opérationnelles. La STL est un outil standard de la vérification formelle de systèmes cyber-physiques depuis les années 2010, et ses extensions différentiables avaient déjà intéressé la communauté robotique pour l'optimisation de trajectoires. Le Crazyflie, drone open-source de la société suédoise Bitcraze, est une plateforme académique de référence appréciée pour sa dynamique instable, qui en fait un test exigeant pour toute approche de contrôle robuste. Ce travail est pour l'instant un preprint non relu par les pairs, sans code public annoncé et sans métriques quantitatives précises dans le résumé, ce qui invite à la prudence face aux affirmations de surperformance. Les équipes de motion planning sous incertitude dans les secteurs drones, véhicule autonome et manipulation industrielle sont les premières concernées par une éventuelle implémentation.

RecherchePaper
1 source
Co-policy : création musicale humain-robot en temps réel
2286arXiv cs.RO 

Co-policy : création musicale humain-robot en temps réel

Des chercheurs proposent Co-policy, un framework de co-création musicale humain-robot présenté comme preprint sur arXiv (référence 2606.19914). Le système articule trois blocs fonctionnels indépendants : un ancrage sémantique pré-inférence associé à un planificateur multimodal Qwen-VL fine-tuné (baptisé F-Qwen), chargé de convertir la parole, des séquences musicales jouées en direct et les observations visuelles en plans de co-création structurés ; une politique visuomotrice à mélange gaussien (GMP, Gaussian-Mixture Visuomotor Policy), implémentée comme une mixture-density network conditionnelle qui produit des actions robotiques multimodales en un seul passage forward ; et un module de variation musicale opérant sous contraintes à la fois musicales et physiques. Les expériences ont été menées sur un robot réel jouant des carillons (chimes), avec ablations et évaluation experte. Co-policy surpasse les baselines à politique de diffusion sur trois métriques : alignement d'intention, précision d'exécution et fréquence de réponse. Ce qui distingue l'approche des systèmes de lecture robotique classiques, c'est que le robot ne se contente pas de reproduire des notes prédéfinies par l'utilisateur : il génère des réponses musicales complémentaires, en temps réel, en tenant compte du contexte auditif et visuel. Pour un intégrateur ou un décideur R&D, c'est la démonstration que les VLA (Vision-Language-Action models) peuvent s'étendre à des tâches créatives ouvertes, pas uniquement à des tâches de manipulation industrielle ou domestique. La séparation explicite entre couche sémantique (LLM multimodal) et couche d'exécution (GMP en forward pass unique) est aussi une réponse directe au problème de latence qui pénalise les architectures de diffusion dans les contextes temps réel. Le recours à Qwen-VL open-source comme planificateur, fine-tuné plutôt qu'utilisé tel quel, facilite la reproductibilité de la recherche. Co-policy s'inscrit dans un mouvement plus large qui cherche à ancrer physiquement les modèles génératifs, au-delà du contenu numérique désincorporé. La diffusion policy, popularisée notamment par les travaux de Chi et al. (2023), reste la référence dominante pour les politiques visuomotrices génériques, et c'est contre cette baseline que Co-policy se mesure. Aucun acteur commercial, ni français ni européen, n'est impliqué dans ce travail académique. Les suites naturelles identifiées par les auteurs incluent l'extension à d'autres instruments et à des configurations multi-robots ; aucun calendrier ni partenariat industriel n'est annoncé à ce stade.

RechercheOpinion
1 source
HAVE : un vérificateur sensible à l'historique qui raisonne sur les interactions passées
2287arXiv cs.RO 

HAVE : un vérificateur sensible à l'historique qui raisonne sur les interactions passées

Des chercheurs présentent HAVE (History-Aware VErifier), une architecture de contrôle robotique publiée sur arXiv (2509.00271v2) et soumise à CoRL 2025. Le principe central est une dissociation explicite entre deux composants distincts : un générateur diffusif non conditionnel qui propose plusieurs actions candidates, et un vérificateur apprenant à sélectionner la meilleure action en raisonnant sur l'historique des interactions passées. Les expériences couvrent des environnements simulés et réels incluant des objets articulés, des portes à comportement multimodal (poussée ou tirée selon le contexte), et des scénarios de saisie d'objets sur surfaces inégales. Aucun chiffre de déploiement industriel ni de partenaire commercial n'est mentionné : il s'agit d'une contribution académique pure. L'intérêt de HAVE réside dans son diagnostic du problème plutôt que dans la solution elle-même. Les modèles génératifs récents, y compris ceux conditionnés sur l'historique d'actions, peinent à résoudre les ambiguïtés visuelles lors de la manipulation : un objet dont l'état interne est incertain (tiroir bloqué, poignée bimode) génère des échecs répétés même avec des VLA sophistiqués. Séparer génération et vérification permet au vérificateur de capitaliser sur les tentatives précédentes, là où un seul réseau intégré lisse ces signaux. Les auteurs fournissent une analyse théorique montrant que l'ajout d'un vérificateur améliore statistiquement la qualité d'action espérée, ce qui est moins courant dans la littérature robotique que les seules validations empiriques. Pour un intégrateur industriel, cela suggère une voie pour traiter les cas limites sans collecter massivement de données étiquetées sur chaque configuration ambiguë. HAVE s'inscrit dans la vague des politiques diffusives initiée par Diffusion Policy (Chi et al., 2023) et étendue par pi-0 de Physical Intelligence, qui applique ce paradigme aux robots humanoïdes. Face aux approches concurrentes comme GR00T N2 de NVIDIA ou OpenVLA, qui misent sur le conditionnement fort des transformeurs vision-langage-action, HAVE choisit une architecture modulaire où la vérification est un citoyen de première classe et non une post-correction. Aucun acteur européen ou français n'est impliqué dans cette publication. Les prochaines étapes naturelles seraient des tests sur des manipulateurs industriels en conditions non structurées et une intégration avec des modèles de fondation plus larges pour le raisonnement contextuel.

RechercheOpinion
1 source
Localisation relative d'une équipe de robots mobiles sans infrastructure ni contrôle centralisé, par mesures de distance
2288arXiv cs.RO 

Localisation relative d'une équipe de robots mobiles sans infrastructure ni contrôle centralisé, par mesures de distance

Une équipe de chercheurs publie sur arXiv (2606.20365) un algorithme décentralisé de localisation relative pour flottilles de robots mobiles, conçu pour fonctionner sans infrastructure fixe et sans contrainte imposée sur les trajectoires. La méthode repose uniquement sur l'odométrie locale de chaque agent, des mesures de distance inter-robots (ranging UWB ou radio) et une communication courte portée, trois capacités déjà disponibles sur la quasi-totalité des plateformes AMR commerciales. Le coeur de l'approche est un cadre bayésien multi-hypothèses qui maintient simultanément l'ensemble des configurations spatiales compatibles avec les observations, assurant la robustesse dans les phases où le système est transitoirement non-observable. Ce qui distingue cette contribution de la majorité des solutions existantes est l'abandon de la contrainte d'observabilité par contrôle de mouvement. La plupart des algorithmes de localisation coopérative exigent que les robots exécutent des trajectoires spécifiques pour lever l'ambiguïté sur leurs positions relatives, une hypothèse incompatible avec des missions opérationnelles réelles où chaque robot suit son propre planning. Ici, les agents se déplacent librement et l'algorithme maintient la cohérence des estimées grâce au partage d'information entre voisins, y compris dans des topologies de communication partiellement connectées. Pour un intégrateur de flottilles en entrepôt ou en milieu non structuré, cela signifie aucune balise UWB à déployer, aucun protocole de mouvement contraint, et une mise en service réduite à la configuration logicielle. La localisation coopérative sans ancre fixe est un problème ouvert depuis plusieurs décennies, généralement traité soit par des systèmes centralisés avec beacons (solutions Pozyx, Sewio en contexte industriel), soit par des approches décentralisées nécessitant une coordination des déplacements. Ce travail s'inscrit dans la lignée des recherches sur les swarms décentralisés, avec un positionnement explicitement orienté déploiement rapide en environnements non équipés. Il faut noter que l'article reste à ce stade un preprint arXiv sans validation expérimentale détaillée publiée : les performances réelles sur des flottilles physiques en conditions de terrain, notamment la précision des estimées et le comportement en cas de perte de communication prolongée, restent à démontrer indépendamment.

RecherchePaper
1 source
Commande prédictive convexe robuste avec garanties d'évitement de collision pour bras manipulateurs
2289arXiv cs.RO 

Commande prédictive convexe robuste avec garanties d'évitement de collision pour bras manipulateurs

Des chercheurs présentent dans un pré-print arXiv (référence 2508.21677, troisième révision) une méthode de contrôle par modèle prédictif (MPC) conçue pour les bras manipulateurs industriels à 6 degrés de liberté (DOF) opérant dans des environnements encombrés. L'approche repose sur deux composantes : un tube MPC robuste, qui encapsule les trajectoires dans un tube garanti même en présence d'incertitudes paramétriques du modèle, et un algorithme de planification de corridor qui génère des chemins exemptes de collisions. La formulation qui en résulte est convexe, propriété rare dans ce domaine, ce qui permet une résolution rapide et compatible avec des boucles de contrôle temps réel. Validée uniquement en simulation, la méthode surpasse des approches de référence en tolérant des niveaux plus élevés d'incertitude de modèle tout en maintenant des vitesses d'exécution supérieures. Aucun déploiement matériel ni partenaire industriel n'est mentionné à ce stade. La portée industrielle de ce travail tient à un problème concret : les incertitudes de modèle dans les manipulateurs (charge variable, usure, flexibilité des joints) imposent aujourd'hui des limites de vitesse conservatives dans les cellules robotisées, ce qui réduit la cadence. Une méthode MPC offrant des garanties formelles de sécurité tout en réduisant ce conservatisme permettrait aux intégrateurs de pousser les vitesses nominales sans compromettre la conformité aux normes de sécurité (ISO 10218). La formulation convexe est ici un point-clé : elle rend le MPC compatible avec des solveurs rapides type QP (quadratic programming), là où les approches non-convexes nécessitent souvent des relaxations coûteuses ou des horizons de prédiction courts. Le contrôle prédictif pour manipulateurs est un axe de recherche actif depuis une décennie, avec des approches concurrentes incluant les MPC non-linéaires (via ACADO ou FORCES Pro), les méthodes basées sur les fonctions barrières de contrôle (CBF), ou encore les planificateurs par échantillonnage (MPPI). Ce travail se positionne sur la robustesse formelle et la rapidité de résolution, deux propriétés rarement combinées. La limite principale reste la validation purement simulée : le passage au réel (sim-to-real gap, flexibilité mécanique non modélisée, latences capteurs) n'est pas abordé. Les prochaines étapes naturelles seraient une validation sur hardware, par exemple sur un UR10 ou un KUKA LBR, et une extension à des horizons d'évitement dynamique face à des obstacles mobiles.

RecherchePaper
1 source
Apprentissage par auto-imitation temporelle
2290arXiv cs.RO 

Apprentissage par auto-imitation temporelle

Un preprint arXiv déposé fin juin 2026 (référence 2606.19752) présente TSIL (Temporal Self-Imitation Learning), un cadre d'apprentissage par renforcement pour les politiques de manipulation robotique sur longues séquences d'actions. Le principe : identifier, au fil de l'entraînement, les trajectoires réussies les plus rapides, puis les convertir en supervision réutilisable pour les itérations suivantes via des cibles temporelles adaptatives conditionnées par la configuration ("configuration-conditioned adaptive temporal targets") et une réimitation pondérée par l'efficacité relative de chaque comportement. La méthode a été évaluée sur 15 tâches de manipulation longue séquence distinctes ; aucun déploiement sur robot physique n'est annoncé dans le papier. L'apport adresse un défaut bien documenté des approches par récompense dense (reward shaping) : un agent peut satisfaire le signal de récompense tout en produisant des comportements lents ou redondants, puisque rien ne pénalise explicitement l'inefficacité temporelle, et les rares séquences vraiment rapides tendent à être oubliées au fil de l'entraînement. TSIL propose de traiter le temps d'exécution lui-même comme signal d'auto-supervision scalable, complémentaire aux récompenses manuelles. Sur les 15 tâches testées, la méthode améliore simultanément l'efficacité d'apprentissage global, l'efficacité de complétion de tâche, la réintégration des comportements rapides et la robustesse aux instabilités d'entraînement. Pour les équipes cherchant à réduire l'ingénierie de récompense sur des tâches industrielles complexes, le signal est pertinent, mais il s'agit d'un résultat de recherche en simulation, non d'un produit validé terrain. TSIL s'inscrit dans la lignée de SAIL (Self-Imitation Learning, Oh et al. 2018) et de HER (Hindsight Experience Replay), deux méthodes exploitant les expériences passées pour guider l'apprentissage par renforcement, en y ajoutant une dimension temporelle explicite absente des approches précédentes. La manipulation longue séquence reste un verrou majeur pour les bras industriels et les humanoïdes ; des acteurs comme Physical Intelligence (Pi-0), Figure AI ou les équipes RL de Boston Dynamics travaillent sur des problématiques similaires. Ce preprint, non encore évalué par des pairs, ne mentionne ni partenaire industriel ni horizon de transfert sur robot réel. La prochaine étape logique sera de tester la robustesse de l'approche hors simulation, là où le sim-to-real gap remet généralement en cause les gains obtenus en environnement contrôlé.

RecherchePaper
1 source
Lier efficacement scènes réelles et données synthétiques pour la robotique cognitive et la vision par ordinateur
2291arXiv cs.RO 

Lier efficacement scènes réelles et données synthétiques pour la robotique cognitive et la vision par ordinateur

Des chercheurs ont soumis mi-juin 2026 un article préliminaire (preprint arXiv 2606.20272) portant sur la génération de données d'entraînement synthétiques liées à des scènes réelles pour les systèmes de vision IA appliqués à la robotique cognitive. Le travail couvre plusieurs familles de méthodes : l'analyse sémantique d'environnement, l'estimation de pose 6D et l'estimation de pose de préhension (grasping pose estimation), deux capacités centrales pour permettre à un robot de localiser et saisir des objets dans des scènes non contrôlées. L'objectif déclaré est de réduire le fossé de domaine (domain gap) entre les environnements de simulation utilisés pour générer des données d'entraînement et les conditions du monde réel, en liant explicitement les deux lors de la phase de génération. Les auteurs présentent ce travail comme en cours ("work in progress") et ne publient pas encore de résultats quantitatifs ni de benchmarks comparatifs. Le domain gap est l'un des verrous techniques les plus structurants pour le déploiement industriel de robots perceptifs. Les modèles de vision entraînés uniquement sur des données synthétiques tendent à échouer en environnements réels à cause des variations d'éclairage, de texture et de géométrie non reproduites en simulation. Une approche qui ancre la génération synthétique dans des scènes réelles captées (par exemple via reconstruction 3D ou relevé de profondeur) pourrait réduire ce biais sans le coût prohibitif de l'annotation manuelle à grande échelle, un goulot d'étranglement bien documenté pour les pipelines de vision industrielle. Si cette méthode est validée à l'échelle, elle représente un levier de productivité concret pour les intégrateurs déployant des solutions de pick-and-place ou de navigation en environnements variés. Le sim-to-real transfer mobilise depuis plusieurs années les principaux acteurs du secteur : NVIDIA a structuré sa plateforme Isaac Sim précisément pour produire des données synthétiques photoréalistes à grande échelle, Google DeepMind y investit dans ses travaux sur les modèles Vision-Language-Action comme RT-2, et Physical Intelligence a publié des résultats notables sur la généralisation en environnements réels avec π0. L'article soumis s'inscrit dans ce courant, mais reste à un stade amont : aucune implémentation publiée, aucun code disponible, aucun jeu de données de référence cité. La version finale, si elle présente des résultats sur des benchmarks reconnus comme le BOP Challenge, YCB-V ou LINEMOD, sera plus déterminante pour évaluer la contribution réelle de cette approche.

RecherchePaper
1 source
Les précommandes du robot humanoïde UBTECH U1 approchent 5 000 unités en 17 jours
2292Pandaily 

Les précommandes du robot humanoïde UBTECH U1 approchent 5 000 unités en 17 jours

En dix-sept jours à peine, UBTECH a enregistré près de 5 000 précommandes pour son robot humanoïde U1, depuis le lancement des préventes le 2 juin 2026. Au 18 juin, la boutique officielle de l'entreprise sur JD.com affichait plus de 4 600 réservations, pour une livraison prévue le 30 juin. Le U1 mesure 183 cm, pèse 42 kg et embarque 88 degrés de liberté ainsi qu'un modèle d'IA dédié à la compagnie émotionnelle. Il propose une personnalisation d'apparence multi-dimensionnelle, une connectivité Wi-Fi et une autonomie de 2 à 4 heures. L'appareil est commercialisé exclusivement auprès d'adultes, ciblant les citadins confrontés à l'isolement et les amateurs d'esthétiques subculturelles. Pour contextualiser l'ampleur de ce score : sur l'ensemble de l'année 2025, UBTECH n'avait vendu que 1 079 robots humanoïdes taille réelle. En parallèle, la société vise une capacité de production industrielle de 10 000 unités par an dès 2026 pour sa gamme B2B. Ces chiffres témoignent d'un changement de régime dans la filière humanoïde, mais méritent d'être lus avec précaution. Les précommandes ne sont pas des ventes livrées, et les métriques d'autonomie (2 à 4 heures) comme les fonctionnalités actuelles -- centrées sur la conversation plutôt que sur la manipulation physique -- posent des questions réelles sur la valeur d'usage. Cela dit, le signal commercial est réel : Deutsche Bank a révisé à la hausse sa prévision mondiale de livraisons de robots humanoïdes pour 2026, passant de 17 500 à près de 50 000 unités, dont environ 40 000 en provenance de Chine. Si ces volumes se confirment, ils valideraient le passage d'une phase de démonstration à une phase de déploiement à l'échelle, un seuil que beaucoup d'observateurs situaient encore à horizon 2028-2030. Le contexte sectoriel s'accélère sur tous les fronts. Unitree Robotics ambitionne de livrer entre 10 000 et 20 000 robots humanoïdes en 2026, contre environ 5 500 en 2025. AgiBot annonçait en mars 2026 avoir cumulé 10 000 robots embodied à usage général. Du côté des acteurs internationaux, Tesla a sorti les premières unités de production de l'Optimus Gen-3 de ses lignes, avec une montée en cadence prévue à Fremont dès le troisième trimestre 2026. BYD a confirmé développer des humanoïdes, et XPeng vise une production de masse au quatrième trimestre 2026. UBTECH, fondée en 2012 à Shenzhen et surtout connue pour ses robots éducatifs Alpha, opère ce pivot vers le grand public après des années de présence en B2B industriel. L'enjeu désormais est moins technologique que commercial : trouver l'équilibre entre maîtrise des coûts, définition claire des usages, et expérience utilisateur suffisante pour transformer une réservation en fidélité client.

Chine/AsieOpinion
1 source
Soutien politique et production de masse propulsent les ETF de robots humanoïdes à l'aube d'une phase critique
2293Pandaily 

Soutien politique et production de masse propulsent les ETF de robots humanoïdes à l'aube d'une phase critique

La Chine accélère sa stratégie dans la robotique humanoïde : le ministère de l'Industrie et des Technologies de l'Information (MIIT), en coordination avec la SASAC (Commission de supervision des actifs d'État), a fixé un objectif contraignant de plus de 10 000 unités humanoïdes déployées d'ici fin 2026, signalant un passage de l'incitation à la R&D vers une obligation de déploiement industriel. Sur le plan production, le Centre d'innovation en robotique humanoïde de Pékin a confirmé que le Tiangong 3.0 entrera en fabrication en série au second semestre 2026, avec des réductions de coûts attendues supérieures à 50 %. UBTECH a formalisé une coentreprise pour développer des puces d'intelligence incarnée, avec un capital enregistré de 100 millions de yuans. Côté chaîne d'approvisionnement, Wanma et Langxin Electric ont commencé des livraisons en volume de composants critiques. À l'international, GenesisAI, soutenu par l'ex-PDG de Google Eric Schmidt, a lancé son robot industriel Eno, tandis que Faraday Future affirme avoir livré 157 unités réparties sur quatre modèles. Dans ce contexte, l'ETF Robot d'Invesco Great Wall (code 159559), indexé sur le Guozheng Robot Industry Index (980022), affiche une exposition de plus de 73 % aux valeurs du secteur humanoïde, avec une allocation sectorielle dominée par les équipements mécaniques à 47,23 % (réducteurs, vis à billes, moteurs) et les équipements électriques à 14,68 %. Ce moment marque une inflexion structurelle : la Chine ne pilote plus la filière par subventions symboliques mais par objectifs de déploiement chiffrés et datés, ce qui force les intégrateurs et les acheteurs industriels à anticiper des volumes réels dès 2026. La maturité affichée de la chaîne d'approvisionnement, notamment autour des composants à haute valeur (actionneurs, chips embarqués), réduit un des principaux goulets d'étranglement identifiés lors des phases pilotes. Toutefois, il convient de rester prudent : l'article source est en grande partie un texte promotionnel pour le fonds 159559 lui-même, dont la performance de 60,81 % sur deux ans est mise en avant face aux 34,02 % du CSI 300. Les chiffres de déploiement restent des objectifs politiques, pas des confirmations de livraisons effectives, et les vidéos de démonstration des robots ne constituent pas une preuve de passage à l'échelle industrielle. La trajectoire de la robotique humanoïde chinoise s'inscrit dans un effort stratégique accéléré depuis 2023, avec des acteurs comme Unitree, AgiBot et UBTECH qui avancent en parallèle. À l'international, Tesla (Optimus Gen 3), Figure (Figure 03), Physical Intelligence (pi0), Agility Robotics et Boston Dynamics maintiennent une pression concurrentielle forte, principalement sur les cas d'usage logistique et manufacture. Le second semestre 2026 et l'année 2027 sont désignés comme la première fenêtre de réalisation de revenus réels pour le secteur, sous réserve que les objectifs de déploiement se confirment en commandes fermes plutôt qu'en annonces de pilotes.

Chine/AsieActu
1 source
Le robot Codey, adapté aux enfants, illustre l'avenir de l'AGI incarnée dans l'éducation et la santé
2294Interesting Engineering 

Le robot Codey, adapté aux enfants, illustre l'avenir de l'AGI incarnée dans l'éducation et la santé

Mind Children, une startup de Seattle, a présenté Codey, un robot humanoïde d'environ 90 centimètres de hauteur conçu pour les environnements publics comme les musées, hôtels et galeries d'art. Le robot embarque le framework Hyperon de SingularityNET, une plateforme d'intelligence artificielle générale (AGI) décentralisée, censée lui permettre de naviguer de façon autonome, de tenir des conversations et de prendre des décisions basiques sans téléopération humaine. Ses yeux lumineux hazel et ses animations faciales expressives visent à le rendre accessible, particulièrement aux enfants. Mind Children prévoit de conduire des études pilotes dans ces trois types de lieux dès 2026, avec une deuxième génération du robot annoncée pour 2027. La société a lancé une campagne de financement participatif et a levé à ce jour plus de 600 000 dollars sur un objectif d'un million. À court terme, l'équipe cible une capacité simple : permettre à Codey d'appuyer sur des boutons physiques, une étape significative dans le contexte de la manipulation. L'intérêt de Codey pour les décideurs B2B n'est pas tant dans ses capacités physiques actuelles, encore très limitées, que dans la démonstration d'une navigation autonome et d'une interaction conversationnelle sans supervision humaine temps réel dans des espaces ouverts et imprévisibles. C'est précisément le "demo-to-reality gap" que beaucoup de plateformes humanoïdes peinent encore à combler dans des contextes non structurés. Si les pilots 2026 confirment une robustesse opérationnelle réelle, cela ouvrirait un segment de marché distinct de la robotique industrielle: les environnements d'accueil, de soin et d'éducation, où la sécurité perçue et l'interaction naturelle priment sur le débit ou la précision de manipulation. Il convient néanmoins de nuancer: les vidéos publiées restent des démonstrations contrôlées, et aucune métrique de fiabilité opérationnelle sur durée longue n'a été communiquée. Mind Children s'appuie sur Hyperon, le framework AGI décentralisé de SingularityNET, l'organisation fondée par Ben Goertzel, figure historique de la recherche en AGI et co-créateur de Sophia, le robot humanoïde de Hanson Robotics. L'architecture décentralisée de Hyperon distribue les capacités de raisonnement, représentation de connaissance et calcul sur un réseau d'agents IA, à l'opposé des systèmes centralisés dominants. Dans le paysage concurrentiel, Codey se positionne loin des humanoïdes industriels comme Figure 03, Optimus Gen 3 d'Tesla ou Apollo d'Apptronik, et plus près de robots de service sociaux comme Pepper (SoftBank) ou ARI (PAL Robotics), avec une promesse de cognition plus adaptative. Aucun acteur français ou européen n'est directement impliqué dans ce projet. Les prochaines étapes dépendront des résultats des pilots 2026 et de l'atteinte du seuil de financement d'un million de dollars, conditions sine qua non pour enclencher la pré-série.

HumanoïdesOpinion
1 source
Une société américaine dévoile des humanoïdes et robots avec un nouvel écosystème pour l'intelligence incarnée
2295Interesting Engineering 

Une société américaine dévoile des humanoïdes et robots avec un nouvel écosystème pour l'intelligence incarnée

Faraday Future (FF), entreprise californienne principalement connue comme constructeur de véhicules électriques en difficulté, a présenté le 18 juin 2026 à son nouveau siège d'El Segundo (Californie) une gamme robotique baptisée "EAI Robot World", articulée autour de six séries de produits. La pièce maîtresse est le robot humanoïde Futurist, redessiné : 54 kg (14 % plus léger que son prédécesseur), 31 degrés de liberté (DOF), un couple au niveau du genou de 320 Nm et une vitesse de pointe annoncée à 17,7 km/h, alimenté par un double pack batterie promettant 6 heures d'autonomie. L'architecture logicielle repose sur un modèle Vision-Language-Action (VLA) couplé à un "World Model" pour la perception et la prise de décision autonome. Aucun tarif ni client n'ont été dévoilés pour le Futurist : FF a renvoyé au salon Automate 2026 à Chicago, le 22 juin. En revanche, le quadrupède FX Navi, 8 kg, 12 articulations motorisées, utilisant un smartphone (iOS ou Android) glissé dans un module tête comme unité de calcul, est disponible immédiatement à 1 990 dollars, ciblant la salle de classe et l'usage domestique. Deux formats supplémentaires ont été esquissés : Master Mini (~1 m, compétitions de robotique éducative) et Nova (~50 cm, robot compagnon enfant), sans date ni prix communiqués. La stratégie "one brain, multiple forms" de FF, qui consiste à partager une même couche d'intelligence VLA+World Model sur plusieurs facteurs de forme, est cohérente avec ce que font NVIDIA (GR00T N2) ou Physical Intelligence (pi-0) côté logiciel, et mérite d'être distinguée des approches produit unique. Toutefois, la prudence s'impose : les performances du Futurist (320 Nm, 17,7 km/h) sont comparables aux annonces récentes d'Unitree ou Figure AI, mais sans démonstration publique indépendante ni données de cycle réel, elles restent des chiffres de fiche technique. L'usage d'un smartphone comme cerveau du FX Navi réduit les coûts mais impose des contraintes de puissance de calcul qui limiteront les cas d'usage autonomes avancés. À ce stade, le Futurist est une annonce de produit, pas un déploiement ; le FX Navi, lui, est un produit livrable. Faraday Future porte un passif lourd : introduction en bourse via SPAC en 2021, multiples alertes de continuité d'exploitation, enquête de la SEC, et départ de son fondateur Jia Yueting dans le chaos. Ce pivot vers la robotique s'inscrit dans un mouvement plus large d'entreprises tech/EV cherchant un second souffle dans l'IA incarnée. Sur le segment humanoïde commercial, FF affronte Figure AI (Figure 03, déployé chez BMW), Tesla (Optimus Gen 3, production interne), Agility Robotics (Digit, partenariat Amazon), et en Europe Wandercraft ou Enchanted Tools, acteurs qui cumulent davantage de déploiements terrain. La prochaine échéance concrète est Automate 2026 le 22 juin, où FF devra fournir prix, volumes et clients réels pour le Futurist, faute de quoi l'annonce restera dans la catégorie teaser.

HumanoïdesOpinion
1 source
RealSense dévoile la caméra de profondeur D585 Pro, conçue nativement pour l'IA et la robotique
2296Robotics Business Review 

RealSense dévoile la caméra de profondeur D585 Pro, conçue nativement pour l'IA et la robotique

RealSense a présenté le D585 Pro à l'Automate 2026 (stand 12036), une caméra de profondeur à traitement IA embarqué destinée aux robots humanoïdes, aux AMR (robots mobiles autonomes), aux bras cobots et aux systèmes d'inspection industrielle. La commercialisation est prévue pour le premier trimestre 2027. Le capteur est construit autour d'un SoC propriétaire de cinquième génération intégrant un moteur de profondeur, un processeur ISP, un DSP, des accélérateurs IA dédiés et un ARM quadricœur. Les spécifications annoncées : champ de vision de 120x100°, 60 images par seconde à 1280x960, portée minimale inférieure à 15 cm en pleine résolution, portée maximale supérieure à 10 mètres, indice IP65 en standard sur chaque unité, connectivité GMSL2 et USB-C avec synchronisation matérielle. RealSense revendique une qualité de profondeur deux fois supérieure à sa génération précédente et une réduction du bruit doublée. À la livraison, le traitement de profondeur amélioré et la détection de personnes fonctionneront en bêta directement sur le SoC, sans charge CPU hôte. Des capacités supplémentaires, dont l'odométrie visuo-inertielle (VIO), la génération de grille d'occupation, la calibration automatique et la détection de visages, seront ajoutées via mises à jour SDK après disponibilité générale. Le D585 Pro cible deux limitations structurelles des caméras de profondeur actuelles en robotique : la plage proche et la dépendance au calcul hôte. En descendant à moins de 15 cm en pleine résolution, RealSense revendique un avantage de 2,5x sur le concurrent le plus proche, sans le nommer, ce qui ouvre des cas d'usage jusqu'ici difficiles à couvrir avec un seul capteur : picking en bac, inspection à courte portée, scan de rayonnages denses. Le flux RGB dual synchronisé, deux flux 30 FPS couleur et profondeur fusionnés sur caméra sans overhead CPU, est directement pertinent pour les pipelines VLA dont dépendent des systèmes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui requièrent une perception couleur-profondeur synchronisée. Le modèle logiciel évolutif, où de nouvelles capacités arrivent par SDK sans remplacement matériel, est un changement de paradigme commercial notable dans un secteur où les cycles de qualification hardware sont longs et coûteux pour les intégrateurs. RealSense est une marque historiquement liée à Intel, qui avait progressivement retiré ses investissements dans la perception 3D avant de céder l'activité. La société s'est repositionnée sous direction indépendante, avec Nadav Orbach comme CEO. Elle évolue dans un marché sous forte pression concurrentielle : Luxonis (OAK-D), Orbbec, Stereolabs (ZED X), et des acteurs industriels comme Photoneo ou SICK occupent des segments adjacents. La promesse d'un capteur unique couvrant 15 cm à 10 m, utilisable en intérieur comme en extérieur à 60 FPS avec IA embarquée, est techniquement ambitieuse. Aucun partenaire de déploiement n'a été nommé publiquement à ce stade, et les performances annoncées reposent sur des données fabricant non validées par des tiers indépendants. La livraison effective au premier trimestre 2027 constituera le vrai test de maturité de la plateforme.

InfrastructureOpinion
1 source
Richtech Robotics lance un flux en direct pour son humanoïde ADAM propulsé par l'IA
2297Robotics Business Review 

Richtech Robotics lance un flux en direct pour son humanoïde ADAM propulsé par l'IA

Richtech Robotics a lancé le 18 juin 2026 une plateforme de diffusion en continu, disponible 24h/24 et 7j/7, permettant à n'importe quel internaute d'interagir en temps réel avec son robot ADAM. Contrairement à une démonstration vidéo classique, le dispositif invite les utilisateurs à poser des questions et à soumettre des tâches au robot en direct. ADAM repose sur la plateforme NVIDIA Isaac et embarque un module de calcul NVIDIA Jetson Thor pour le traitement onboard. L'entreprise a déjà déployé le robot dans plusieurs environnements commerciaux : service de boissons au Kennedy Space Center en Floride, préparation de nouilles au salon National Restaurant Association en mai 2026, et opération de barista à Times Square depuis avril 2026. Ce même mois, Richtech a référencé ses systèmes robotiques et ses services de données sur le Microsoft Marketplace pour Azure, et a signé un accord de distribution européen avec la société néerlandaise NewConsultancy B.V. La semaine prochaine, l'entreprise exposera son robot humanoïde industriel Dex au stand 2088, ainsi qu'un nouveau jack à palettes autonome piloté par IA. La démarche du livestream permanent est moins anodine qu'elle n'y paraît. Dans un secteur où le fossé entre démonstration contrôlée et déploiement réel (le fameux "demo-to-reality gap") reste la critique principale adressée aux acteurs humanoïdes, exposer un robot à des interactions non scriptées et continues constitue un test de robustesse en conditions réelles, public et permanent. Phil Zheng, directeur des opérations, annonce que "les réponses et mouvements plus naturels deviendront plus courants d'ici un an", une déclaration à vérifier à l'aune des performances observables sur le flux. La stratégie de "robot influencer" relève clairement du marketing, mais la transparence opérationnelle 24/7 représente une forme de validation externe que les fiches techniques ne peuvent pas offrir. Pour les intégrateurs et décideurs B2B, c'est aussi un signal sur le niveau de maturité atteint par les modèles vision-langage-action (VLA) dans des contextes d'interaction non structurée. Fondée en 2016 à Las Vegas, Richtech se positionne sur trois segments : industrie, commerce, et services de données. L'entreprise a acquis un entrepôt de 7 370 m² à Las Vegas pour développer son infrastructure IA. ADAM n'est pas un humanoïde de travail lourd, il cible l'hôtellerie, la restauration et l'accueil, là où Figure (Figure 02), Apptronik (Apollo) ou Agility Robotics (Digit) visent la logistique et la manufacture. Le lancement de Dex marque un pivot vers l'industriel, en réponse directe à cette concurrence. L'ancrage sur Azure via Microsoft Marketplace ouvre un modèle data-as-a-service qui différencie Richtech au-delà du hardware. Les prochaines étapes à surveiller : les métriques de fiabilité sur le livestream à long terme, et les conditions réelles du déploiement européen via NewConsultancy.

HumanoïdesOpinion
1 source
Le Massachusetts attribue 2 millions de dollars à six entreprises locales de robotique
2298Robotics & Automation News 

Le Massachusetts attribue 2 millions de dollars à six entreprises locales de robotique

L'administration Healey-Driscoll du Massachusetts et l'Innovation Institute, division du Massachusetts Technology Collaborative (MassTech), ont annoncé l'attribution de près de 2 millions de dollars à six entreprises robotiques locales dans le cadre du Massachusetts Robotic Digital Twin Initiative. Ce programme vise à accélérer les trajectoires de commercialisation pour les développeurs de matériel robotique en élargissant leur accès aux technologies de jumeau numérique. Les six bénéficiaires n'ont pas été identifiés dans la version disponible de l'annonce. Ce financement public cible un goulet d'étranglement réel dans la filière robotique : le coût et la complexité du développement par simulation avant déploiement physique. Les jumeaux numériques permettent aux fabricants de matériel de tester, valider et itérer sur leurs systèmes en environnement virtuel, réduisant les cycles de prototypage et les risques de sim-to-real gap. Pour des PME hardware, l'accès subventionné à ces outils peut représenter un levier de compétitivité significatif face aux grands groupes qui les déploient en interne depuis plusieurs années. Le Massachusetts est historiquement l'un des écosystèmes robotiques les plus denses des États-Unis, avec une concentration autour de Boston (MIT CSAIL, Boston Dynamics, Robust AI, iRobot). MassTech opère plusieurs programmes d'aide à l'innovation manufacturière et robotique depuis les années 2010. Ce programme s'inscrit dans une logique de politique industrielle étatique visant à maintenir l'avantage compétitif local face à la montée en puissance de clusters robotiques en Californie (Agility Robotics, Figure, 1X) et en Asie. Les détails sur les entreprises sélectionnées et les projets financés restent à préciser.

BusinessOpinion
1 source
La configuration des capteurs est déterminante : une évaluation systématique du SLAM multimodal sur des robots quadrupèdes
2299arXiv cs.RO 

La configuration des capteurs est déterminante : une évaluation systématique du SLAM multimodal sur des robots quadrupèdes

Des chercheurs publient sur arXiv (réf. 2606.19067) une évaluation systématique de méthodes SLAM (Simultaneous Localization and Mapping) appliquées aux robots quadrupèdes, en s'appuyant sur le dataset GrandTour enregistré sur un ANYmal D d'ANYbotics. Trois familles d'approches sont comparées : SLAM visuel pur, visuel-inertiel (VIO), et LiDAR-visuel-inertiel. L'étude isole trois variables matérielles : modalité caméra (monoculaire, stéréo, RGB-D), type d'obturateur (global shutter vs rolling shutter), et qualité de l'IMU. Résultats principaux : les configurations stéréo surpassent systématiquement le monoculaire et le RGB-D en précision de localisation ; les caméras à obturateur global réduisent significativement les échecs de tracking liés au mouvement ; et, point contre-intuitif, l'intégration d'une IMU standard peut dégrader les performances des frameworks principalement visuels sous les dynamiques agressives de la locomotion quadrupède. Les robots à pattes génèrent des perturbations sensorielles que les plateformes à roues ou les drones ne produisent pas à la même intensité : chocs d'impact au sol à chaque appui, vibrations mécaniques haute fréquence dans la structure, rotations angulaires rapides lors des corrections de posture. Ces phénomènes dégradent les pipelines de perception conçus pour des dynamiques plus lisses. L'enseignement clé pour les intégrateurs : le choix matériel conditionne la robustesse avant même le choix algorithmique. Que l'IMU standard puisse activement nuire à la perception visuelle, plutôt que simplement ne pas l'améliorer, remet en question la pratique courante d'ajouter une centrale inertielle bas de gamme par défaut dans un payload. Pour un responsable technique évaluant un quadrupède pour l'inspection d'infrastructure, l'étude fournit des critères de sélection hardware directement actionnables. L'ANYmal D, développé par ANYbotics (spin-off de l'ETH Zurich), est l'une des plateformes quadrupèdes les plus déployées en inspection industrielle, notamment dans le secteur pétrolier et gazier. Le SLAM visuel-inertiel a été largement validé sur drones et robots à roues, mais sa transposition aux systèmes à pattes reste un chantier de recherche actif. Les équipes travaillant sur Boston Dynamics Spot, Unitree B2 ou les plateformes d'Agility Robotics affrontent les mêmes contraintes d'embodiment. L'article formule des recommandations concrètes pour la constitution de payloads capteurs sur systèmes agiles, directement exploitables par les intégrateurs définissant les prochaines itérations de ces plateformes.

RecherchePaper
1 source
ROBOSHACKLES : un jeu de données de sécurité pour la prévention des blessures humaines dans les modèles fondation incarnés
2300arXiv cs.RO 

ROBOSHACKLES : un jeu de données de sécurité pour la prévention des blessures humaines dans les modèles fondation incarnés

Une équipe de chercheurs publie ROBOSHACKLES, un jeu de données de 10 000 clips vidéo robotiques conçu pour évaluer la sécurité des modèles de fondation embarqués (EFMs, Embodied Foundation Models) face aux risques de blessures humaines. Disponible sur HuggingFace, le dataset est construit à partir d'observations réelles du corpus DROID, un jeu de téléopération robotique existant. Le pipeline suit quatre étapes : compréhension de scène, édition d'image orientée dangers, génération de prompts temporels décrivant l'évolution attendue, puis synthèse en un seul passage via le modèle vidéo Wan2.7. Les clips couvrent six catégories de risques : deux de dommages directs (contact physique avec un humain) et quatre de dommages indirects (situations domestiques dangereuses créées par le robot). L'évaluation de six EFMs représentatifs selon un critère de refus d'action donne un résultat sans équivoque : 100% de taux de génération d'actions dangereuses dans tous les scénarios testés. Ce chiffre interpelle directement les intégrateurs et décideurs industriels envisageant le déploiement de robots à base d'EFMs en environnements mixtes. Il expose un angle mort structurel : contrairement aux LLMs textuels, les EFMs ne disposent pas encore de mécanismes d'alignement de sécurité pour anticiper les séquences d'actions dangereuses avant leur exécution physique. La difficulté est méthodologique : collecter des données réelles de robots blessant des humains est éthiquement et légalement impossible, ce qui explique l'absence de benchmarks dans ce domaine jusqu'ici. ROBOSHACKLES propose une voie scalable via la synthèse vidéo, pour entraîner des modèles à refuser des actions à risque et à anticiper les dangers en amont de l'exécution. Les EFMs sont au cœur d'une compétition intense entre les principaux acteurs : Physical Intelligence avec π0, Google DeepMind avec RT-2, NVIDIA avec GR00T N2, et plusieurs implémentations open-source comme OpenVLA. Ces modèles combinent compréhension multimodale, raisonnement sur les états futurs et génération d'actions directement exécutables sur le robot, un paradigme qui accélère la commercialisation mais expose à des risques que le RLHF classique ne couvre pas. ROBOSHACKLES s'inscrit dans un effort émergent de safety spécifique à la robotique physique, avec pour suites logiques son intégration dans des pipelines de refusal learning et son extension à des scénarios industriels à plus haute énergie cinétique.

RechercheOpinion
1 source