Aller au contenu principal

Actualités robotique — page 43

4 737 articles au fil, du plus récent au plus ancien.

Stratégies d'échantillonnage pour des politiques de locomotion quadrupède robustes et universelles
2101arXiv cs.RO 

Stratégies d'échantillonnage pour des politiques de locomotion quadrupède robustes et universelles

Des chercheurs ont publié sur arXiv (2510.07094) une étude comparant trois stratégies d'échantillonnage de paramètres pour entraîner une politique de locomotion universelle applicable à plusieurs robots quadrupèdes sans re-entraînement. L'enjeu : former un seul agent par apprentissage par renforcement capable de s'adapter à des configurations physiques variées, masses différentes, géométries de pattes, gains de contrôleur articulaire PD (proportionnel-dérivateur) distincts. Les trois approches comparées sont des mappings linéaires et polynomiaux reliant masse aux gains PD, un filtrage adaptatif basé sur les performances, et un échantillonnage aléatoire uniforme. L'entraînement s'est déroulé dans le simulateur RaiSim, avec validation sur une gamme de quadrupèdes virtuels, puis déploiement zéro-shot sur le robot physique ANYmal d'ANYbotics. Résultat central : l'échantillonnage uniforme des gains articulaires, combiné à des priors nominaux pour biaiser les configurations, offre la meilleure robustesse au passage simulation-réalité. La démonstration qu'une randomisation forte des gains PD est nécessaire, et non optionnelle, pour fermer le sim-to-real gap est un résultat directement actionnable. Calibrer précisément les gains dans le simulateur ne suffit pas ; il faut au contraire introduire volontairement de la variance pour couvrir les incertitudes du monde réel : usure, imprécisions mécaniques, variations de charge utile. Le déploiement zéro-shot validé sur ANYmal, sans fine-tuning hardware, réduit concrètement les cycles d'adaptation pour les intégrateurs qui déploient des quadrupèdes sur terrains variés. Pour un COO industriel, cela se traduit par moins de recalibrations coûteuses entre sites ou lors de changements de configuration. ANYmal est le quadrupède phare d'ANYbotics, spin-off de l'ETH Zurich déployé dans l'inspection industrielle sur centrales électriques et sites pétroliers. Ces travaux s'inscrivent dans la compétition entre approches de sim-to-real : domain randomization classique dont relève cet article, modèles du monde appris comme DreamerV3 ou TD-MPC2, et adaptation en ligne telle que RMA (Rapid Motor Adaptation, Berkeley). Les publications concurrentes en politique universelle quadrupède émanent principalement de DeepMind, CMU et Google DeepMind. La suite naturelle serait d'étendre l'approche à des morphologies plus diverses ou à la loco-manipulation, robots à bras embarqué pour l'inspection et la manipulation industrielle autonome, un segment en forte croissance.

RecherchePaper
1 source
ForceBand : apprentissage de la manipulation de force par sEMG
2102arXiv cs.RO 

ForceBand : apprentissage de la manipulation de force par sEMG

Une équipe de chercheurs a présenté ForceBand, un bracelet sEMG (électromyographie de surface) porté au poignet et conçu pour enrichir les démonstrations humaines destinées à l'apprentissage de politiques de manipulation robotique. Le système capture l'activité musculaire du poignet via des électrodes de surface et, combiné à une IMU, alimente un modèle pré-entraîné baptisé EMG2Force qui prédit les forces exercées par chaque doigt. Pour entraîner ce modèle, les chercheurs ont constitué un jeu de données multimodal de 10 heures combinant vidéo égocentrique, signaux sEMG, données inertielles et mesures de forces au bout des doigts, couvrant des actions et objets variés. Après une courte calibration propre à l'utilisateur, celui-ci peut collecter de nouvelles démonstrations avec seulement le bracelet et une caméra : EMG2Force étiquette automatiquement ces séquences avec les traces de force par doigt. Les expériences rapportent une réduction d'erreur de prédiction de force supérieure à 50 % par rapport aux baselines fondées uniquement sur la vision, et un taux de succès de 87 % sur des tâches de saisie, compression et dépose impliquant des objets de formes, tailles et poids variés. L'apport clé de ForceBand réside dans la résolution d'un angle mort structurel des pipelines d'imitation learning : les sources courantes de démonstrations humaines, capture de mouvement ou vidéos internet, fournissent trajectoire et apparence mais ignorent les forces de contact, pourtant déterminantes pour toute manipulation sensible au toucher. Serrer un emballage souple sans l'écraser, insérer un connecteur, manipuler des objets fragiles ou déformables sont des tâches où le contrôle en effort prime sur le contrôle en position. En rendant ces forces observables à faible coût matériel, le système ouvre la voie à des politiques VLA (vision-language-action) capables de généraliser sur des propriétés mécaniques d'objets non vus, sans capteurs de force onéreux montés sur le robot. Ce travail s'inscrit dans une dynamique active autour de l'augmentation des données de démonstration : plusieurs laboratoires explorent des gants haptiques, des capteurs tactiles intégrés aux mains robotiques ou des méthodes de reconstruction de force par vision stéréo. ForceBand se positionne comme une alternative légère et bon marché, accessible sans infrastructure de motion capture. L'article est pour l'instant un preprint arXiv (2606.26093), non encore soumis à une conférence majeure, et les résultats reposent sur un protocole contrôlé en laboratoire. La robustesse au bruit musculaire inter-sujets, à la fatigue et aux variations de placement du bracelet en conditions industrielles reste à démontrer. Les prochaines étapes naturelles impliqueront des tests sur des robots à mains dextrères (dexterous hands) et une validation sur des tâches d'assemblage réelles, là où la complémentarité avec des plateformes comme les mains Allegro ou Shadow est la plus directe.

RecherchePaper
1 source
Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon
2103arXiv cs.RO 

Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon

Des chercheurs du Robin Lab de l'Université du Texas à Austin ont publié fin juin 2026 un preprint (arXiv:2606.25136) présentant HALO, une politique visuomotrice dotée d'un mécanisme de récupération mémorielle par attention pour le contrôle robotique à long horizon. L'architecture cible les robots polyvalents opérant dans des environnements partiellement observables, typiquement le domicile : le robot doit retrouver où un objet a été posé, se souvenir qu'un utilisateur a déjà accompli une sous-tâche, ou mémoriser l'état d'un appareil activé plusieurs minutes auparavant. HALO répond à deux défis identifiés lors de l'apprentissage par imitation sur données hors-ligne : la corrélation spurieuse entre contexte passé et actions prédites, et l'accumulation d'erreurs en boucle fermée qui entraîne une dérive progressive du modèle. Pour y remédier, la méthode distille des priors issus d'un modèle vision-langage (VLM) via un objectif de question-réponse vidéo généré depuis les trajectoires de démonstration, et combine cela à une attention sparse limitée aux segments d'historique les plus pertinents. Au total, HALO peut récupérer des informations pertinentes sur jusqu'à huit minutes d'expérience passée. Ce résultat est notable car il attaque frontalement le goulot d'étranglement des tâches longues-durées, là où la majorité des politiques visuomotrices actuelles, y compris les approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, supposent implicitement un horizon court ou une observabilité quasi-complète. La distillation de priors VLM pour orienter la récupération vers l'information pertinente à la tâche est une voie prometteuse pour réduire le gap démo-réalité, car elle ancre l'attention dans une compréhension sémantique plutôt que dans des heuristiques codées à la main. L'attention sparse contribue à contenir la propagation d'erreurs qui, dans les architectures transformer standard sur contexte long, peut faire diverger la politique après quelques dizaines de secondes d'exécution autonome. HALO s'inscrit dans une dynamique de recherche qui voit Transformers et modèles de langage coloniser la couche mémoire des systèmes robotiques, après avoir dominé la planification symbolique et la génération d'instructions. Le Robin Lab publie régulièrement sur l'apprentissage robot en environnements non structurés ; ce travail est encore au stade preprint et aucun déploiement physique à l'échelle n'est annoncé. Les concurrents directs incluent les approches à mémoire épisodique de travaux comme RT-X, mais aussi les architectures récurrentes à état latent explorées par des labos comme CMU ou Stanford. Les prochaines étapes attendues sont une validation sur robot physique dans des scénarios domestiques réels et une comparaison quantitative avec des baselines mémorielle existantes.

RechercheOpinion
1 source
Politique de diffusion sensible aux phases et contrainte par la rugosité pour le polissage robotique multiphasé
2104arXiv cs.RO 

Politique de diffusion sensible aux phases et contrainte par la rugosité pour le polissage robotique multiphasé

Des chercheurs ont publié sur arXiv (2606.25754) une politique de diffusion baptisée SRDP (Stage-Aware and Roughness-Constrained Diffusion Policy) conçue pour le polissage robotique multi-étapes en environnement industriel. Le système cible en priorité l'aérospatiale, secteur où la qualité de surface conditionne directement la tenue mécanique et la fiabilité des pièces. SRDP infère en continu la phase de polissage en cours (ébauche, semi-finition, finition) à partir d'un historique d'observations multimodales, sans nécessiter d'étiquettes de phase fournies manuellement lors de l'exécution. Le générateur d'actions contraint ensuite la vitesse d'avance et la force de contact normale selon les vitesses de broche préréglées par étape, via un échantillonnage de diffusion orienté rugosité. Les expériences ont été menées sur deux scénarios représentatifs : polissage d'un revêtement de cabine de vaisseau spatial et finition de surfaces structurelles en cavité interne, avec validation sur robot réel. L'enjeu industriel est direct : le polissage reste l'une des tâches les plus difficiles à automatiser par apprentissage par imitation, en raison des dépendances temporelles longues, des transitions de phase incertaines et du couplage fort entre paramètres process (force, vitesse, rugosité cible). Les approches existantes échouent précisément parce qu'elles ignorent la nature séquentielle des étapes ou ne peuvent pas réguler les paramètres physiques de manière cohérente. SRDP rompt avec cette limite en conditionnant le processus de débruitage inverse sur la phase inférée, ce qui produit des actions cohérentes avec l'étape courante sans supervision externe. Les résultats montrent une meilleure stabilité lors des transitions de phase, une plus grande consistance des paramètres process et une qualité de surface finale améliorée par rapport aux baselines comparées. Ce travail s'inscrit dans une vague de politiques de diffusion pour la manipulation industrielle fine, portée depuis 2023 par les travaux de Chi et al. sur Diffusion Policy et accélérée par des architectures comme pi0 (Physical Intelligence) ou les politiques de contact de Lerobot. Le polissage était jusqu'ici dominé par des approches de contrôle en force classique ou d'asservissement d'impédance, moins flexibles face à la variété géométrique des pièces. Aucun partenaire industriel ni calendrier de transfert n'est mentionné dans la publication ; il s'agit donc d'un résultat de recherche académique, pas d'un produit commercialisé.

RecherchePaper
1 source
Détection de défauts spatiaux à faibles données par réseaux neuronaux optoélectroniques hybrides en inspection robotique
2105arXiv cs.RO 

Détection de défauts spatiaux à faibles données par réseaux neuronaux optoélectroniques hybrides en inspection robotique

Des chercheurs ont publié sur arXiv (référence 2606.25277) une architecture optoélectronique intégrée matériel-logiciel destinée à la détection de défauts surfaciques en inspection robotique industrielle. Le système repose sur un dispositif à micromiroirs numériques (DMD) reconfiguré en couche convolutionnelle optique physique : au lieu de capturer une image complète puis de la traiter numériquement, le capteur lui-même effectue l'extraction de caractéristiques dans le domaine photonique. Une stratégie de compressed sensing par blocs encode ensuite l'information spatiale en signaux temporels de faible dimension, éliminant la redondance à la source. Pour s'affranchir de l'annotation manuelle fastidieuse des formes de défauts, le réseau est guidé par des descriptions en langage naturel qui alignent ses cartes d'attention sur les représentations généralisables de CLIP (Contrastive Language-Image Pre-training). Une métrique dédiée, la LAA (Localization Accuracy for Attention), quantifie la précision de localisation au niveau de la forme. Les expériences portent sur la détection de défauts dans des matériaux transparents. Les résultats sont substantiels : comparé à une acquisition d'image traditionnelle, l'architecture proposée maintient une précision équivalente tout en réduisant le volume de données de 90 % pour les Vision Transformers et la charge de calcul de 60 % pour les réseaux convolutionnels classiques. Pour les intégrateurs industriels, cela signifie des pipelines d'inspection viables sur hardware embarqué contraint, sans sacrifier la précision de détection. L'utilisation de CLIP comme superviseur sémantique réduit également le coût d'étiquetage, point de friction majeur dans le déploiement de systèmes de contrôle qualité automatisés à l'échelle. La combinaison sensing-computing dans le même composant physique ouvre par ailleurs une voie vers des cadences d'inspection plus élevées sans bande passante supplémentaire. Ce travail s'inscrit dans une tendance plus large de recherche en edge AI pour l'inspection industrielle, où la contrainte n'est plus uniquement algorithmique mais aussi énergétique et matérielle. Les approches concurrentes incluent les systèmes purement logiciels basés sur des CNNs quantifiés ou des modèles légers type MobileNet, ainsi que des solutions de compressed sensing purement numériques. L'originalité ici est le déport du calcul dans le domaine optique via le DMD, une piste explorée aussi dans des contextes de calcul neuromorphique. L'article reste à ce stade une validation expérimentale sur matériaux transparents ; la généralisation à d'autres substrats industriels (métal, composite, textile) et l'intégration dans une chaîne robotique réelle constituent les prochaines étapes non encore annoncées.

RecherchePaper
1 source
RoboRouter : sélection de politiques sans entraînement pour la manipulation robotique
2106arXiv cs.RO 

RoboRouter : sélection de politiques sans entraînement pour la manipulation robotique

Des chercheurs ont publié RoboRouter (arXiv:2603.07892, version 4), un système de routage intelligent entre politiques robotiques hétérogènes pour les tâches de manipulation. Plutôt que d'entraîner une nouvelle politique monolithique, RoboRouter maintient un pool de politiques existantes -- modèles vision-langage-action (VLA), politiques vision-action (VA) et approches compositionnelles par code -- et sélectionne automatiquement la meilleure pour chaque nouvelle tâche. Le mécanisme repose sur une représentation sémantique de la tâche, une recherche dans l'historique d'exécutions similaires, puis une prédiction directe sans trial-and-error. Le retour structuré après chaque exécution affine les décisions suivantes. En simulation et en conditions réelles, RoboRouter améliore le taux de succès moyen de plus de 3 points en simulation et de 13 points en environnement réel par rapport aux politiques individuelles, sans dégradation de la vitesse d'exécution. Intégrer une nouvelle politique dans le système ne requiert qu'une évaluation légère, sans coût de réentraînement. Ce résultat a une portée concrète pour les intégrateurs. Le problème central de la manipulation robotique est que chaque paradigme excelle sur sa distribution d'entraînement mais généralise mal hors distribution. RoboRouter contourne ce mur non pas en cherchant un meilleur modèle universel, mais en exploitant les forces complémentaires de politiques spécialisées existantes. Le gain de 13 % en réel est notable car le sim-to-real gap ronge habituellement les gains obtenus en simulation. L'absence de réentraînement signifie que le système peut absorber de nouveaux modèles au fil du temps -- une propriété utile à mesure que les VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) sortent des cycles de recherche pour entrer en déploiement. Ce travail prend place dans un contexte de prolifération rapide des paradigmes de contrôle robotique. Les équipes de Figure (Figure 03), Tesla (Optimus Gen 3) ou 1X parient sur l'unification via un seul grand modèle entraîné à grande échelle. RoboRouter incarne une thèse adverse: l'hétérogénéité contrôlée, avec un orchestrateur léger, peut surpasser la politique unique sans le coût computationnel associé. Les auteurs ne précisent pas de déploiement industriel annoncé ni de partenariats, ce qui place cette contribution dans le registre recherche applicable plutôt que produit shipé. Les prochaines étapes naturelles seraient l'évaluation sur des benchmarks standardisés plus larges (LIBERO, RoboSuite) et l'intégration de politiques récentes à mesure qu'elles sont rendues publiques.

IA physiqueOpinion
1 source
FORCE : affinage par renforcement efficace de modèles VLA via préchauffage calibré par valeur et auto-distillation
2107arXiv cs.RO 

FORCE : affinage par renforcement efficace de modèles VLA via préchauffage calibré par valeur et auto-distillation

Une équipe de recherche a publié FORCE (arXiv:2606.26006, juin 2026), un cadre d'entraînement en trois étapes conçu pour affiner les modèles Vision-Language-Action (VLA) par renforcement sans nécessiter d'interventions humaines coûteuses. Sur des benchmarks en simulation et en environnements réels, FORCE affiche une progression absolue de 79 points de pourcentage sur les taux de succès par rapport à la ligne de base en imitation pure, surpasse les méthodes RL existantes de 10 %, et réduit le temps d'entraînement de 32,5 %. Ces chiffres proviennent d'expériences contrôlées décrites dans un preprint non encore évalué par les pairs, ce qui invite à la prudence avant toute extrapolation industrielle. L'importance de ces résultats tient à un problème fondamental des VLA déployés aujourd'hui : leur performance plafonne au niveau de qualité des données d'imitation utilisées pour les pré-entraîner. Le fine-tuning par renforcement est théoriquement capable de dépasser ce plafond, mais se heurte en pratique à deux obstacles majeurs. Le premier est l'oubli catastrophique initial, causé par une fonction de valeur Q instable dès les premiers pas d'optimisation. Le second est la faible qualité des données d'exploration générées par la politique en cours d'apprentissage, qui force habituellement les équipes à injecter des démonstrations humaines supplémentaires à intervalles réguliers. FORCE répond aux deux simultanément : une phase de "Value-Calibrated Warm-Up" stabilise la Q-function via des rollouts on-policy avant de lancer l'apprentissage en ligne, puis cette Q-function calibrée filtre les actions candidates pour ne garder que celles à haute valeur estimée. L'absence d'intervention humaine pendant l'entraînement est l'élément le plus opérationnellement pertinent pour les intégrateurs, car c'est précisément ce coût de supervision qui freine le passage à l'échelle des robots apprenants en cellule industrielle. Le contexte est celui d'une course intense à l'efficacité du fine-tuning VLA, dans laquelle plusieurs équipes cherchent à transformer les grands modèles multimodaux en politiques robotiques fiables. Des travaux comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure) ont démontré que les VLA pré-entraînés sur de larges corpus de données de manipulation peuvent être spécialisés sur des tâches précises, mais le coût de la collecte de données de qualité reste un goulot d'étranglement. FORCE s'inscrit dans la vague des méthodes qui cherchent à substituer du calcul à de la supervision humaine. Les concurrents directs incluent notamment RLVR et des variantes d'entraînement hors-politique couplées à des buffers de replay. Aucun déploiement commercial n'est annoncé à ce stade : FORCE est un résultat de recherche académique dont les prochaines étapes naturelles seraient une validation sur des robots à morphologie variable et une publication dans une conférence de robotique (ICRA, CoRL, RSS).

IA physiqueOpinion
1 source
ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action
2108arXiv cs.RO 

ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action

Une équipe de chercheurs publie fin juin 2026 ROAD-VLA (arXiv:2606.25800), un cadre d'adaptation en ligne des modèles VLA (Vision-Language-Action) par auto-distillation guidée par avantage. Les VLA, à l'image de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou RT-2 (Google DeepMind), traduisent directement une entrée visuelle et une instruction en langage naturel en séquences d'actions robotiques. Le problème : affiner un tel modèle pré-entraîné sur de nouvelles tâches via apprentissage par renforcement (RL) génère des récompenses trop éparses pour superviser des politiques autoregressives de haute dimension. ROAD-VLA y répond en construisant un "enseignant proximal" dans l'espace des actions, perturbant les logits des tokens d'action avec des estimations d'avantage calibrées pour convertir des récompenses rares en supervision dense token par token. Évalué sur sept environnements de manipulation robotique, en distribution et hors distribution, le framework surpasse PPO (Proximal Policy Optimization, référence RL standard) dans la quasi-totalité des configurations. La découverte la plus saillante est l'existence d'un "modality gap" : les enseignants textuels conditionnés sur des démonstrations, des expériences récupérées ou des plans de haut niveau s'avèrent systématiquement inefficaces pour adapter les politiques d'action VLA. C'est une contradiction directe avec une hypothèse répandue selon laquelle le guidage symbolique ou langagier peut servir de supervision fiable lors du fine-tuning RL. ROAD-VLA démontre que la supervision doit opérer dans l'espace des actions, pas dans l'espace du langage. Pour un intégrateur déployant des bras manipulateurs basés sur VLA, cela ouvre une voie d'adaptation au domaine sans collecter de nouvelles démonstrations massives : le modèle se corrige via son propre comportement et les signaux de récompense de l'environnement réel. Le paradigme VLA a pris son essor avec RT-2 (Google DeepMind, 2023), puis s'est accéléré via Pi-0 (Physical Intelligence, 2024), GR00T N2 (NVIDIA, 2025) et Helix (Figure AI), accompagnés d'une vague de publications académiques. L'adaptation post-déploiement, soit ajuster un modèle généraliste à une géométrie de préhension spécifique ou à un flux industriel précis sans tout ré-entraîner, est désormais identifiée comme le verrou opérationnel suivant par les équipes terrain. Ce travail reste une annonce académique (arXiv, juin 2026), pas un produit livré ni un déploiement industriel réel, et la validation sur robots physiques en conditions industrielles reste à conduire. Aucun acteur français ou européen n'est impliqué dans cette recherche.

RechercheOpinion
1 source
TIDAL : boucle diffusion-action à entrelacement temporel pour le contrôle VLA haute fréquence
2109arXiv cs.RO 

TIDAL : boucle diffusion-action à entrelacement temporel pour le contrôle VLA haute fréquence

Des chercheurs ont publié sur arXiv (papier 2601.14945, version 2) un cadre architectural nommé TIDAL, Temporally Interleaved Diffusion and Action Loop, qui s'attaque directement au goulot d'étranglement en latence des modèles Vision-Language-Action (VLA). Le problème est précis : les VLA actuels basés sur la diffusion tournent typiquement à environ 2,4 Hz sur hardware embarqué, imposant un paradigme "batch-and-execute" où le robot planifie en bloc puis exécute en boucle ouverte. TIDAL introduit une architecture à double fréquence qui découple le raisonnement sémantique (boucle basse fréquence qui met en cache les embeddings d'intention) de l'actuation motrice (boucle haute fréquence qui entrelace intégration de flux à un pas et exécution). Résultat mesuré : environ 9 Hz de mises à jour de contrôle sur edge hardware, soit 4x la fréquence de feedback des baselines, avec un gain de performance 2x sur des tâches d'interception dynamique. La méthode ajoute également un prédicteur différentiel de mouvement pour compenser l'insensibilité à la vélocité des encodeurs visuels statiques, et une stratégie d'entraînement à désalignement temporel pour apprendre à compenser la latence résiduelle. L'impact concret pour les intégrateurs robotiques réside dans ce que le papier nomme "l'angle mort d'exécution" : quand une cible se déplace pendant la fenêtre d'exécution en boucle ouverte, les baselines VLA échouent systématiquement sous protocole d'inférence non-pausée, TIDAL reste opérationnel. C'est architectural et orthogonal aux optimisations système (quantification, batching), ce qui signifie qu'il peut s'empiler sur d'autres gains de performance. La régression marginale sur les tâches statiques (cibles immobiles) est honnêtement reconnue par les auteurs, ce qui est de bonne pratique évaluative. Pour un décideur B2B, la question pertinente reste ouverte : les gains sont mesurés en simulation et sur tâches de laboratoire, pas sur déploiement réel. TIDAL s'inscrit dans une compétition dense autour de la latence des VLA, portée par les modèles Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA. Ces architectures partagent le défi structurel du sim-to-real et de la fréquence de contrôle insuffisante pour les environnements industriels dynamiques (convoyeurs, pièces en mouvement, collaboration humain-robot). TIDAL est un travail de recherche académique sans annonce de déploiement ni partenaire industriel identifié, ce qui tempère toute projection immédiate. La prochaine étape naturelle serait une validation sur hardware réel, bras manipulateur ou humanoïde, avec métriques de robustesse en conditions non-contrôlées.

IA physiqueOpinion
1 source
WOLF-VLA : framework de locomotion optimale corps entier pour humanoïdes avec apprentissage vision-langage-action
2110arXiv cs.RO 

WOLF-VLA : framework de locomotion optimale corps entier pour humanoïdes avec apprentissage vision-langage-action

Des chercheurs ont publié le 25 juin 2026 sur arXiv (arXiv:2606.25591) WOLF-VLA, un cadre unifié qui combine la synthèse de trajectoires par contrôle optimal (OC) en corps entier avec un dataset multimodal à grande échelle, dans le but d'entraîner des modèles VLA (Vision-Language-Action) capables de piloter la locomotion d'humanoïdes directement depuis des instructions en langage naturel. Le dataset couvre six familles de tâches de locomotion, paramétrées par des variations d'environnement, de couleurs d'objets, de placements et de distracteurs visuels. L'entrainement utilise des trajectoires articulaires dynamiquement cohérentes, des observations visuelles ego-centriques et des instructions textuelles. Les résultats annoncés font état d'une robustesse notable aux variations de conditions initiales et de performances compétitives sur plusieurs tâches et configurations d'environnement. Le dataset complet, les checkpoints de modèle et la suite de benchmarks en simulation seront publiés en open source. Ce travail comble un angle mort important : si les VLA ont prouvé leur efficacité en manipulation (voir Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA), leur extension à la locomotion en corps entier, contact-riche et dynamiquement contrainte, restait quasi inexploitée. Les trois verrous identifiés par les auteurs sont précis -- pénurie de données, absence de démonstrations dynamiquement consistantes, et difficulté à encoder optimalité et sécurité dans un pipeline d'apprentissage -- ce sont exactement les obstacles qui ont maintenu la locomotion hors du champ VLA. La génération de trajectoires via contrôle optimal comme source de données supervisées est une approche méthodologiquement solide pour contourner la dépendance aux démonstrations humaines ou téléopérées. Ce papier s'inscrit dans un mouvement plus large vers des politiques de locomotion instruction-guidées, concurrent de travaux comme ANYmal (ETH Zurich / ANYbotics), Digit (Agility Robotics) ou les approches reinforcement learning de Boston Dynamics. La release open source du benchmark constitue la contribution potentiellement la plus durable : établir un référentiel reproductible pour la locomotion humanoïde VLA permettrait de structurer les comparaisons dans un domaine où les métriques sont encore disparates. Aucun déploiement physique n'est mentionné dans cet article, qui reste une contribution de recherche en simulation -- le transfert sim-to-real sur des plateformes comme Unitree H1 ou Figure 03 constitue la prochaine étape non résolue.

RechercheOpinion
1 source
SAGE-Nav : planification LLM et fusion d'alignement pour la navigation par graphe de scène hiérarchique
2111arXiv cs.RO 

SAGE-Nav : planification LLM et fusion d'alignement pour la navigation par graphe de scène hiérarchique

Des chercheurs ont publié le 25 juin 2026 sur arXiv (réf. 2606.25497) SAGE-Nav, un système de navigation autonome pour robots incarnés capable de localiser des objets spécifiés à partir de la seule perception visuelle égocentrique. L'architecture découple explicitement deux boucles temporelles : une planification globale sémantique assurée par un LLM, et un contrôle réactif basse latence. Le LLM décompose une instruction abstraite ("trouve la tasse dans la cuisine") en une séquence de waypoints sémantiquement ancrés. Deux modules originaux assurent la traduction en commandes : un encodeur de graphe de scène hiérarchique (HSGE) fondé sur des convolutions de graphes relationnelles, et un réseau de fusion GAFN qui combine perception temps réel et représentations structurées via un mécanisme de gating adaptatif à biais inductif explicite. Les évaluations conduites dans les simulateurs i-THOR et RoboTHOR affichent des performances à l'état de l'art en efficacité de navigation et en généralisation zero-shot vers des environnements non vus à l'entraînement. L'apport central est architectural : en séparant planification haute latence (LLM) et boucle de contrôle haute fréquence, SAGE-Nav évite le goulot d'étranglement qui pénalise les approches monolithiques de type VLA (Vision-Language-Action) sur des plateformes embarquées temps-réel. La généralisation zero-shot est un indicateur industriel critique car elle conditionne directement l'utilité d'un robot dans des entrepôts, hôpitaux ou espaces de bureau non cartographiés à l'avance. Le mécanisme GAFN répond concrètement au problème de cohérence entre carte sémantique construite offline et perception temps réel, un défi que les méthodes classiques d'exploration-planification traitent mal. La navigation orientée-objet (ObjNav) est un benchmark central de l'IA incarnée depuis la plateforme AI2-THOR de l'Allen Institute. SAGE-Nav s'inscrit dans la tendance qui instrumentalise les LLMs comme planificateurs symboliques plutôt que contrôleurs directs, approche défendue aussi par SayPlan (2023) et NavGPT. Limite importante : les évaluations restent confinées aux simulateurs, et aucun déploiement physique n'est rapporté malgré une mention de latence "compatible avec le matériel réel". Le gap sim-to-real demeure non adressé dans ce papier. Les concurrents directs incluent les architectures VLA bout-en-bout comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui font le pari inverse de la séparation planification/contrôle. Une validation sur plateformes physiques (Spot, Hello Robot Stretch) constituerait la prochaine étape naturelle.

IA physiquePaper
1 source
RARM : modèle de récompenses de progression à seuil de confiance pour l'apprentissage par renforcement en manipulation
2112arXiv cs.RO 

RARM : modèle de récompenses de progression à seuil de confiance pour l'apprentissage par renforcement en manipulation

Des chercheurs ont publié sur arXiv (réf. 2606.22027) RARM, pour Reference-Anchored Reward Model, une approche visant à résoudre un verrou central de l'apprentissage par renforcement (RL) en manipulation robotique : la conception des fonctions de récompense. La méthode repose sur un comparateur visuel léger qui, à partir d'une seule démonstration réussie, génère automatiquement un signal de récompense dense et progressif. RARM est pré-entraîné une unique fois sur des vidéos généralistes via un objectif de contraste temporel, sans données robot-spécifiques ni étiquetage manuel. Au déploiement, il compare des extraits de la tentative courante à des clips de référence et ne délivre une récompense que lorsque la correspondance dépasse un seuil de confiance (d'où l'appellation confidence-gated). Évalué sur 9 tâches de manipulation simulées issues des benchmarks LIBERO et MetaWorld ainsi que sur 4 tâches réelles, RARM obtient les meilleurs taux de succès globaux en entraînement RL, avec des gains particulièrement marqués sur des tâches longue durée comme le pliage de tissu. Le verrou qu'attaque RARM est fondamental : les récompenses éparses (succès/échec en fin de séquence) produisent un signal trop faible pour les tâches longues, tandis que les récompenses denses codées manuellement exigent une ingénierie fastidieuse et se généralisent mal d'une tâche à l'autre. Les approches de progression existantes souffraient d'un biais critique : elles attribuaient des récompenses élevées à des états visuellement plausibles mais physiquement incorrects, ce que la porte de confiance de RARM réduit directement. L'implication concrète pour les intégrateurs est qu'une seule vidéo de démonstration humaine suffit désormais à bootstrapper l'entraînement RL sur une nouvelle tâche, sans ré-ingénierie de la fonction de récompense. RARM se positionne en concurrence directe avec EUREKA (OpenAI, génération de récompenses via LLM) et les méthodes d'imitation inverse (IRL), dont il se distingue par sa légèreté et l'absence de données robot-spécifiques. Son objectif de généralisation le rapproche des ambitions des modèles VLA comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA). La publication reste un preprint arXiv, pas encore un produit ni un déploiement industriel ; les prochaines étapes attendues incluent une validation sur des plateformes hardware diversifiées et une intégration dans des pipelines de fine-tuning de modèles fondationnels robotiques.

RecherchePaper
1 source
RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle
2113arXiv cs.RO 

RAVEN : raisonnement à long horizon et navigation avec une mémoire visuo-spatio-temporelle

Des chercheurs ont publié RAVEN (arXiv:2606.25206), un système de mémoire agentique conçu pour les robots devant opérer sur de longues durées sans réinitialisation. Le système stocke des embeddings visuels enrichis de données de pose et d'horodatage dans une base vectorielle, puis ancre la récupération dans une carte spatiale pour répondre à des requêtes ou naviguer vers des objectifs exprimés en langage naturel. Contrairement aux approches classiques qui convertissent les images en descriptions textuelles, RAVEN opère directement sur les représentations visuelles brutes, évitant la perte d'information sémantique inhérente à cette étape de transcription. Le système a été évalué sur plusieurs benchmarks de question-réponse vidéo en simulation et en environnement réel, puis déployé physiquement sur un robot quadrupède Unitree Go1 pour des tâches de navigation longue portée dans de grands espaces intérieurs. Les résultats publiés indiquent que RAVEN surpasse systématiquement les mémoires à base de captioning sur les benchmarks long-horizon, tout en égalant les VLM de pointe à un coût de récupération dix fois inférieur. Ce ratio coût-performance est directement pertinent pour les intégrateurs : maintenir une mémoire épisodique précise sur des heures ou des jours de déploiement est l'un des verrous principaux vers l'autonomie prolongée. La capacité à répondre à des questions sémantiques et spatiales depuis une mémoire compacte ouvre la voie à des robots de service, de logistique ou d'inspection capables de missions multi-sessions, sans réinitialisation entre chaque passage. Il faut cependant noter que les benchmarks et environnements de test restent contrôlés : le fossé entre performance en labo et déploiement industriel à grande échelle n'est pas encore comblé. La mémoire à long terme est un défi structurel de la robotique autonome depuis l'essor des approches LLM+captioning popularisées entre 2022 et 2024 (SayPlan, CLIP-Nav et leurs dérivés), lesquelles sacrifient la précision visuelle au profit de la flexibilité textuelle. RAVEN s'inscrit dans une tendance croissante de mémoires vectorielles embarquées, proche des architectures RAG transposées au robotique, en compétition conceptuelle avec des systèmes comme SpatialVLM ou MemoryOS. Le Unitree Go1, quadrupède commercialisé autour de 9 000 dollars, sert ici de plateforme de validation accessible, ce qui renforce la reproductibilité potentielle. Aucun partenariat industriel ni calendrier de productisation n'est annoncé : RAVEN demeure une contribution de recherche dont l'impact concret dépendra de la qualité du code publié et de son éventuelle intégration dans des frameworks ouverts comme ROS2.

RecherchePaper
1 source
WaveForward : un robot quadrupède omnidirectionnel sur roulettes passives
2114arXiv cs.RO 

WaveForward : un robot quadrupède omnidirectionnel sur roulettes passives

Une équipe de chercheurs présente WaveForward, un robot quadrupède à roues passives (roulettes pivotantes standard, dites casters) capable de se déplacer dans toutes les directions sans roues motorisées. Publiée le 25 juin 2026 sur arXiv (référence 2606.25299), l'étude propose une architecture de contrôle par apprentissage par renforcement de type acteur-critique asymétrique, qui exploite en phase d'entraînement des informations privilégiées sur les angles et vitesses instantanées des roulettes, informations non accessibles à l'inférence sur le robot réel. Le système génère le mouvement en actionnant les articulations des pattes pour modifier l'axe de rotation des roulettes et créer différents modes de propulsion par oscillation. Lors de tests de slalom et de changements de mode de propulsion, le COT (coût de transport) a été réduit jusqu'à 89,1 % par rapport à une locomotion purement en pas de jambes. Cette réduction de 89,1 % du COT positionne ce type de robot hybride dans une plage d'efficacité énergétique comparable aux AMR à roues conventionnels, sans les contraintes mécaniques et électroniques liées aux roues motorisées. L'usage de roulettes passives standard et bon marché ouvre une voie de conception bien moins coûteuse que les architectures rivales équipées de roues actionnées, comme l'ANYmal-W d'ETH Zurich, le Spot avec module de roues de Boston Dynamics, ou le B2-W d'Unitree. La technique d'acteur-critique asymétrique, où l'acteur opère sans les états des roulettes à l'inférence, illustre concrètement l'apport du privileged learning au sim-to-real en locomotion robotique, une direction de recherche portée depuis quelques années par les labos de l'ETH ASL et de CMU. Les robots hybrides roues-pattes constituent un champ actif depuis une décennie, avec des jalons comme le Centauro de l'IIT de Gênes, les travaux ETH sur ANYmal-W et les déploiements commerciaux récents d'Unitree (B2-W) et Ghost Robotics. L'originalité de WaveForward réside dans l'élimination du sous-système de roues motorisées, principale source de coût et de complexité électronique, en exploitant la dynamique des roulettes pivotantes via la commande des pattes seules. À ce stade, le travail reste une démonstration académique : aucun déploiement industriel ni partenaire commercial n'est mentionné. Les prochaines étapes logiques incluent des tests sur terrains non structurés et une évaluation de robustesse face aux irrégularités de surface, conditions où les roulettes passives montrent typiquement leurs limites face à des roues actionnées.

RecherchePaper
1 source
Découplage de la sémantique et de l'ancrage géométrique : prompts visuels spatiaux pour l'apprentissage par imitation guidé par le langage
2115arXiv cs.RO 

Découplage de la sémantique et de l'ancrage géométrique : prompts visuels spatiaux pour l'apprentissage par imitation guidé par le langage

Une équipe de chercheurs présente SVP-IL dans un préprint publié sur arXiv le 25 juin 2026 (arXiv:2606.25360), une architecture destinée à l'apprentissage par imitation conditionné par le langage naturel en robotique de manipulation. Le constat de départ est précis : les modèles Vision-Language-Action (VLA) de bout en bout actuels couplent dans un même réseau le raisonnement sémantique et le contrôle spatial, ce qui génère un goulot d'étranglement d'alignement quand les données d'entraînement sont rares. SVP-IL découple ces deux fonctions : un modèle fondation vision-langage analyse les instructions textuelles pour produire des masques géométriques zero-shot, traduits en "Spatial Visual Prompts" (SVP), qui sont ensuite injectés dans un générateur d'actions continu via une fusion légère au niveau des features. Résultats sur des tâches à ambiguïté linguistique élevée : avec seulement 50 à 100 démonstrations, le taux de succès moyen passe de 24,0 % à 39,5 %, et atteint 67,8 % sur les benchmarks standards. Des expériences en environnement physique non structuré ont validé la robustesse de l'approche hors laboratoire. L'enjeu industriel de ce résultat est le coût de collecte de données. Les VLA monolithiques comme RT-2, OpenVLA ou π0 (Physical Intelligence) exigent des milliers à des dizaines de milliers de démonstrations pour généraliser à de nouvelles tâches ou de nouveaux environnements, ce qui rend leur déploiement chez les intégrateurs robotiques coûteux et lent. SVP-IL ramène ce seuil à 50-100 démos, soit une réduction d'un ou deux ordres de grandeur, tout en surpassant l'état de l'art sur les tâches à désambiguïsation difficile. Pour un COO industriel ou un intégrateur, cela signifie un temps de mise en service radicalement plus court pour chaque nouvelle cellule de travail. L'approche valide aussi l'hypothèse que le couplage sémantique-spatial n'est pas une nécessité architecturale mais un choix de conception contournable. Les architectures VLA ont émergé à partir de 2022-2023 avec les travaux de Google DeepMind (RT-2), avant d'être popularisées par des modèles open-source et des acteurs comme Physical Intelligence avec π0 ou l'initiative GR00T N2 de NVIDIA. La tendance dominante reste le paradigme monolithique de bout en bout, considéré comme plus simple à scaler. SVP-IL conteste cette hypothèse en montrant qu'un découplage explicite donne de meilleurs résultats en régime de faibles données, sans compromis sur la généralisation. Le préprint ne mentionne pas de partenaire industriel ni de calendrier de déploiement, ce qui en fait pour l'instant une contribution académique ouverte, sans produit shipé associé. Les prochaines étapes naturelles seraient une validation sur des robots commerciaux multi-DOF (bras industriels 6-7 axes, manipulateurs mobiles) et une intégration avec des pipelines de collecte de données synthétiques pour réduire encore davantage le besoin en démonstrations humaines.

RechercheOpinion
1 source
TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs
2116arXiv cs.RO 

TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs

Une équipe de chercheurs a publié TacVerse, un jeu de données multi-capteurs et benchmark destiné à évaluer la perception tactile par vision (vision-based tactile sensors, VBTS) à travers des capteurs de designs hétérogènes. Le dataset compile 106 800 images tactiles issues de sept capteurs VBTS distincts, couvrant trois tâches cibles : classification de formes, classification de réseaux de rainures (grating), et régression de force. Les expériences sont conduites selon trois protocoles expérimentaux : entraînement intra-capteur, transfert zéro-shot inter-capteurs, et adaptation few-shot. L'article, déposé sur arXiv (2606.25877), ne mentionne pas de financement industriel ni de partenaire de déploiement terrain ; il s'agit d'une contribution académique à visée benchmark, sans produit commercialisé associé. Le résultat le plus structurant pour les intégrateurs robotiques est le gouffre de généralisation inter-capteurs : si les performances intra-capteur sont solides sur les trois tâches, le transfert direct zéro-shot vers un capteur inconnu dégrade significativement les résultats, surtout pour la régression de force et la classification de réseaux de rainures. La classification de forme se révèle comparativement plus robuste face au changement de capteur. L'adaptation few-shot améliore la régression de force sur des capteurs cibles non vus, sans toutefois atteindre les performances intra-capteur. Ce résultat implique qu'un modèle entraîné sur un VBTS donné ne peut pas être déployé tel quel sur un autre design sans dégradation mesurable, ce qui complexifie les stratégies de standardisation des pipelines de perception tactile dans l'industrie. Les capteurs VBTS (type GelSight, DIGIT, Tactip et variantes) ont connu un essor marqué depuis 2018, portés par des labos comme MIT CSAIL et des acteurs industriels comme Meta AI (DIGIT). TacVerse s'inscrit dans un effort de standardisation de l'évaluation, comparable à ce que ImageNet a représenté pour la vision classique. L'étude révèle également que le préentraînement par MAE (Masked Autoencoder) offre les gains les plus constants sur l'ensemble des tâches et des capteurs, suggérant une piste d'architecture prioritaire pour les travaux futurs. Aucun concurrent direct de benchmark tactile multi-capteurs à cette échelle n'est cité dans l'abstract ; TacVerse vise à combler ce vide méthodologique pour la communauté sim-to-real et apprentissage auto-supervisé en perception haptique.

RecherchePaper
1 source
RoDyn : apprivoiser un modèle du monde 2.5D interactif pour la manipulation robotique
2117arXiv cs.RO 

RoDyn : apprivoiser un modèle du monde 2.5D interactif pour la manipulation robotique

Des chercheurs ont publié sur arXiv (identifiant 2510.09036, seconde version) RoDyn, un modèle de monde 2.5D destiné à la manipulation robotique. L'architecture repose sur un espace latent géométriquement conscient plutôt que sur des flux vidéo 2D bruts. Son composant central, le Robot-Dynamic Tokenizer, couple les représentations visuelles sémantiques avec des informations spatiales et centrées sur l'agent via un mécanisme de cross-attention dominé par le canal RGB, complété d'un guidage par masque dynamique. Une architecture autorégressi guidée par ces masques oriente ensuite le modèle vers les zones d'interaction active entre le robot et les objets manipulés. Sur des jeux de données à grande échelle, RoDyn atteint l'état de l'art en fidélité de génération et affiche, point le plus saillant, une amélioration de 42% du taux de réussite en imitation learning dans le monde réel par rapport aux baselines purement 2D. Ce gain de 42% doit être lu avec soin: il est mesuré contre des modèles 2D, non contre d'autres approches 2.5D ou 3D, ce qui circonscrit la portée de la comparaison. Il illustre néanmoins un problème structurel bien documenté: les modèles vidéo 2D, aussi convaincants visuellement, ne capturent pas la géométrie ni la cinématique indispensables aux interactions physiques précises. En introduisant une représentation intermédiaire 2.5D, soit une profondeur estimée sans reconstruction 3D complète et coûteuse, RoDyn tente de combler ce fossé à moindre coût computationnel. Pour les équipes R&D en manipulation industrielle, l'intérêt concret réside dans l'accélération du reinforcement learning model-based (MBRL), qui réduit potentiellement le nombre d'interactions physiques requises à l'entraînement, et dans une meilleure généralisation aux objets non vus en simulation. Le champ des modèles de monde pour la robotique s'est densifié depuis 2023, porté par Dreamer (DeepMind), UniSim, et plus récemment les architectures VLA comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). RoDyn occupe une niche spécifique: la simulation neuronale pour la manipulation de précision, avec un compromis géométrique explicite entre vidéo pure et reconstruction 3D complète. Cette publication reste à ce stade purement académique, sans annonce de déploiement commercial ni partenariat industriel mentionné. Les suites naturelles concerneront des tâches de manipulation plus exigeantes (assemblage fin, dépose contrainte) et une éventuelle intégration dans des pipelines VLA existants. Aucun acteur français ou européen n'est impliqué dans ces travaux.

RechercheOpinion
1 source
Reflective VLA : les conséquences d'actions en contexte améliorent la généralisation des modèles VLA
2118arXiv cs.RO 

Reflective VLA : les conséquences d'actions en contexte améliorent la généralisation des modèles VLA

Des chercheurs ont publié le 25 juin 2026 sur arXiv (réf. 2606.25215) une architecture baptisée Reflective VLA, conçue pour améliorer la généralisation des modèles de type vision-language-action (VLA) en dehors de leurs environnements d'entraînement. Contrairement aux politiques dites "réactives" qui prédisent l'action suivante à partir de la seule observation courante, Reflective VLA conditionne chaque décision sur un contexte de triplets observation-action-conséquence: le modèle enregistre non seulement ce que le robot a vu et exécuté, mais aussi comment la scène a changé après chaque action. Architecturalement, toutes les modalités perceptives passent par le modèle de langage visuel (VLM) sous attention partagée, tandis qu'un masque de causalité par blocs permet l'entraînement parallèle sur plusieurs frames sans fuite d'information et supporte une inférence temps réel avec cache KV. Sur les benchmarks standards LIBERO et SimplerEnv-Bridge, le modèle maintient les performances en distribution. Sous distribution shift, sur LIBERO-Plus et la variante plus difficile LIBERO-Plus-Hard, il améliore le taux de succès moyen respectivement de 5,4 et 4,2 points de pourcentage face à une baseline réactive appariée. Ces gains, modestes en valeur absolue mais obtenus dans des conditions de transfert réel, adressent un verrou central de la robotique embarquée: les facteurs spécifiques à chaque déploiement (calibration robot, biais d'actuation, géométrie caméra-robot) sont difficiles à inférer d'une observation unique. En exposant la cartographie actions-effets propre à chaque environnement, l'approche réduit l'overfitting aux conditions d'entraînement sans modifier la structure générale du modèle. Chose importante, les ablations montrent que c'est le signal de conséquence, et non la simple augmentation du contexte historique, qui est responsable du gain de généralisation, résultat qui contredit l'hypothèse selon laquelle "plus de contexte suffit". Les VLA réactifs, popularisés par des travaux comme RT-2 (Google DeepMind), OpenVLA ou Pi-0 (Physical Intelligence), souffrent depuis leurs débuts de ce gap sim-to-real et de dégradation hors distribution. Reflective VLA s'inscrit dans une tendance émergente qui cherche à doter les politiques robotiques d'une forme de boucle de feedback interne, proche du concept de "réflexion" en LLM. Les concurrents directs incluent des approches à mémoire épisodique ou à correction en ligne (comme RoboDreamer ou ACT avec buffer de contexte). L'article reste une contribution académique sans annonce de déploiement industriel ni partenaire commercial déclaré; les prochaines étapes naturelles seraient une validation sur matériel réel à grande échelle et l'intégration dans des pipelines de fine-tuning continu sur robots déployés.

RechercheOpinion
1 source
ARTOO-DARTU : étude de la collaboration humain-robot en réalité augmentée avec atténuation des occlusions pour les tâches d'entrepôt
2119arXiv cs.RO 

ARTOO-DARTU : étude de la collaboration humain-robot en réalité augmentée avec atténuation des occlusions pour les tâches d'entrepôt

Des chercheurs ont publié sur arXiv (arXiv:2606.25202) un système de réalité augmentée baptisé ARTOO-DARTU, conçu pour améliorer la collaboration humain-robot (HRC) en entrepôt logistique. Le principe : superposer en temps réel des informations sur l'état et les intentions du robot directement dans le champ de vision de l'opérateur via un casque AR, tout en évitant que ces couches graphiques n'occultent des éléments critiques du monde réel. L'équipe a développé pour cela un pipeline ODM (Obstruction Detection and Mitigation) qui repositionne dynamiquement les éléments AR lorsque le robot mobile se déplace. L'évaluation a mobilisé 34 participants sur un scénario gamifié appelé Pocket MonstARs, abstraction contrôlée d'une tâche de picking en entrepôt où des monstres virtuels servent de proxies pour les cibles de prélèvement, tandis que des boîtes étiquetées préservent les contraintes d'identification du monde réel. Résultats : avec l'ODM actif, les participants ont affiché une efficacité globale supérieure de 46 % sur la tâche HRC, et se sont révélés 61 % plus rapides sur les sous-tâches nécessitant une visibilité directe du terrain. Ces chiffres méritent d'être mis en perspective : le gain de 46 % n'est observé que lorsque le pipeline ODM est enclenché, ce qui indique que l'AR sans gestion des obstructions peut dégrader les performances plutôt que les améliorer. Pour les intégrateurs logistiques et les équipes de déploiement d'AMR (autonomous mobile robots), le message est structurant : la valeur des analytics AR situationnels est conditionnelle à la qualité de leur intégration perceptuelle, pas seulement à la richesse des données affichées. Cela valide l'hypothèse que le sim-to-real gap en HRC n'est pas uniquement mécanique, mais aussi cognitif : l'interface compte autant que le robot. Le domaine de l'AR appliquée à la robotique industrielle reste fragmenté. Des travaux antérieurs ont exploré les overlays statiques ou les interfaces sur tablette, mais peu traitent le cas dynamique des robots mobiles où la position de l'annotation change en continu. ARTOO-DARTU s'inscrit dans un effort plus large pour rendre les floors robotisés auditable et sûrs sans mobiliser des opérateurs hautement qualifiés. Côté concurrentiel, des acteurs comme RealWear (casques AR industriels), PTC Vuforia ou encore des startups françaises comme Immersion se positionnent sur des segments adjacents. L'étude reste cependant dans un cadre académique contrôlé et gamifié : aucun déploiement réel en entrepôt n'est annoncé à ce stade, et la robustesse de l'ODM face à des environnements industriels bruités (éclairage variable, occlusions dynamiques multiples) reste à démontrer.

RecherchePaper
1 source
ReaDy-Go : simulation dynamique réel-vers-sim par Gaussian Splatting 3D pour la navigation visuelle avec obstacles mobiles
2120arXiv cs.RO 

ReaDy-Go : simulation dynamique réel-vers-sim par Gaussian Splatting 3D pour la navigation visuelle avec obstacles mobiles

Des chercheurs présentent dans un preprint arXiv (référence 2602.11575, troisième version) un pipeline baptisé ReaDy-Go qui vise à combler l'écart simulation-réalité pour la navigation visuelle robotique en environnements dynamiques. Le principe : reconstruire une scène réelle cible (domicile, restaurant, usine) sous forme de nuage de gaussiennes 3D (Gaussian Splatting, ou GS), puis y insérer des avatars humains animables, eux aussi représentés en GS photoreáliste, dont les mouvements sont synthétisés à partir de trajectoires 2D. Un planificateur expert dédié aux représentations GS dynamiques, couplé à un planificateur humain, génère ensuite automatiquement des milliers de scénarios de navigation depuis des points de vue arbitraires. Les politiques de navigation entraînées sur ces datasets sont ensuite déployées sur robot physique. Les auteurs rapportent des gains de performance en simulation et en conditions réelles face à des obstacles mobiles, ainsi qu'un transfert zero-shot dans un environnement inédit, ce qui suggère une capacité de généralisation au-delà des scènes d'entraînement. L'enjeu industriel est significatif pour les intégrateurs de robots de service et les concepteurs de systèmes AMR (autonomous mobile robots) en environnements non contrôlés. Le verrou principal que ReaDy-Go cherche à lever est double : les méthodes classiques souffrent d'un sim-to-real gap important parce que les scènes d'entraînement sont génériques, et les obstacles dynamiques y sont soit absents, soit représentés par des mannequins non photoréalistes issus de simulateurs comme Isaac Sim ou Gazebo. En ancrant la simulation dans une reconstruction GS de l'environnement cible réel et en peuplant cette scène d'avatars humains photoréalistes et cinématiquement plausibles, l'approche réduit la distance de distribution entre entraînement et déploiement. Il s'agit d'une contribution méthodologique, pas d'un produit commercialisé ; les résultats restent à ce stade des démonstrations académiques, et les métriques annoncées (temps de cycle, taux de succès) gagneraient à être contextualisées par des conditions de test plus variées. Le Gaussian Splatting a émergé comme technique de reconstruction 3D rapide et photoréaliste depuis les travaux de Kerbl et al. en 2023, et plusieurs groupes l'ont depuis exploré pour la simulation robotique, notamment pour la manipulation (voir les travaux de RoboGSim ou GaussianWorld). ReaDy-Go se distingue en ciblant la navigation en présence de piétons, un cas d'usage critique pour les robots de livraison indoor et les plateformes de service en espace public. Sur ce segment, les concurrents directs incluent les pipelines basés sur NeRF (plus lents à l'entraînement), les simulateurs procéduraux type NVIDIA Omniverse, et des approches comme UniSim ou HabitatSim. Aucun acteur européen n'est cité dans le preprint, mais des équipes comme Enchanted Tools (robotique de service, France) ou les labos de navigation de l'INRIA pourraient trouver dans ReaDy-Go une brique de simulation réutilisable. La page projet est accessible et le code pourrait être publié ; les prochaines étapes naturelles seraient des tests à plus grande échelle avec diversité de populations et d'environnements, et une intégration dans des stacks de navigation open-source comme Nav2.

RecherchePaper
1 source
Bibliothèques de politiques compactes par adaptation de rang faible en apprentissage par renforcement
2121arXiv cs.RO 

Bibliothèques de politiques compactes par adaptation de rang faible en apprentissage par renforcement

Des chercheurs ont publié sur arXiv (référence 2606.25700) un article explorant l'application de LoRA (Low-Rank Adaptation) au domaine de la robotique et de l'apprentissage par renforcement (RL). La technique, largement adoptée pour le fine-tuning des grands modèles de langage, est ici appliquée à un algorithme PPO (Proximal Policy Optimization) pour créer des bibliothèques de politiques spécialisées multi-tâches. Les résultats principaux : une réduction mémoire d'un facteur 20 à 160 par rapport au fine-tuning classique de l'ensemble des couches, soit une économie de stockage de 90 à 95 % lors du déploiement d'une bibliothèque de 10 à 50 politiques spécialisées. Point notable : aucune dégradation significative du taux de succès n'est observée entre le fine-tuning complet et la version LoRA sur les tâches testées. L'enjeu concret pour les intégrateurs robotiques est précis : embarquer une bibliothèque complète de politiques spécialisées en RAM ou basculer en swap-memory sur le matériel embarqué représente un seuil opérationnel critique. Sur un robot industriel ou un système d'inspection autonome gérant 20 à 50 tâches distinctes, la différence entre "tout tient en mémoire vive" et "le système pagine" peut conditionner la latence, la fiabilité temps-réel et les coûts matériels. La conservation du taux de succès sans full fine-tuning suggère par ailleurs que les couches basses du réseau de politique encodent déjà des représentations suffisamment généralisables pour être partagées entre tâches, ce qui conforte l'hypothèse d'un transfert de compétences entre politiques spécialisées sans réapprentissage coûteux. LoRA a été formalisée en 2021 par Hu et al. dans le contexte des LLMs, où elle est devenue un standard du fine-tuning sur matériel contraint. Son transfert au RL n'est pas trivial : les dynamiques d'entraînement par essai-erreur diffèrent structurellement de l'apprentissage supervisé sur lequel LoRA a été validée. Ce preprint est une preuve de concept préliminaire, sans institution ni auteurs nommés dans l'abstract, et sans description détaillée des tâches robotiques testées, ce qui limite l'évaluation de la généralisation des résultats. Dans l'écosystème concurrent, des travaux sur la distillation de politiques (policy distillation), la compression de réseaux pour l'embarqué robotique, et les architectures de fondation pour la robotique (pi0 de Physical Intelligence, GR00T N2 de NVIDIA) explorent des pistes parallèles pour réduire l'empreinte computationnelle à l'inférence. La prochaine étape naturelle serait une validation sur des robots physiques avec contraintes mémoire réelles.

RecherchePaper
1 source
RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement
2122arXiv cs.RO 

RGB : MPPI corps entier pour humanoïdes guidé par apprentissage par renforcement

Une équipe de recherche a publié sur arXiv (référence 2606.25123) une architecture de contrôle hybride baptisée RGB, pour "RL Guided whole-body MPPI", destinée aux robots humanoïdes évoluant dans des environnements à contacts complexes. Le framework a été évalué en simulation MuJoCo sur un Unitree G1 à 29 degrés de liberté, avec une fréquence de contrôle moyenne de 280 Hz. Le principe : au lieu d'utiliser une politique d'apprentissage par renforcement (RL) comme contrôleur final, RGB l'emploie comme prior d'échantillonnage pour guider les rollouts d'un algorithme MPPI (Model Predictive Path Integral). Les objectifs de tâche sont définis via des termes de coût modulaires MPPI, qui corrigent en ligne la politique RL pour satisfaire ces objectifs sans nécessiter de réentraînement. Les tests montrent une réduction de la dérive systématique en marche rectiligne et une meilleure capacité à suivre des signaux de référence corps entier supplémentaires, comparé à une politique RL pure sous la même interface de commande. L'intérêt industriel de cette approche réside dans la rigidité structurelle des politiques RL actuelles : une fois entraînée, une politique couple fortement son comportement à l'objectif d'entraînement et à l'interface de commande. Ajouter un nouvel objectif de feedback (correction de trajectoire, contrainte de contact, suivi d'un membre spécifique) exige généralement un réentraînement complet, coûteux et long. RGB court-circuite cette contrainte en déléguant la précision et la modularité au MPPI, qui opère en boucle fermée à haute fréquence. Pour un intégrateur industriel ou un COO qui doit adapter un humanoïde à plusieurs lignes de production, la possibilité de spécifier de nouveaux comportements via des termes de coût, sans retouch au modèle RL sous-jacent, représente un gain de flexibilité concret. La fréquence de 280 Hz en simulation est encourageante, mais les auteurs ne démontrent pas encore le transfert sim-to-real, ce qui reste le saut critique pour toute validation industrielle. Le cadre MPPI est une technique de contrôle prédictif par échantillonnage bien établie en robotique mobile et manipulation, mais son couplage avec une politique RL comme prior pour les humanoïdes corps entier est une direction récente. Unitree, dont le G1 est devenu une plateforme de recherche courante grâce à son accessibilité commerciale (autour de 16 000 dollars), est au coeur de nombreux travaux académiques concurrents, notamment autour des architectures VLA (Vision-Language-Action) de type GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence. RGB se positionne dans un créneau distinct : il ne vise pas la généralisation via des données de démonstration, mais l'optimisation en ligne de politiques existantes. La prochaine étape logique sera une validation sur hardware réel, déterminante pour établir si les 280 Hz de simulation se maintiennent face aux incertitudes mécaniques et aux latences capteurs d'un vrai G1.

RecherchePaper
1 source
fARfetch : collaboration homme-robot en réalité augmentée colocalisée dans des environnements visuellement hétérogènes, avec adaptation de contenu par VLM
2123arXiv cs.RO 

fARfetch : collaboration homme-robot en réalité augmentée colocalisée dans des environnements visuellement hétérogènes, avec adaptation de contenu par VLM

Des chercheurs ont publié sur arXiv (juin 2026) les résultats de fARfetch, un système de collaboration humain-robot en réalité augmentée conçu pour les environnements extérieurs vastes et visuellement hétérogènes. Le dispositif combine un casque Meta Quest 3 et un robot quadrupède Unitree Go2, et repose sur trois mécanismes : une cartographie sémantique partagée entre le casque et le robot qui visualise des repères de l'environnement pour émettre des commandes de navigation par désignation, une représentation miniaturisée de l'espace (world-in-miniature) pour composer des trajectoires précises, et un module d'adaptation visuelle piloté par un VLM (vision-language model) qui ajuste en temps réel la couleur, la taille et l'orientation des éléments AR afin de maintenir leur lisibilité quelle que soit l'arrière-plan. L'évaluation a été conduite en conditions réelles sur une tâche d'inspection extérieure d'environ 30,5 mètres avec 13 participants en protocole intra-sujets. Par rapport à une baseline sans AR, fARfetch réduit le temps d'exécution de 66 %, la charge mentale de 43 %, la pression temporelle de 34 % et le niveau de frustration de 66 %. Ces résultats sont significatifs pour les intégrateurs de robotique mobile en milieux industriels ouverts (sites de construction, inspection d'infrastructure, logistique extérieure) où la téléopération classique bute sur la désorientation spatiale de l'opérateur et la perte de ligne de vue. L'usage d'un VLM pour l'adaptation du rendu AR constitue une avancée méthodologique : plutôt que de coder des règles statiques de contraste, le système raisonne sur le contexte visuel capturé. Cela suggère que la grille sim-to-real ne se limite plus aux actionneurs physiques mais s'étend à la couche d'interaction humain-machine. L'étude reste toutefois limitée : N=13 est un échantillon restreint, la tâche couvre 30,5 mètres en extérieur contrôlé, et aucune métrique de robustesse en conditions adverses (pluie, contre-jour fort, foule) n'est rapportée. fARfetch s'inscrit dans un champ de recherche actif sur l'AR comme interface de supervision de robots mobiles, aux côtés de travaux portant sur les drones et les AMR en entrepôt. Côté hardware, le Unitree Go2 est un quadrupède grand public à moins de 10 000 dollars, ce qui ancre l'expérimentation dans des configurations accessibles, contrairement aux plateformes à six chiffres de Boston Dynamics. Aucun acteur français ou européen n'est impliqué dans cette étude. Les auteurs n'annoncent pas de pilote industriel ni de timeline de déploiement : il s'agit d'un prototype académique dont les prochaines étapes naturelles seraient des évaluations sur des périmètres plus étendus, avec des opérateurs non entraînés et des robots à mobilité différente (bras, AMR sur roues).

RecherchePaper
1 source
StairMaster : apprendre à franchir des escaliers ajourés périlleux pour robots quadrupèdes agiles
2124arXiv cs.RO 

StairMaster : apprendre à franchir des escaliers ajourés périlleux pour robots quadrupèdes agiles

Des chercheurs ont publié sur arXiv (2606.25765) un système baptisé StairMaster, un cadre d'apprentissage par renforcement en trois étapes permettant à un robot quadrupède Unitree Go2 de gravir des escaliers creux avec une inclinaison jusqu'à 55 degrés en transfert zéro-shot depuis la simulation. L'architecture combine un mécanisme d'attention croisée (Cross-Attention) pour extraire des structures depuis des données de profondeur bruitées, une unité récurrente spatiale (SRU) maintenant une mémoire spatio-temporelle pour compenser les zones aveugles de perception, et un pipeline de modélisation haute-fidélité du capteur de profondeur en simulation répliquant les artefacts réels. Des récompenses de perception active guidées par waypoints 3D et des pénalités cinématiques sur les barreaux creux et les arêtes de marches assurent un placement précis des appuis. Ce résultat s'attaque à l'un des problèmes les plus difficiles de la locomotion quadrupède en milieu industriel : les escaliers à barreaux creux exposent les pattes au risque de coincement, génèrent une densité de points de profondeur très faible et un bruit haute fréquence difficile à filtrer. Que le système tienne à 55 degrés sans ré-entraînement sur le robot réel valide deux hypothèses que le secteur testait depuis plusieurs années : la modélisation fidèle des artefacts capteurs peut combler le sim-to-real gap sur la perception de profondeur, et des politiques RL peuvent généraliser à des terrains extrêmes en zéro-shot. Pour les intégrateurs déployant des robots sur des infrastructures multi-niveaux, passerelles métalliques ou escaliers de secours, ce type de politique ouvre des scénarios jusqu'ici inaccessibles. Le Unitree Go2 est devenu un banc d'essai académique de référence pour la locomotion RL, aux côtés de l'ANYmal d'ANYbotics et du Spot de Boston Dynamics. Des équipes d'ETH Zurich (RSL), CMU et UC Berkeley ont publié des politiques sur terrains difficiles, mais aucune ne revendiquait jusqu'ici le franchissement d'escaliers creux à cette inclinaison en zéro-shot. Les auteurs ne citent aucun partenariat industriel ni timeline de déploiement commercial : il s'agit à ce stade d'un résultat de laboratoire avec démonstration vidéo, dont la robustesse en conditions réelles à plus grande échelle reste à valider.

RecherchePaper
1 source
RigPI : identification des paramètres dynamiques d'un corps rigide par simulation différentiable guidée par VLM
2125arXiv cs.RO 

RigPI : identification des paramètres dynamiques d'un corps rigide par simulation différentiable guidée par VLM

Des chercheurs présentent RigPI (arXiv:2606.25212, juin 2026), un framework d'identification des paramètres dynamiques d'objets rigides manipulés par un bras robotique, sans connaissance préalable de leurs propriétés physiques. Le système fusionne trois sources : un modèle vision-langage (VLM) qui initialise sémantiquement les estimations à partir de l'apparence de l'objet, des capteurs force-couple pour capturer les interactions réelles, et un simulateur physique différentiable qui affine les paramètres par descente de gradient. RigPI couvre les objets libres non contraints et les corps multi-articulés à joints rotoïdes ou prismatiques. Une optimisation en deux étapes atténue la sensibilité au bruit et évite les solutions physiquement aberrantes. Des expériences en conditions réelles valident que le robot reproduit fidèlement les trajectoires de manipulation en utilisant les paramètres identifiés. L'enjeu pour l'industrie est direct : construire des jumeaux numériques fiables exige de connaître les propriétés inertielles et frictionnelles d'un objet inconnu, pas seulement sa géométrie. Les pipelines classiques d'identification de système déraillent face au bruit capteur, aux erreurs de modèle et à l'absence de prior. RigPI innove sur deux fronts : l'usage d'un VLM comme oracle physique pour contraindre l'espace de recherche avant optimisation numérique, réduisant le risque de minima locaux incohérents ; et l'exploitation de la simulation différentiable pour propager des gradients analytiques plutôt que de procéder par essais-erreurs. Pour un intégrateur ou un responsable de production, cela signifie qu'une cellule de manipulation peut s'auto-calibrer sur un nouvel objet sans intervention humaine, comprimant les délais de mise en service. Ce travail prend place dans un effort de recherche dense autour de la simulation différentiable en robotique, où des groupes de MIT, Stanford et de laboratoires comme DeepMind publient des approches parallèles. Le sim-to-real sur les paramètres physiques reste un problème ouvert : la majorité des pipelines actuels supposent des masses et frictions connues, ou les approximent grossièrement. RigPI est à ce stade un prototype académique, preprint non encore peer-reviewé, sans partenaire industriel annoncé. Les prolongements logiques incluent l'intégration avec des politiques VLA (vision-language-action) pour fermer la boucle perception-identification-contrôle, et l'extension aux matériaux déformables ou aux contacts multi-points.

RecherchePaper
1 source
Contrôle prédictif événementiel piloté par les données via apprentissage par renforcement profond pour un bras souple à câbles 3D
2126arXiv cs.RO 

Contrôle prédictif événementiel piloté par les données via apprentissage par renforcement profond pour un bras souple à câbles 3D

Des chercheurs ont publié sur arXiv (arXiv:2606.26048v1) un framework de contrôle hybride baptisé RL-ET-DeePC, combinant apprentissage par renforcement (RL) sans modèle et contrôle prédictif basé sur les données (DeePC) avec déclenchement événementiel, appliqué à un bras souple câblé à trois dimensions. L'approche repose sur une politique RL entraînée à décider dynamiquement quand activer le solveur d'optimisation DeePC, plutôt que de le lancer à chaque pas d'échantillonnage comme le fait le DeePC périodique classique. En simulation, le framework réduit la fréquence d'appel au solveur jusqu'à 66 % sans dégradation mesurable de la précision de suivi de trajectoire. Sur le banc physique, le transfert s'effectue en zero-shot, c'est-à-dire sans réentraînement ni adaptation, avec une réduction de 34 % des appels d'optimisation, une précision de suivi comparable au DeePC périodique, et des performances plus régulières qu'un déclenchement événementiel à seuil statique. L'enjeu est directement industriel : le DeePC standard, qui évite la modélisation explicite en exploitant les trajectoires entrée-sortie mesurées, bute sur le coût computationnel de son optimisation en horizon glissant à chaque cycle. Sur des plateformes embarquées à ressources limitées, ce verrou bloque le déploiement temps réel. En déléguant la décision de déclenchement à une politique RL légère, RL-ET-DeePC rend le contrôle prédictif viable sur matériel contraint, tout en validant un transfert sim-to-real zero-shot sur un système souple, dont les dynamiques non linéaires et variant dans le temps constituent précisément le défi classique du gap simulation-réalité. C'est un résultat notable : les robots souples sont réputés récalcitrants au sim-to-real, et une réduction de 34 % des appels solveur sur hardware sans recalibration ouvre la voie à des architectures plus légères. Le DeePC, introduit autour de 2019 comme alternative data-driven aux MPC classiques, souffre depuis de son coût en ligne. Les travaux sur le déclenchement événementiel (event-triggered control) cherchent depuis plusieurs années à conditionner l'appel au solveur à des critères d'état système, mais les seuils statiques manquent d'adaptabilité. L'usage du RL pour apprendre ce critère de déclenchement constitue la nouveauté architecturale centrale de ce papier. Dans le paysage des robots souples, les approches concurrentes incluent les contrôleurs basés sur des réseaux de neurones récurrents (LSTM, Echo State Networks) et les méthodes Koopman pour la linéarisation. Ce travail positionne RL-ET-DeePC comme une alternative sans modèle et computationnellement frugale, avec des perspectives de déploiement sur des bras chirurgicaux, des grippers adaptatifs, ou des exosquelettes souples où la puissance de calcul embarquée reste contrainte.

RecherchePaper
1 source
MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique
2127arXiv cs.RO 

MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique

Des chercheurs présentent MAPL (Multi-Objective AI-Informed Preference Learning), un cadre d'apprentissage par renforcement pour la locomotion quadrupède qui remplace les fonctions de récompense manuelles par des préférences générées par LLM. Publié sur arXiv (réf. 2606.25398) en juin 2025, le système soumet des paires de trajectoires à un grand modèle de langage, qui les évalue selon plusieurs critères sémantiques distincts, formulés en langage naturel générique et invariants selon le terrain. Ces préférences par objectif alimentent un modèle de scoring à plusieurs têtes, dont les sorties sont agrégées en récompense scalaire pour l'optimisation de politique. Sur quatre environnements de simulation quadrupède, les auteurs rapportent des performances comparables ou supérieures à des récompenses conçues par des experts du domaine. L'intérêt de MAPL tient à sa décomposition structurée des objectifs, là où les méthodes LLM existantes se limitent à un jugement global entre comportements. En robotique industrielle, la conception de fonctions de récompense reste un goulot d'étranglement reconnu, exigeant de longues itérations entre ingénieurs RL et spécialistes métier. Substituer ce travail par des descriptions en langage naturel, réutilisables sans réécriture d'équations, réduirait le coût d'adaptation à de nouvelles tâches. La décomposition en critères distincts offre aussi une meilleure interprétabilité : il devient possible d'identifier quels objectifs sont en tension, ce qui facilite le débogage comportemental. MAPL s'inscrit dans la vague d'automatisation de la conception de récompenses via LLM, initiée notamment par EUREKA (NVIDIA, 2023), qui générait directement du code de récompense via GPT-4, et par RL-VLM-F, qui exploite des modèles vision-langage pour évaluer les comportements. La locomotion quadrupède est un benchmark standard utilisé par des projets comme ANYmal (ETH Zurich) et les plateformes Unitree. Plusieurs limites méritent d'être signalées : l'article reste un preprint non relu par les pairs, les expériences sont menées uniquement en simulation sans validation physique, et le LLM utilisé pour générer les préférences n'est pas spécifié, ce qui complique la reproductibilité. Les extensions naturelles concernent la validation sur robot réel et l'application à des morphologies plus complexes, comme les humanoïdes, où l'ingénierie de récompense est particulièrement coûteuse.

RecherchePaper
1 source
MIL-LC : architecture robuste de localisation multimodale par fusion magnétomètre-inertiel-LiDAR
2128arXiv cs.RO 

MIL-LC : architecture robuste de localisation multimodale par fusion magnétomètre-inertiel-LiDAR

Une équipe de recherche publie sur arXiv (identifiant 2606.25796, juin 2026) un framework de localisation multimodale baptisé MIL-LC, qui fusionne trois sources de données : un magnétomètre, une centrale inertielle (IMU) et un LiDAR, montés sur une suite de capteurs conçue spécifiquement pour les robots mobiles autonomes (AMR). Le système cible les environnements où le GPS est absent et où les méthodes classiques échouent : parkings souterrains, hôtels, open-spaces à géométrie répétitive ou sans texture distinctive. MIL-LC est conçu pour maintenir une localisation fiable dans deux scénarios critiques : la dégénérescence géométrique du LiDAR (tunnels, couloirs uniformes), et l'évolution de la carte magnétique au fil du temps lors de déploiements longue durée. Les résultats présentés couvrent des tests en simulation et en environnement réel, sans chiffres de précision publiés dans le résumé disponible. L'intérêt industriel réside dans la promesse d'un déploiement sans infrastructure supplémentaire. Les solutions actuelles de localisation indoor pour AMR s'appuient soit sur des features géométriques ou visuelles (fragiles en environnement répétitif), soit sur des balises UWB, Wi-Fi ou QR (coût d'installation, maintenance, rigidité de déploiement). Le champ magnétique ambiant (AMF), lui, est omniprésent et ne nécessite aucun équipement terrain. L'apport de MIL-LC est de transposer cette idée, jusqu'ici explorée uniquement en contexte piéton avec des smartphones, à un AMR équipé d'une suite capteurs dédiée. Pour un intégrateur ou un COO industriel, cela signifie potentiellement réduire les prérequis d'installation dans des bâtiments complexes, un frein récurrent à l'adoption. La fusion magnétomètre-IMU pour la localisation piétonne a été explorée depuis plusieurs années par des laboratoires de robotique (notamment en Chine, en Europe et au Japon), mais son application aux AMR industriels restait largement ouverte. Les alternatives dominantes sur le marché AMR indoor incluent le SLAM LiDAR pur (Sick, Hokuyo, Livox), la vision (Boston Dynamics, Locus Robotics), et les systèmes hybrides LiDAR+vision. Côté français, des acteurs comme Exotec (logistique) ou Balyo déploient des AMR en entrepôts structurés, moins exposés aux environnements dégradés ciblés ici. MIL-LC reste pour l'instant une contribution académique en preprint, sans annonce de déploiement ni de partenariat industriel. Une soumission vers une conférence de référence (ICRA ou IROS) constituerait la prochaine étape naturelle avant toute validation à l'échelle.

RecherchePaper
1 source
GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots
2129arXiv cs.RO 

GROVE : simulation de piétons fondée sur le langage naturel pour la navigation sociale interactive de robots

GROVE (Grounded Robot-Oriented Vehicle Environment), présenté dans un preprint arXiv (2606.25504) déposé fin juin 2026, est un framework de simulation de piétons piloté par langage naturel, conçu pour entraîner et évaluer des robots de navigation sociale. Le système accepte des instructions textuelles pour générer des scénarios de simulation: trois presets préconfigurés couvrent les situations d'urgence, de file d'attente et de déplacement ordinaire, mais l'utilisateur peut aussi saisir un prompt libre pour obtenir un scénario entièrement personnalisé. Trois modules distincts gèrent respectivement le comportement humain à long horizon (trajectoires et intentions globales), la navigation piétonne à moyen horizon (évitement, flots de foule), et les interactions sociales à court horizon entre robot et individus. GROVE s'intègre nativement dans Isaac Sim (NVIDIA), Gazebo et RViz. Les scènes de validation couvrent des environnements résidentiels, hospitaliers et de bureau. Le principal verrou que GROVE cherche à lever est le coût de génération manuelle de données de simulation: aujourd'hui, produire un scénario crédible (couloir d'hôpital en heure de pointe, évacuation d'urgence) exige un travail de paramétrage fastidieux, répété à chaque variante. Déléguer cette configuration au langage naturel réduit la friction pour les équipes non-spécialistes et accélère la diversification des données d'entraînement. La sélection dynamique des algorithmes de l'état de l'art par module vise explicitement à comprimer le sim-to-real gap, défaillance structurelle qui pénalise le transfert des politiques apprises en simulation vers des robots déployés en milieu réel. Sur le papier, l'architecture modulaire permet aussi de mettre à jour chaque couche indépendamment quand un nouvel algorithme de navigation ou de prédiction de trajectoire devient disponible. La navigation sociale robotique est un champ actif depuis plus d'une décennie, avec des modèles fondateurs comme le Social Force Model et des outils de simulation existants (PedSim, pedsim\_ros, SEAN) qui imposaient des paramétrages rigides et manuels. GROVE s'inscrit dans une tendance plus large d'utilisation des LLM comme interface de configuration pour les pipelines de simulation, une direction explorée parallèlement dans la génération procédurale de scènes 3D. Important à noter: la validation présentée est uniquement qualitative, sans benchmark quantitatif sur des métriques standardisées comme celles de trajnet++ ou BARN. Les affirmations sur la "haute fidélité" de simulation restent donc à vérifier sur robot réel. Le preprint ne mentionne ni déploiement en production ni partenariat industriel.

RecherchePaper
1 source
MANGO : génération automatisée d'oracles de test multi-agents pour les modèles vision-langage-action
2130arXiv cs.RO 

MANGO : génération automatisée d'oracles de test multi-agents pour les modèles vision-langage-action

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.24815) un framework nommé MANGO, pour Multi-Agent test oracle GENeration for Vision-Language-Action models. Les modèles VLA constituent la nouvelle génération de systèmes de contrôle robotique : ils intègrent dans une architecture unifiée la perception visuelle, la compréhension du langage naturel et la génération d'actions motrices. L'approche dominante pour les tester repose sur des oracles symboliques écrits manuellement, des fonctions qui évaluent si un robot a accompli sa tâche à partir de l'état final de l'environnement. MANGO automatise cette étape via un pipeline de trois agents LLM collaboratifs : un Generator qui produit une bibliothèque d'actions atomiques réutilisables, un Assessor qui ancre ces définitions dans le simulateur, et un Judge qui arbitre et affine les artefacts par feedback itératif. Le système a été évalué sur les benchmarks LIBERO_10 et RoboCasa Humanoid Tabletop. L'intérêt principal est de supprimer le goulot d'étranglement humain dans la qualification des robots VLA. Les oracles symboliques actuels exigent une expertise domaine significative et restent couplés à une tâche précise, ce qui limite fortement leur réutilisation dès qu'on change de scénario ou de cellule de travail. MANGO génère des oracles à grain fin capables d'évaluer des étapes intermédiaires, pas seulement l'état final, ce qui améliore la localisation des pannes : au lieu de constater qu'un robot a échoué, on identifie quelle action atomique a dévié. Les résultats montrent une détection de défauts comparable aux oracles symboliques manuels avec une couverture diagnostique plus riche, un levier direct pour les équipes QA qui valident des flottes de robots VLA en production. Les modèles VLA ont connu une accélération marquée depuis 2024 avec Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI et plusieurs variantes issues des laboratoires académiques. Tous partagent le même point faible : leur validation reste artisanale, peu reproductible, et difficile à passer à l'échelle. MANGO s'inscrit dans un effort croissant pour combler le fossé entre démos en laboratoire et déploiement industriel, en dotant les pipelines CI/CD robotiques d'outils d'évaluation automatisés. L'article demeure un preprint non relu par les pairs et le code n'est pas encore publié, ce qui invite à nuancer les résultats avant toute adoption. La prochaine étape naturelle serait une validation sur environnements physiques réels, au-delà des scénarios de manipulation sur table couverts par les benchmarks actuels.

RechercheOpinion
1 source
Planification de mouvement adaptative aux événements avec un modèle vision-langage distillé en situations critiques
2131arXiv cs.RO 

Planification de mouvement adaptative aux événements avec un modèle vision-langage distillé en situations critiques

Une équipe de chercheurs a déposé le 25 juin 2026 sur arXiv (réf. 2606.25629) un cadre algorithmique baptisé EAMP (Event-Adaptive Motion Planning) pour la navigation robotique en environnements logistiques à criticité sécurité. Le système repose sur trois modules imbriqués : un déclencheur sémantique configurable par prompt, le PC-SET, qui surveille en continu de courtes séquences vidéo pour détecter des anomalies comportementales ; un modèle vision-langage allégé, le SemNav-VLM, activé uniquement lors d'une anomalie avérée, qui produit des décisions stratégiques discrètes ; et un module de contrôle prédictif sémantique (SMPC) qui traduit ces décisions en reconfiguration des objectifs d'optimisation et des références géométriques du planificateur bas niveau. Le SemNav-VLM est obtenu par distillation d'un grand modèle vision-langage (VLM), guidée par des vérifications de cohérence physique, ce qui préserve le raisonnement de bon sens du modèle parent tout en réduisant drastiquement la latence d'inférence. Les expériences sont menées dans des scénarios logistiques simulés. L'enjeu adressé est structurel pour la robotique mobile industrielle : dans les entrepôts et environnements mixtes, la majorité des collisions ne provient pas d'obstacles statiques inédits, mais du comportement imprévisible d'agents dynamiques, opérateurs humains, chariots élévateurs, autres robots autonomes. Les VLMs, capables d'un raisonnement contextuel robuste sur ces situations, sont jusqu'ici incompatibles avec la boucle de contrôle temps-réel en raison de leur latence computationnelle, qui déstabilise l'exécution physique. EAMP résout cette contradiction par déclenchement conditionnel : le modèle allégé n'est invoqué qu'en présence d'une anomalie, préservant l'efficacité temps-réel sans sacrifier la capacité de raisonnement sémantique. Les résultats indiquent une amélioration significative des marges de sécurité dynamiques par rapport aux baselines existantes. Il s'agit néanmoins d'une démonstration en simulation ; aucune validation sur robot physique réel n'est rapportée dans cette version du preprint. Ce travail s'inscrit dans une tendance de fond de 2025-2026 : intégrer les capacités de raisonnement des grands modèles dans des architectures de planification classiques (MPC, RRT) sans sacrifier la réactivité temps-réel. Les approches concurrentes incluent les modèles VLA (Vision-Language-Action) de bout en bout comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui fusionnent différemment raisonnement et action à l'échelle. La distillation supervisée par contraintes physiques est une direction active pour compresser ces modèles sans dégradation critique. Côté déploiement, des acteurs comme Exotec (France, système Skypod) opèrent déjà dans des entrepôts mixtes humains-robots où la problématique des agents dynamiques est centrale ; un cadre comme EAMP pourrait constituer une brique de planification adaptative pour ces systèmes, à condition d'une validation physique que les auteurs n'ont pas encore fournie.

RecherchePaper
1 source
SurveilNav : navigation collaborative vers des objets cibles avec robot et système de surveillance
2132arXiv cs.RO 

SurveilNav : navigation collaborative vers des objets cibles avec robot et système de surveillance

Une équipe de chercheurs propose SurveilNav, un système de navigation collaborative couplant un robot mobile à un réseau de caméras de surveillance fixes pour localiser des objets dans des espaces intérieurs de grande surface. Présenté sous forme de preprint arXiv (arXiv:2606.25119, juin 2026), le travail introduit un jeu de données inédit construit sur le simulateur Habitat-Sim, comportant 206 caméras réparties sur 74 étages. Le framework s'articule autour de quatre composants : un ordonnanceur de caméras actives, une cartographie conjointe 2D/3D, une estimation de valeur fondée sur un VLM (Vision-Language Model), et une vérification collaborative de la cible détectée. Évalué sur le benchmark HM3D (Habitat-Matterport 3D), SurveilNav atteint des résultats état de l'art en efficacité d'exploration et en taux de succès de navigation par rapport aux méthodes mono-agent existantes. L'intérêt technique tient à la complémentarité des deux types de perception : un robot mobile dispose d'une vue dynamique locale mais limitée par sa portée et ses angles morts, tandis qu'un réseau de caméras fixes offre une couverture globale statique, incomplète par construction. SurveilNav fusionne ces deux sources en temps réel via cartographie 3D partagée et estimation sémantique par VLM, permettant de prioriser les zones à explorer sans balayage exhaustif. Pour les intégrateurs industriels opérant dans des entrepôts ou usines déjà équipés d'infrastructure vidéo, la proposition est directement pertinente : elle exploite un actif existant (le réseau CCTV) pour augmenter les capacités des AMR sans modifier le matériel. L'usage du VLM pour l'estimation de valeur sémantique reste néanmoins un point à surveiller, les auteurs ne précisant pas la latence d'inférence ni sa compatibilité avec une navigation temps réel en conditions réelles. Le champ de l'Object Goal Navigation (OGN) s'est principalement construit sur des architectures mono-agent et des environnements simulés (Habitat, AI2-THOR, Gibson). L'extension vers un réseau de capteurs fixes hétérogènes représente une direction logique vers des scénarios industriels réels, où bâtiments tertiaires et usines sont massivement équipés de systèmes CCTV. Les travaux concurrents sur la navigation multi-robot, comme MultiON ou CoNav, restent centrés sur la coopération entre agents mobiles homogènes et ne tirent pas parti de l'infrastructure fixe existante. Aucun acteur européen n'est impliqué selon le résumé disponible. Les débouchés envisagés, dont la recherche en zone sinistrée (search-and-rescue) et la domotique, restent au stade de la validation en simulation : aucun déploiement terrain ni partenariat industriel n'est annoncé.

RecherchePaper
1 source
Emcar : contrôleur incarné pour l'animation de robots
2133arXiv cs.RO 

Emcar : contrôleur incarné pour l'animation de robots

Une équipe de chercheurs a publié le 25 juin 2026 sur arXiv (2506.26008) la description d'EMCAR, un outil logiciel de programmation de mouvements robotiques basé sur des métaphores artistiques comme la marionnette et le dessin. La plateforme, présentée dans le cadre de la recherche en interaction humain-robot (HRI), adopte une approche no-code : aucune ligne de code n'est requise pour concevoir, tester et déployer des comportements sur des robots collaboratifs. L'article ne précise pas de plateformes matérielles cibles ni de métriques de performance (temps de programmation, taux d'erreur), ce qui limite l'évaluation des gains réels. L'enjeu central est celui de l'accessibilité : la programmation de cobots reste aujourd'hui l'apanage d'ingénieurs formés en robotique ou en ROS, ce qui freine le déploiement dans des environnements non-industriels (médiation culturelle, thérapie, spectacle vivant). En ouvrant l'outil à des artistes et à des profils sans bagage technique, EMCAR vise à élargir le spectre des cas d'usage HRI et à alimenter la recherche participative. Si la démonstration tient à l'échelle, cela confirmerait que l'abstraction par le geste et le mouvement peut substituer efficacement les interfaces de programmation classiques pour des tâches expressives. Ce type d'approche s'inscrit dans un courant établi : Choreograph de SoftBank Robotics pour Pepper et NAO, les interfaces de programmation par démonstration de Universal Robots, ou encore les environnements visuels Scratch-for-robots développés en milieu académique. Des acteurs français comme Enchanted Tools (Miroki) explorent également des paradigmes d'interaction expressifs pour les cobots. La suite dépendra de l'ouverture du code et des validations expérimentales avec des utilisateurs non-techniques, non encore publiées.

RecherchePaper
1 source
Système de capteurs tactiles capacitifs conçu pour les robots compagnons
2134arXiv cs.RO 

Système de capteurs tactiles capacitifs conçu pour les robots compagnons

Des chercheurs ont publié sur arXiv (référence 2606.25348) un système de captation tactile à capacitance propre (self-capacitance) conçu pour les robots humanoïdes compagnons. L'architecture repose sur une unique couche de tissu conducteur avec un réseau de fils conducteurs, sans nécessiter de gravure d'électrodes complexe. La faisabilité a été démontrée par la fabrication d'un réseau de 100 points de mesure sur un circuit imprimé flexible (FPC). Les tests menés à différentes fréquences d'échantillonnage établissent que 10 Hz sont insuffisants et ratent les événements transitoires, alors que 100 Hz et 1 000 Hz permettent de distinguer fidèlement quatre types d'interactions : toucher léger, tapotement lent, tapotement rapide et impact. Un classifieur à arbre de décision est exécuté directement sur un FPGA, déchargeant le Raspberry Pi 4 embarqué de toute inférence temps réel, avec une latence minimale et une consommation électrique négligeable. Le système est dimensionné pour le robot HIRO-chan. L'intérêt technique de cette approche réside dans sa réponse directe aux trois verrous classiques de la peau artificielle : la complexité de fabrication (structures multicouches, câblage dense), le coût unitaire et l'incapacité à passer à l'échelle vers une couverture corporelle complète. En déléguant l'inférence au FPGA plutôt qu'au processeur principal, les auteurs résolvent également le problème de charge de calcul qui freine l'intégration tactile dans les plateformes à ressources contraintes. Pour les intégrateurs, la démonstration d'un tableau 100 points sur FPC souple est un signal concret : la fabrication de peaux tactiles denses devient accessible sans processus de photolithographie fin. HIRO-chan est un robot humanoïde compagnon d'origine japonaise, positionné sur les usages de proximité sociale plutôt que sur la manipulation industrielle. L'article reste un preprint académique et ne constitue pas une annonce produit ni un déploiement commercial. Le domaine de la peau artificielle voit plusieurs approches en compétition : capteurs piézoélectriques (BioTac, SynTouch), réseaux de capteurs optiques (MIT CSAIL, Meta FAIR), et systèmes à base de matériaux conducteurs élastiques comme celui proposé ici. La capacitance propre se distingue par sa simplicité de lecture mais reste sensible aux interférences électromagnétiques en environnement industriel. Les prochaines étapes logiques seraient une validation sur couverture corporelle partielle et des tests en conditions d'utilisation réelle avec des utilisateurs humains.

RecherchePaper
1 source
GRAFT : transfert d'affordances à base de graphes par correspondance de parties
2135arXiv cs.RO 

GRAFT : transfert d'affordances à base de graphes par correspondance de parties

Des chercheurs ont publié sur arXiv (identifiant 2606.25241) GRAFT, un cadre de transfert d'affordance par correspondance de parties pour la manipulation robotique d'objets inconnus. Le principe : à partir d'un seul exemple par objet stocké dans un buffer de démonstrations, GRAFT permet à un robot de manipuler des instances qu'il n'a jamais vues, sans réentraînement. Chaque objet est représenté sous forme de graphe structuré par parties fonctionnelles, avec deux niveaux de descripteurs : des descripteurs au niveau des parties pour retrouver l'instance la plus proche fonctionnellement et géométriquement dans le buffer, puis des descripteurs au niveau des sommets pour localiser les points de contact précis à propager sur le nouvel objet. Ce que GRAFT apporte de concret, c'est la prise en compte explicite de la géométrie, là où les approches précédentes de transfert d'affordance s'appuyaient uniquement sur la similarité sémantique. Retrouver qu'une cafetière et une théière appartiennent à la même catégorie ne suffit pas si leurs anses diffèrent morphologiquement : le point de préhension optimal change, et un robot guidé uniquement par sémantique rate la saisie. En combinant alignement fonctionnel et correspondance géométrique fine des parties, GRAFT vise à réduire les échecs sur les variantes d'un même objet. Pour des intégrateurs en cellule flexible ou des équipes de bin-picking, cela signifie théoriquement moins de démonstrations à collecter pour couvrir la diversité d'un flux de pièces réel. La généralisation à de nouveaux objets avec peu d'exemples est un frein majeur en manipulation depuis des années : les méthodes d'imitation classiques requièrent typiquement des dizaines à des centaines de démonstrations par objet. Des approches récentes comme AnyGrasp, GraspNet ou les méthodes par affordance visuelle fondées sur CLIP (F3RM, CLIP-Fields) cherchent à réduire ce coût via des fondations vision-langage. GRAFT prend le pari inverse, en misant sur la correspondance structurelle de parties plutôt que sur le langage. Il s'agit d'une pré-publication arXiv sans institution mentionnée dans l'abstract et sans résultats quantitatifs accessibles sans lire le papier complet : les benchmarks de référence (YCB, OCID, RLBench) et les comparaisons avec les baselines restent à consulter dans le corps du travail avant toute conclusion sur les performances réelles.

RecherchePaper
1 source
HEART : coordination d'agents experts hétérogènes pour la planification de tâches robotiques ancrée dans le réel
2136arXiv cs.RO 

HEART : coordination d'agents experts hétérogènes pour la planification de tâches robotiques ancrée dans le réel

Une équipe de chercheurs publie sur arXiv (réf. 2606.25404) HEART, un framework de planification robotique qui distribue le raisonnement entre plusieurs LLM spécialisés plutôt que de confier l'ensemble de la tâche à un seul modèle. Le principe : décomposer une instruction complexe en sous-tâches atomiques (vérification des capacités du robot, analyse de l'atteignabilité des objets, respect des contraintes logiques et temporelles), puis allouer chacune à un agent LLM dédié, le tout sous une contrainte de budget en tokens pour rester viable sur du matériel embarqué ou en communication limitée. La synthèse finale produit un plan d'actions physiquement exécutable, validé avant transmission au robot. Les expériences sur plusieurs benchmarks de scénarios domestiques montrent une amélioration consistante du taux de succès face aux planificateurs mono-LLM et aux approches à base de règles, sans que l'abstract disponible détaille de chiffres absolus. La contribution centrale de HEART est d'intégrer une couche de validation physique avant la génération du plan, un angle mort chronique des approches LLM-only. Les modèles de langage généralisent bien le raisonnement symbolique mais peinent avec les contraintes géométriques réelles : objet hors de portée, séquence d'actions physiquement impossible, outil absent. En déléguant ces vérifications à des agents rôle-spécialisés, le framework réduit le taux de plans invalides ou incomplets. Pour les intégrateurs travaillant sur l'automatisation de tâches non-structurées en environnement domestique ou industriel léger, c'est un signal pertinent : la spécialisation des agents LLM par type de contrainte commence à produire des gains mesurables sur les benchmarks standard. Ce travail s'inscrit dans un courant de recherche actif qui cherche à dépasser les limites du "single LLM as planner", avec des approches comme SayPlan, LLM+P ou Code as Policies comme antécédents directs. Aucun acteur industriel ni déploiement terrain n'est mentionné, et le papier reste un preprint non relu par les pairs. L'absence de métriques chiffrées précises dans l'abstract (taux de succès, nombre de benchmarks, configurations matérielles testées) rend l'évaluation externe difficile. Les prochaines étapes naturelles seraient une validation sur robot physique réel et une comparaison contre des frameworks VLA (Vision-Language-Action) comme pi-0 ou GR00T N2, qui intègrent déjà un raisonnement ancré dans la perception sensorielle.

RecherchePaper
1 source
AISPO : estimation de profondeur fiable pour la manipulation d'objets non lambertiens via a priori de forme invariant affine
2137arXiv cs.RO 

AISPO : estimation de profondeur fiable pour la manipulation d'objets non lambertiens via a priori de forme invariant affine

Une équipe de chercheurs a publié sur arXiv (identifiant 2606.25503) un système de complétion de profondeur baptisé AISPO, destiné à améliorer la fiabilité de la perception 3D lors de la manipulation robotique d'objets à surfaces non-lambertiennes, c'est-à-dire transparents (verres, flacons, plastiques) ou fortement spéculaires (pièces métalliques polies). Ces matériaux posent un problème structurel aux capteurs RGB-D : les mesures de profondeur y sont systématiquement corrompues ou absentes, car ces surfaces ne diffusent pas la lumière infrarouge de façon prévisible. AISPO combine une fusion multi-échelle de caractéristiques RGB-D avec un prior de forme affine-invariant, qui impose une cohérence géométrique locale et corrige les défaillances de profondeur avant qu'elles ne se propagent au planificateur de mouvement et ne génèrent des poses de préhension invalides. L'intérêt industriel est direct : les objets non-lambertiens sont omniprésents en logistique pharmaceutique, en agroalimentaire et en assemblage électronique. La plupart des méthodes de complétion de profondeur existantes sont optimisées pour la précision moyenne sur des benchmarks standardisés, sans garantir la plausibilité physique des cartes de profondeur produites, ce qui suffit pour la reconstruction 3D mais pas pour générer des trajectoires de grasping exécutables. AISPO se distingue en priorisant l'intégrité structurelle des prédictions plutôt que la métrique globale. Les expériences de préhension réelle montrent une amélioration des taux de succès sur objets transparents, bien que l'article ne quantifie pas précisément cet écart, un manque de rigueur notable pour un travail qui se positionne sur la fiabilité. AISPO s'inscrit dans un champ de recherche actif autour de la perception d'objets difficiles à mesurer, aux côtés de travaux comme ClearGrasp (Google Research, 2019) et des jeux de données TransCG et DREDS. La contribution clé est le prior de forme affine-invariant, qui permet une généralisation à des objets et scènes non vus à l'entraînement, un enjeu central du sim-to-real gap. Aucune entreprise industrielle ni laboratoire européen n'est associé à ce travail, qui reste un préprint arXiv sans évaluation par les pairs. Les prochaines étapes naturelles seraient une intégration dans des pipelines de manipulation existants comme OpenVLA ou Pi-0 de Physical Intelligence, et une comparaison quantitative plus rigoureuse sur des benchmarks comme GraspNet-1B.

RecherchePaper
1 source
Apprentissage par renforcement résiduel incrémental pour la navigation sociale en conditions réelles
2138arXiv cs.RO 

Apprentissage par renforcement résiduel incrémental pour la navigation sociale en conditions réelles

Des chercheurs ont publié sur arXiv (réf. 2604.07945, version 2) une méthode baptisée IRRL, Incremental Residual Reinforcement Learning, conçue pour permettre aux robots mobiles d'apprendre à naviguer parmi les piétons directement dans des environnements physiques réels, sans passer par une étape de simulation exhaustive. L'approche combine deux mécanismes distincts : l'apprentissage incrémental, un processus léger qui ne nécessite ni replay buffer ni mise à jour par batch, et le RL résiduel, qui restreint l'apprentissage aux corrections à apporter par rapport à une politique de base préexistante. Les expériences couvrent à la fois des environnements simulés et des déploiements réels sur robot physique, avec pour cible explicite les dispositifs edge à ressources computationnelles contraintes. L'enjeu industriel est concret : la navigation sociale, faire circuler un robot autonome parmi des piétons en respectant les conventions implicites de déplacement, est un verrou majeur pour les AMR déployés dans des espaces publics, des entrepôts partagés ou des établissements de santé. Le problème du sim-to-real gap est ici particulièrement prononcé, car les dynamiques piétonnes varient fortement selon les régions, les cultures et les configurations d'espace, rendant toute couverture exhaustive par simulation illusoire. IRRL propose une réponse directe : laisser le robot continuer à apprendre une fois déployé, en se limitant aux résidus par rapport à une politique de base, ce qui réduit drastiquement la charge computationnelle. Les résultats publiés montrent des performances comparables aux méthodes classiques avec replay buffer en simulation, et une supériorité sur les approches d'apprentissage incrémental existantes. Les expériences en environnement réel confirment une adaptation effective à des situations inédites. Ces résultats restent toutefois à interpréter avec prudence : il s'agit d'un preprint académique, sans benchmark standardisé ni déploiement à l'échelle annoncé. Le domaine de la navigation sociale par deep RL est actif depuis plusieurs années, porté par des travaux comme CrowdNav (ICRA 2019) ou des méthodes basées sur ORCA et ses extensions apprenantes. L'approche résiduelle n'est pas nouvelle en soi, elle est notamment utilisée dans le contrôle de robots manipulateurs pour corriger une politique classique, mais son application à la navigation sociale en conditions réelles avec contrainte edge reste peu explorée. Aucune institution ni entreprise n'est identifiée dans l'abstract disponible, et aucun partenariat industriel ni pilote terrain n'est mentionné. Les prochaines étapes naturelles seraient une validation sur des plateformes AMR commerciales (type Clearpath ou unitree) et une confrontation aux benchmarks publics de navigation sociale tels que BARN ou SocNavBench.

RecherchePaper
1 source
DynaMOMA : prédiction instantanée des poses de saisie pour la manipulation mobile d'objets dynamiques
2139arXiv cs.RO 

DynaMOMA : prédiction instantanée des poses de saisie pour la manipulation mobile d'objets dynamiques

Des chercheurs présentent DynaMOMA, un cadre logiciel pour la manipulation mobile d'objets en mouvement, publié sur arXiv en juin 2026. L'architecture combine deux blocs : un modèle de diffusion ancré (anchor-based diffusion model) qui génère des trajectoires de préhension à court horizon de façon temporellement cohérente, et une politique de contrôle corps entier par apprentissage par renforcement qui pilote simultanément la base mobile et le bras robotique. Un mécanisme nommé anticipation-guided reward ajuste la cible de la politique en substituant progressivement l'observation instantanée à la trajectoire prédite, poussant le système à anticiper plutôt qu'à simplement réagir. Les expériences ont été conduites dans Isaac Gym (NVIDIA), complétées par des validations sur robot physique en environnement réel. L'enjeu industriel est concret : la majorité des systèmes de picking déployés sur convoyeur ou en transfert humain-robot supposent une cible statique ou à trajectoire parfaitement prévisible. Coordonner une base mobile et un bras multi-axes face à un objet dont la pose évolue en continu cumule deux difficultés distinctes : prédire des trajectoires de saisie cohérentes dans le temps, et fermer la boucle de commande corps entier à faible latence. L'usage d'un modèle de diffusion pour la prédiction de trajectoires de préhension (et non pour la génération d'images ou de politiques textuelles) prolonge une tendance récente incluant Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). La démonstration d'un transfert sim-to-real fonctionnel constitue l'élément le plus significatif pour les intégrateurs robotiques. Il s'agit à ce stade d'un preprint académique sans affiliation industrielle déclarée, et l'abstract ne fournit ni chiffres de cadence (cycle time) ni de charge utile (payload), ce qui rend toute comparaison directe avec des solutions commerciales impossible. Isaac Gym facilite la reproductibilité, mais la question du sim-to-real gap sur des scènes dynamiques complexes reste ouverte. DynaMOMA s'inscrit dans le même espace de recherche que Physical Intelligence, Agility Robotics ou Apptronik sur la généralisation de la manipulation, sans cibler un segment commercial précis. Des validations sur objets déformables ou partiellement occultés constitueraient l'extension naturelle vers des cas d'usage industriels réels.

RecherchePaper
1 source
Table ronde : tout le monde voit la bulle, mais quand les robots entreront-ils dans des usages réels ?
214036Kr 

Table ronde : tout le monde voit la bulle, mais quand les robots entreront-ils dans des usages réels ?

Lors de la conférence WAVES 2026 organisée par 36Kr à Guangzhou fin juin, une table ronde sur la robotique incarnée (具身智能) a réuni six acteurs du secteur : les fondateurs de Shenpu Intelligence et Qiongming Intelligence côté constructeurs, le CEO de Qingtian Rent pour la commercialisation, et trois investisseurs de BV Baidu Ventures, Kailiane Capital et Yunshi Capital. La toile de fond est parlante : la startup Shizhi Hang vient de lever 242 millions de dollars en tour d'amorçage, mais Goldman Sachs a sondé neuf fournisseurs de la chaîne d'approvisionnement robotique chinoise, sans qu'aucun ne rapporte de gros contrat ferme. BV Baidu Ventures, entrée dès 2022 avant la vague spéculative, confirme continuer à investir et à renforcer ses positions existantes. La discussion cartographie ce qui génère concrètement des revenus aujourd'hui. La location courte durée de robots, à quelques milliers de yuans par jour pour cinq à dix unités (comparable à la location d'une Rolls-Royce selon un investisseur du panel), constitue la niche la plus rentable à court terme. La sous-traitance humaine déguisée en collecte de données d'entraînement représente un deuxième flux, tout comme les ventes dans le marché geek/maker et les robots compagnons à forte dimension IP. Qingtian Rent affirme que l'intégralité de ses contrats est rentable en se concentrant sur les tâches "sous le plafond" des capacités actuelles. Les participants reconnaissent unanimement le triangle impossible des robots domestiques : bon marché, fonctionnel et sûr, trois critères impossibles à satisfaire simultanément à ce stade. Les modèles grand public à moins de 10 000 yuans existent, mais restent cantonnés à l'accompagnement ; dès que l'on exige des tâches ménagères réelles, le coût monte immédiatement. Cui Kedi de BV Baidu Ventures cite les combats de robots développés par Zhongqing comme scénario haute intensité utile pour valider les capacités dynamiques, tout en estimant que le secteur reste sous-financé par rapport aux grands laboratoires d'IA générative. BV Baidu Ventures a commencé à investir dans l'intelligence incarnée dès mi-2022, en partant du débordement technologique de la conduite autonome. Li Xiaofei de Shenpu compare l'état actuel au marché de l'autonomie routière en 2017-2018 : la preuve de concept est établie, mais la commercialisation de masse s'inscrit sur un horizon de cinq à dix ans. Sa stratégie dite "1+2+N" (un modèle de base, deux pipelines de données réelles, N scénarios progressifs) privilégie d'abord les environnements structurés comme les hôtels et les établissements de soins avant de viser les foyers. Ce gradualisme rejoint le constat de Wang Zixuan de Yunshi Capital : les robots qui font déjà de l'argent opèrent souvent dans des espaces invisibles, chantiers navals, usines lourdes périphériques, fonds marins, là où l'équation économique est claire avant même que la généralisation soit résolue.

Chine/AsieOpinion
1 source
Des robots humanoïdes chinois relèvent le défi du penalty alors que Messi et Ronaldo illuminent la Coupe du Monde FIFA
2141Interesting Engineering 

Des robots humanoïdes chinois relèvent le défi du penalty alors que Messi et Ronaldo illuminent la Coupe du Monde FIFA

Le 24 juin 2026, à l'ouverture du MWC Shanghai 2026, la Mobile AI Innovation Frontiers Zone du Shanghai New International Expo Centre a accueilli le Humanoid Robot Football Penalties Challenge, une compétition de tirs au but mettant en scène des robots humanoïdes en conditions semi-autonomes. D'après les images diffusées en ligne, des modèles de Booster Robotics et Unitree Robotics participent à l'épreuve. Le format est structuré : chaque robot doit interpréter indépendamment la position du ballon et les déplacements du gardien, puis déclencher le tir en effectuant des corrections en temps réel sur la base de ses capteurs, sans séquences pré-programmées ni intervention humaine externe. Les demi-finales et la finale sont prévues le 25 juin, avec des contraintes progressivement durcies pour simuler la pression compétitive. En parallèle, Hyundai Motor, maison mère de Boston Dynamics, a publié une vidéo de son robot Atlas réalisant des exercices de football dans le cadre d'une initiative baptisée "School of Football" : le robot observe des séquences vidéo de matchs, puis reproduit immédiatement dans un espace d'entraînement les gestes observés, passes incluses, imitation de célébration de but et simulation de blessure au genou compris. Hyundai évoque une possible présence d'Atlas et du quadrupède Spot à la Coupe du monde 2026, sans préciser leurs rôles. L'intérêt technique de l'exercice réside dans ce qu'un tir au but exige : perception en temps réel, équilibre dynamique lors du transfert de poids et de l'extension de jambe, et planification motrice adaptative dans un environnement non contrôlé. En faisant d'un moment sportif universellement compris un banc d'essai robotique, l'événement sert de point de comparaison public entre plateformes. Pour les intégrateurs et décideurs industriels, il convient cependant de distinguer soigneusement une démonstration scénarisée d'un déploiement opérationnel : les conditions restent contrôlées, les métriques publiées sont limitées, et les vidéos disponibles proviennent de flux non officiels. La valeur réelle réside moins dans la performance sportive que dans la capacité à enchaîner perception, décision et exécution physique sans intervention humaine, un sous-problème direct du sim-to-real transfer et de la robustesse des VLA (Vision-Language-Action models) en environnement ouvert. Unitree Robotics et Booster Robotics s'inscrivent dans la vague de constructeurs chinois d'humanoïdes qui ont considérablement accéléré depuis 2024, aux côtés de Zhiyuan Robotics et Fourier Intelligence, dans un contexte de forte pression concurrentielle avec les Américains Figure AI, Agility Robotics et Tesla Optimus. Du côté de Boston Dynamics, la campagne football intervient après une série de démonstrations industrielles d'Atlas Gen 2 en environnement d'usine automobile, et sert manifestement à repositionner le robot sur le terrain de la dextérité et de l'apprentissage par imitation plutôt que sur la seule force brute. La Coupe du monde 2026, dont les matchs se tiennent aux États-Unis, au Canada et au Mexique à partir du 11 juin, fournit un calendrier marketing opportun, mais aucune intégration fonctionnelle concrète n'a été annoncée pour l'instant.

Chine/AsieOpinion
1 source
Un robot-chien chinois affronte -30 °C, traverse rivières et terrains accidentés en démonstration
2142Interesting Engineering 

Un robot-chien chinois affronte -30 °C, traverse rivières et terrains accidentés en démonstration

DEEP Robotics a publié une vidéo de démonstration de son robot hybride roues-pattes Lynx M20S, successeur du M20, capable de traverser des rivières glacées jusqu'à 80 cm de profondeur, de fonctionner à -30°C et d'évoluer à une altitude de 5 177 mètres. La plateforme pèse 35 kg, accepte une charge utile de 15 kg (charge maximale 50 kg) et franchit des obstacles jusqu'à 80 cm de hauteur dans des couloirs aussi étroits que 50 cm, avec des pentes jusqu'à 45 degrés. Son autonomie atteint 3 heures et 15 km à vide par charge, réduite à 2,5 heures et 12 km avec 15 kg de payload, grâce à une double batterie hot-swappable et une endurance améliorée de 17 à 67% par rapport au modèle précédent. La vitesse de pointe en laboratoire est de 5 m/s, la vitesse opérationnelle de 2 m/s. Pour la perception, la plateforme intègre deux LiDAR à 96 lignes en configuration 360° x 90°, des caméras grand-angle et un évitement d'obstacles omnidirectionnel. La certification IP66 lui permet d'opérer entre -20°C et +55°C, avec mises à jour OTA et expansion modulaire. Cette démonstration cible un créneau précis : les environnements où les AMR à roues classiques sont bloqués et où les drones ne peuvent pas porter de charge utile significative, soit l'inspection de lignes haute tension en montagne, la réponse d'urgence post-catastrophe ou l'exploration en zone difficile d'accès. La combinaison roues-pattes est ici un compromis technique cohérent, la propulsion à roues assurant vitesse et efficacité énergétique sur terrain stable, les pattes prenant le relais sur obstacles. Les specs annoncées (80 cm d'eau, -30°C, 45° de pente) dépassent sur le papier celles du Spot de Boston Dynamics en contexte outdoor extrême. Il convient cependant de noter que les séquences présentées sont sélectionnées par l'équipe marketing et que les performances en déploiement industriel continu restent à valider par des clients opérationnels. Une charge utile de 15 kg reste suffisante pour des capteurs LiDAR embarqués, de la thermographie ou des kits d'urgence légers, ce qui ouvre des cas d'usage concrets pour les intégrateurs. DEEP Robotics est un acteur chinois positionné face à Unitree Robotics (B2, Go2) sur le segment robots à pattes compétitifs-prix, et face à ANYbotics (ANYmal, Suisse) sur le segment inspection industrielle premium. Le M20S est une évolution incrémentale du M20 original, dont les points forts principaux sont l'endurance améliorée et la double batterie interchangeable à chaud, plutôt qu'une refonte de l'architecture mécanique. Parallèlement, DEEP développe un humanoïde DR02 pour environnements industriels et dangereux, confirmant la tendance des constructeurs de robots spécialisés à élargir leur catalogue vers les plateformes anthropomorphes. Aucune date de disponibilité commerciale ni tarif n'ont été communiqués pour le M20S : la vidéo reste pour l'instant au stade de la démonstration d'enveloppe de performances, pas d'une annonce de produit livrable.

Chine/AsieOpinion
1 source
Agility Robotics entre en bourse via une fusion SPAC
2143Robotics Business Review 

Agility Robotics entre en bourse via une fusion SPAC

Agility Robotics, rebaptisée simplement "Agility" en mars 2026, a annoncé une fusion avec le SPAC Churchill Capital Corp qui valoriserait l'entreprise à 2,5 milliards de dollars en pré-money, avec plus de 620 millions de dollars de produits bruts attendus. La société basée à Salem, Oregon, commercialise le robot humanoïde Digit, dont la cinquième génération peut soulever jusqu'à 18 kg (40 lb), opérer environ 16 heures par charge et atteindre 1,67 mètre de hauteur. La PDG Peggy Johnson a revendiqué, lors d'un briefing investisseurs, qu'Agility serait post-introduction "la seule société américaine cotée en bourse et pure-play dans l'humanoïde avec des déploiements commerciaux actifs et prouvés", Digit étant actuellement en service chez plusieurs clients industriels, principalement sur des tâches de picking de bacs et de totes en entrepôt. Google DeepMind et NVIDIA figurent parmi les partenaires technologiques déclarés, ce dernier ayant choisi Agility comme partenaire de lancement pour un programme non encore détaillé dans l'annonce. L'enjeu central est la crédibilité commerciale dans un secteur encore dominé par les démonstrations. Agility avance des déploiements réels chez des clients industriels, même si le communiqué alterne entre "commercial trials" et "active commercial deployments" sans préciser le périmètre exact, ce qui constituera un point de due diligence pour les investisseurs. La thèse de l'entreprise repose sur le concept de "cooperative safety", soit la capacité du robot à opérer sans cage ni zone d'exclusion aux côtés de travailleurs humains, présenté comme le verrou à résoudre pour une adoption à grande échelle. Pour les intégrateurs et les décideurs B2B, la cotation en bourse d'un acteur humanoïde avec des déploiements réels est un signal structurant: elle introduit des obligations de transparence sur les métriques opérationnelles (temps de cycle, taux de panne, coût par cycle) que les concurrents non cotés n'ont pas à divulguer, ce qui pourrait redéfinir les référentiels de benchmarking sectoriel. Fondée en 2015 par Jonathan Hurst et Damion Shelton, issus du Dynamic Robotics Laboratory de l'Oregon State University, la société a d'abord développé Cassie, une plateforme bipède de recherche, avant de pivoter vers la commercialisation de Digit. Le picking de bacs en entrepôt a été choisi délibérément comme segment d'entrée avant une expansion vers d'autres verticales industrielles, dans un marché adressable estimé par l'entreprise à 1 000 milliards de dollars aux États-Unis. Face à Figure (en cours de déploiement chez BMW), Boston Dynamics (Atlas chez Hyundai), Tesla (Optimus Gen 3, non encore commercialisé) et 1X (NEO), Agility mise sur son avance en déploiements réels et sur l'accès aux capitaux publics pour accélérer. En Europe, aucun acteur du segment logistique humanoïde n'est positionné à ce niveau; Wandercraft (France) reste centré sur la rééducation médicale. La finalisation de la transaction SPAC reste conditionnée à l'approbation des actionnaires de Churchill Capital Corp.

Mantis Robotics lance un robot bimanuel sans clôture de protection
2144Robotics Business Review 

Mantis Robotics lance un robot bimanuel sans clôture de protection

Mantis Robotics, basée à Pleasanton en Californie, a dévoilé le 23 juin 2026 le MR-X, un robot bimanuel conçu pour opérer sans cage ni barrière de sécurité physique dans des environnements industriels partagés avec des humains. Le système affiche un payload de 31,7 kg (70 lb) et une vitesse maximale de 10,6 m/s. Il repose sur la plateforme SafetyCore, un système de réflexes en temps réel breveté par l'entreprise, qui analyse en continu l'environnement et ajuste le comportement du robot dès qu'un opérateur entre dans sa trajectoire, sans arrêt de cycle. Le MR-X est conçu pour des installations fixes comme pour des déploiements en manipulateur mobile (mobile manipulator), et cible des tâches d'assemblage bimanuel, de transfert de matière et de tri de colis. Il embarque une interface de programmation sans code. Mantis présentait les MR-X et MR-1 au salon Automate 2026 (stand 1261, South Hall). Ce lancement illustre une tentative de positionnement entre deux segments qui peinent à se rejoindre : les cobots (lents, sûrs, peu puissants) et les robots industriels classiques (rapides mais nécessitant une intégration de sécurité lourde). Si les métriques annoncées sont confirmées en conditions réelles, un système combinant vitesse industrielle, double bras et opération sans barrière représenterait un avantage d'intégration significatif pour les lignes mixtes homme-robot. L'absence de fence élimine des coûts d'infrastructure et réduit la surface au sol allouée à la cellule robotique, deux points critiques pour les PME industrielles et les entrepôts logistiques. Cela dit, l'article repose sur des déclarations de l'entreprise : aucune donnée indépendante sur le temps de cycle en conditions de production, ni sur la robustesse du SafetyCore face à des scénarios non contrôlés n'est fournie. La mention d'Amazon comme référence de leur MR-1 reste vague, sans volume ni contexte de déploiement précisé. Mantis Robotics s'appuie sur son MR-1, certifié ISO 10218 et ISO 13849, qui aurait déjà démontré la viabilité de l'opération sans fence à vitesse industrielle. Le MR-X étend cette architecture à un format bimanuel, une tendance forte en 2025-2026 face à la montée des humanoides (Figure 03, Tesla Optimus Gen 3, 1X Neo) qui promettent la même polyvalence mais accusent encore un écart significatif entre démo et réalité opérationnelle. Dans le segment fenceless cobots, Mantis affronte des acteurs comme Universal Robots, FANUC CRX et Techman Robot, tandis que sur le bimanuel industriel, ABB YuMi et Rethink Robotics (désormais absent) ont montré les limites du segment. Aucun calendrier de disponibilité commerciale ni prix indicatif n'a été communiqué lors de l'annonce, ce qui place le MR-X davantage côté teaser produit que lancement commercial effectif.

IndustrielOpinion
1 source
Tech for Industry Show : les technologies qui transforment l’industrie
2145Robot Magazine FR 

Tech for Industry Show : les technologies qui transforment l’industrie

Les 23 et 24 juin 2026, le salon Tech for Industry a réuni à Paris industriels, intégrateurs, éditeurs de logiciels et acteurs de la robotique, avec l'ambition affichée de confronter les technologies de l'usine intelligente à des cas d'usage opérationnels concrets. Deux axes ont structuré l'édition : le jumeau numérique (digital twin), porté par Dassault Systèmes et Siemens, qui ont présenté leurs plateformes de modélisation d'usines complètes permettant de simuler lignes de production, bilans énergétiques et scénarios de maintenance prédictive avant tout investissement physique ; et les robots mobiles autonomes (AMR), incarnés notamment par Pudu Robotics, distribué en France par l'intégrateur Jobotto, initialement positionné sur la restauration et l'hôtellerie, désormais déployé dans des entrepôts et sites industriels pour le transport de charges en autonomie. L'éditeur français Optimistik, spécialisé dans la digitalisation des processus pour des secteurs contraints comme la chimie et l'énergie, portait quant à lui le discours d'une IA industrielle orientée résultats mesurables plutôt qu'expérimentation. Ce glissement du pilote vers le déploiement opérationnel est précisément le signal structurant de cette édition 2026 pour les décideurs B2B. Le digital twin, longtemps présenté comme un investissement prospectif, s'impose comme outil de pilotage en production : la convergence entre simulation, données temps réel et modèles prédictifs réduit concrètement les arrêts non planifiés et accélère les décisions d'optimisation. Pour la robotique de service, la présence de Pudu sur des sites industriels illustre un transfert technologique notable : des plateformes développées pour des environnements grand public font leur entrée en usine à des coûts souvent inférieurs aux solutions robotiques industrielles traditionnelles. Ce repositionnement souligne que la tension sur le recrutement et la pression de productivité poussent les industriels à adopter des architectures robotiques hybrides (AMR, cobots, bras fixes) là où une solution unique était autrefois privilégiée. À noter toutefois que le salon, davantage orienté networking B2B que démonstration technique, n'a pas fourni de métriques chiffrées sur les déploiements présentés, rendant difficile toute comparaison rigoureuse des solutions exposées. Tech for Industry s'inscrit dans un paysage de salons industriels dominé au niveau européen par Hannover Messe et automatica (Munich). L'édition 2026 confirme l'émergence d'un écosystème français structuré autour d'acteurs comme Jobotto et Optimistik, aux côtés de licornes comme Exotec (AMR logistique, Roubaix) ou de pionniers de l'humanoïde comme Enchanted Tools (Paris). La prochaine étape lisible dans les discours exposants pointe vers l'intégration de LLM dans les interfaces de supervision industrielle, plusieurs acteurs ayant présenté des copilotes permettant aux opérateurs d'interroger leurs données de production en langage naturel, une tendance dont la maturité industrielle reste encore à prouver à l'échelle.

FR/EU ecosystemeOpinion
1 source
Morgan Stanley relève ses prévisions de livraison de robots humanoïdes chinois à 50 000 unités
2146SCMP Tech 

Morgan Stanley relève ses prévisions de livraison de robots humanoïdes chinois à 50 000 unités

Morgan Stanley a relevé pour la deuxième fois en 2026 ses prévisions de livraisons de robots humanoïdes en Chine, portant l'estimation annuelle à 50 000 unités contre 28 000 unités précédemment, chiffre qui avait lui-même doublé en janvier par rapport à la projection initiale. Cette révision à la hausse, publiée mardi dans un rapport de la banque d'investissement, s'appuie sur une accélération simultanée de trois facteurs : la validation commerciale par des premiers déploiements industriels, un soutien politique renforcé de Pékin, et une chaîne d'approvisionnement locale en maturité rapide. Parmi les acteurs cités, le constructeur de véhicules électriques Xpeng a annoncé des plans de production de masse pour son humanoïde. Ce double rehaussement en moins de six mois signale une inflexion réelle dans la trajectoire de commercialisation, non plus une simple feuille de route prospective. Pour les intégrateurs industriels et les décideurs B2B, le passage à 50 000 unités annuelles marque un seuil au-delà duquel les effets d'échelle commencent à peser sur les coûts unitaires et la disponibilité des pièces. Cela confirme aussi que la Chine consolide une filière humanoïde verticalement intégrée, de la puce au déploiement terrain, réduisant la dépendance aux composants occidentaux. Ce momentum s'inscrit dans un contexte où Pékin a fait de la robotique humanoïde une priorité industrielle nationale, avec des subventions directes et des objectifs de production inscrits dans les plans quinquennaux. Face à cette montée en puissance, les acteurs américains, Boston Dynamics, Figure, Apptronik, et européens comme Enchanted Tools ou Wandercraft opèrent dans un écosystème de financement privé sans équivalent aux soutiens étatiques chinois. La prochaine étape à surveiller est la traçabilité de ces 50 000 unités : déploiement réel en usine ou stocks de présérie, Morgan Stanley ne précise pas encore la ventilation.

Chine/AsieOpinion
1 source
Syrius Robotics : -7% sur le marché gris avant l'introduction, +38% le premier jour de cotation
214736Kr 

Syrius Robotics : -7% sur le marché gris avant l'introduction, +38% le premier jour de cotation

Seer Robotics (仙工智能, HKEX : 06106), fabricant chinois de contrôleurs pour robots mobiles autonomes (AMR), a fait son entrée en bourse à Hong Kong le 24 juin 2026. Le titre a ouvert à 101,60 HKD (prix d'introduction), bondi jusqu'à 140,50 HKD (+38,3 %) en séance, avant de clôturer à 115,70 HKD (+13,9 %), avec une amplitude journalière de 38,3 % et un volume d'échange de 533 millions HKD. La capitalisation boursière atteint ainsi 12,78 milliards HKD, soit un ratio cours/chiffre d'affaires d'environ 25x sur la base des 442 millions de RMB de revenus 2025, la valorisation la plus élevée parmi les nouvelles introductions robotiques à Hong Kong. À titre de comparaison, GEEK+ (leader mondial des AMR) cote autour de 9x, et Estun (premier robot industriel chinois) entre 4 et 5x. La veille, les échanges en gré-à-gré (暗盘) avaient préfiguré la volatilité : le titre avait grimpé à 130 HKD (+27,9 %) avant de s'effondrer à 80 HKD (-21,3 %), clôturant à 94,20 HKD (-7,28 %), avec une amplitude de 49 % sur une seule séance. Ces turbulences révèlent une tension de fond entre le récit marketing et les fondamentaux. Seer revendique la première place mondiale sur les contrôleurs AMR avec 24,8 % de part de marché en volume, mais son propre prospectus la classe septième mondiale (1,1 % des revenus) et troisième en Chine (2,5 %) sur le segment plus large des robots industriels intelligents. Volume vendu ne signifie pas revenus générés. Par ailleurs, la marge brute sur les robots complets (整机) n'est que de 38,4 %, ce qui explique une croissance du chiffre d'affaires qui ne se traduit pas en rentabilité. Le float réduit, seulement 9,5 % des actions en circulation publique, avec 43,34 % verrouillés six mois par huit investisseurs cornerstone dont Hillhouse HHLRA et GF Fund, a amplifié mécaniquement la volatilité sans refléter un consensus de valorisation. Seer Robotics est issu de l'écosystème entrepreneurial de l'université Zhejiang (浙大系), un vivier de startups deep-tech chinoises. Son positionnement sur les contrôleurs AMR cible en priorité les intégrateurs de taille intermédiaire, les grands constructeurs robotiques préférant internaliser ce composant stratégique pour ne pas subventionner un concurrent potentiel. La commercialisation à grande échelle de ces contrôleurs reste donc conditionnée à une montée en puissance du taux de pénétration industrielle des AMR en Chine. L'entreprise doit désormais démontrer, rapport financier après rapport financier, que sa part de marché sur les contrôleurs est défendable face à des acteurs intégrés, et que la ligne robots complets peut atteindre la rentabilité, deux questions que le cours d'introduction ne résout pas.

Chine/AsieOpinion
1 source
Communication multimodale des états et intentions du robot, lisible et intuitive, validée en ligne et sur le terrain
2148arXiv cs.RO 

Communication multimodale des états et intentions du robot, lisible et intuitive, validée en ligne et sur le terrain

Des chercheurs ont publié le 24 juin 2026 une étude comparative systématique sur la lisibilité des stratégies de communication robot-vers-humain pour des robots mobiles non-humanoïdes en environnement industriel partagé. L'équipe a confronté deux approches : une stratégie expressive minimale basée uniquement sur des LEDs (unimodale), et une stratégie hautement expressive multimodale combinant regard robotique, gestes et voix. Cinq types de messages ont été testés, conformément aux standards industriels existants pour les robots industriels : signalisation d'intention de virage, demande d'attention, état d'erreur, robot bloqué, et fonctionnement normal. La validation s'est déroulée en deux phases parallèles, une étude en ligne à grande échelle et des expériences en présentiel, permettant de mesurer l'écart entre les deux contextes d'évaluation. Les résultats montrent des preuves solides que la communication multimodale expressive est perçue comme significativement plus lisible et intuitive que la signalisation par LEDs seule. Mais la contribution la plus importante de cette étude est ailleurs : elle quantifie un écart virtuel-réel notable dans la légibilité perçue. La lisibilité globale baisse de manière significative lors des évaluations en présentiel par rapport aux études en ligne, avec un effet particulièrement marqué pour les LEDs. La confiance des participants dans l'interprétation des messages diminue également en conditions réelles. Pour les intégrateurs industriels qui s'appuient sur des études de validation en ligne pour choisir leurs interfaces AMR, ce résultat est un signal d'alerte concret : les benchmarks virtuels surestiment la lisibilité des systèmes purement lumineux. Cette recherche s'inscrit dans un chantier plus large sur la sécurité cognitive dans les espaces de travail humain-robot partagés, un enjeu croissant avec le déploiement massif d'AMRs (autonomous mobile robots) en logistique et en manufacture. Les standards actuels pour les robots industriels prescrivent des typologies de messages, mais laissent largement ouverte la question des modalités d'expression. Les acteurs européens comme Exotec, dont les systèmes Skypod opèrent aux côtés d'humains dans des entrepôts à haute densité, ou Enchanted Tools avec son robot Miroki, sont directement concernés par ces conclusions. L'étape suivante naturelle serait une validation avec des populations d'utilisateurs plus diverses, opérateurs non-formés, seniors, personnes en situation de handicap, pour généraliser les recommandations au-delà des panels universitaires.

IndustrielPaper
1 source
MuTRAP : trojans à déclencheurs multiples ciblant les systèmes de planification de tâches robotiques
2149arXiv cs.RO 

MuTRAP : trojans à déclencheurs multiples ciblant les systèmes de planification de tâches robotiques

Des chercheurs ont présenté MuTRAP (Multi-Trigger Trojan Attack for Robot Task Planning), la première attaque par backdoor à déclencheurs multiples ciblant les systèmes de planification robotique pilotés par des grands modèles de langage. Publiée en troisième révision sur arXiv (2504.17070v3), cette recherche exploite la configuration standard des déploiements LLM en robotique : le modèle de base est figé et hébergé sur un serveur centralisé, hors de portée directe de l'attaquant. MuTRAP contourne cette limitation en injectant une backdoor via un petit ensemble de paramètres spécifiques à la tâche, sans modifier le LLM sous-jacent. Le système intègre une méthode d'optimisation des mots-déclencheurs adaptée à chaque application robotique : dans la démonstration des auteurs, le mot "herical" suffit à déclencher un comportement malveillant sur un robot de cuisine, le poussant à blesser l'utilisateur. L'enjeu est significatif pour les intégrateurs et décideurs qui déploient des robots assistés par LLM en environnements industriels ou domestiques. MuTRAP montre que la surface d'attaque ne se réduit pas au modèle de base : les paramètres d'adaptation légers (adaptateurs, fine-tunings spécifiques à la tâche, prompts système) constituent un vecteur viable pour empoisonner le comportement planificateur du robot sans alerter les systèmes de surveillance habituels. Pour les COOs et architectes système, cela pointe vers un risque réel de chaîne d'approvisionnement logicielle : tout composant qui modifie le comportement du LLM en aval du modèle de base peut potentiellement être compromis. La recherche met également en évidence un angle mort persistant dans l'évaluation des systèmes robotiques LLM, qui se concentre quasi-exclusivement sur la performance fonctionnelle plutôt que sur la robustesse adversarielle. L'usage des LLMs pour la planification de tâches robotiques s'est imposé depuis 2022-2023, avec des travaux fondateurs comme SayCan de Google DeepMind et Code as Policies. Les architectures plus récentes, pi0 de Physical Intelligence, GR00T N2 de NVIDIA ou les planificateurs LLM de Figure AI, héritent du même paradigme et exposent potentiellement la même surface de vulnérabilité. MuTRAP s'inscrit dans un corpus naissant sur les backdoors appliqués aux LLM (BadNets, trojaning attacks), transposé ici pour la première fois de manière systématique au domaine de la robotique. Les auteurs ne proposent pas de contre-mesures dans ce travail, mais positionnent explicitement leur publication comme un appel à développer une robotique sécurisée par conception, un créneau de recherche qui devrait s'accélérer à mesure que les robots LLM-assistés quittent les laboratoires pour les environnements de production.

Societe/EthiqueOpinion
1 source
TurboMPC : commande prédictive par modèle rapide, évolutive et différentiable sur GPU
2150arXiv cs.RO 

TurboMPC : commande prédictive par modèle rapide, évolutive et différentiable sur GPU

Le Toyota Research Institute (TRI) a publié le 24 juin 2026 TurboMPC, un solveur MPC (commande prédictive par modèle) différentiable fonctionnant entièrement sur GPU. Implémenté en JAX-CUDA, il combine programmation quadratique séquentielle (SQP), solveur interne ADMM et différentiation implicite, tout en supportant contraintes d'inégalité sur états et contrôles, intégrateurs implicites, coûts couplés temporellement et variables de slack. Les gains de performance atteignent jusqu'à 15x par rapport aux solveurs CPU différentiables de référence et jusqu'à 58x face aux meilleurs solveurs GPU existants. Validé en simulation sur planification contrainte, imitation learning pour humanoïde et apprentissage par renforcement à fonction de coût neuronale, TurboMPC a également été testé sur un véhicule réel en conduite à temps minimal. L'optimisation bayésienne des paramètres MPC, rendue possible par le traitement par lots sur GPU, y produit des vitesses nettement supérieures au réglage manuel. Le solveur tient jusqu'à 8 000 points de trajectoire sans perdre le contrôle du véhicule. Le code est mis en open source sur GitHub (ToyotaResearchInstitute/turbompc). L'apport central est la réconciliation entre pipelines GPU d'apprentissage profond et solveurs MPC traditionnellement CPU-centric, une friction qui forçait des transferts mémoire coûteux et une hétérogénéité matérielle pénalisante en production. En restant entièrement sur GPU et en étant différentiable de bout en bout, TurboMPC s'intègre directement dans des boucles d'entraînement par gradient, ce qui valide à grande échelle l'hypothèse des "differentiable MPC" longtemps discutée dans la littérature. La démonstration sur imitation learning humanoïde est particulièrement significative: elle montre que des formulations MPC expressives peuvent rivaliser avec les approches purement apprises pour des robots à haute dimensionnalité, sans abandonner les garanties de planification. TRI, branche recherche de Toyota dédiée à la robotique et aux véhicules autonomes, publie face à des alternatives établies comme Crocoddyl du LAAS-CNRS (Toulouse, France), ALTRO (Stanford/CMU) et Theseus (Meta AI), tous majoritairement CPU-centric ou partiellement GPU. La présence de Crocoddyl dans ce paysage concurrentiel donne une visibilité directe au laboratoire toulousain, dont les travaux seront mis en compétition par ces nouveaux benchmarks. La mise en open source facilite l'intégration dans des simulateurs parallèles comme Isaac Lab ou Genesis. Les prochaines étapes probables incluent des évaluations sur plateformes humanoïdes réelles et une adoption dans des pipelines robotiques industriels.

RecherchePaper
1 source