Aller au contenu principal

Actualités robotique — page 61

4 604 articles au fil, du plus récent au plus ancien.

Membrane proprioceptive hautement déformable pour la reconstruction de forme 3D en temps réel
3001arXiv cs.RO 

Membrane proprioceptive hautement déformable pour la reconstruction de forme 3D en temps réel

Des chercheurs ont publié sur arXiv (identifiant 2601.13574, version 2) une membrane proprioceptive souple en silicone capable de reconstruire sa propre géométrie 3D en temps réel, sans caméra. La membrane, de format 140 mm x 140 mm, intègre des LED montées en bordure et des photodiodes réparties en son centre au sein d'un composite élastomère multicouche. Lorsque la membrane se déforme au contact d'un objet, les signaux d'intensité lumineuse captés par les photodiodes varient selon des motifs caractéristiques que décrypte un modèle entraîné par apprentissage automatique. Le système atteint un taux de mise à jour de 90 Hz en bout de chaîne, avec une erreur moyenne de reconstruction de 1,307 mm pour des déformations hors-plan allant jusqu'à 25 mm. Il tient également sur de grandes déformations dans le plan, jusqu'à 75 % d'allongement, avec une distance de Chamfer moyenne de 1,214 mm, métrique standard pour comparer deux nuages de points 3D. L'intérêt pour la robotique industrielle et les systèmes mous est direct : les approches vision (caméras RGB-D, stéréo) échouent sous faible éclairage ou en situation d'occlusion, conditions courantes en manipulation d'objets complexes, en logistique densément chargée ou en chirurgie assistée. Une membrane qui infère la forme d'une surface par contact contourne ces limitations sans exposer de composants optiques externes fragiles. L'architecture par guides d'onde optiques évite également les écueils des capteurs résistifs ou capacitifs (dérive thermique, sensibilité aux perturbations électromagnétiques) et des approches magnéto-sensitives (compatibilité limitée avec certains environnements industriels). À 90 Hz, la latence est compatible avec des boucles de contrôle en temps réel pour la préhension adaptative ou le suivi de surface en soudage ou collage. Ce travail s'inscrit dans un champ en pleine effervescence : les peaux tactiles pour robots, où les laboratoires de recherche (MIT CSAIL, Stanford HCI, ETH Zürich) et des entreprises comme GelSight (rachetée par Meta), Touchlab ou Xela Robotics cherchent à doter les effecteurs robotiques d'un sens du toucher fiable et scalable. L'approche par guide d'onde optique n'est pas nouvelle, le capteur GelSight repose sur un principe optique similaire pour la mesure de texture locale, mais son application à la reconstruction de forme globale sur membrane déformable à grande déformation (75 % de strain) constitue une avancée de portée. L'article ne mentionne pas de prototype industriel ni de partenariat de commercialisation ; il s'agit d'une publication académique, sans timeline de déploiement annoncée. Les prochaines étapes logiques incluent l'intégration sur des préhenseurs à doigts souples et la validation sur des géométries d'objets variées hors laboratoire.

RecherchePaper
1 source
Completion at the Boundary (CaB) : commutation déployable avec contrôle par complétion sous calibration limitée
3002arXiv cs.RO 

Completion at the Boundary (CaB) : commutation déployable avec contrôle par complétion sous calibration limitée

Des agents vision-langage-action (VLA) peuvent aujourd'hui exécuter des instructions en langage naturel, mais les systèmes déployés butent sur un angle mort critique : savoir quand une instruction est terminée. Des chercheurs décrivent dans l'article arXiv:2606.00145 une méthode baptisée Completion at the Boundary (CaB), conçue pour résoudre ce problème de détection de complétion dans un régime dit "à faible calibration", c'est-à-dire sans réapprentissage à l'inférence et avec une seule règle de commutation calibrée une fois sur le jeu de développement, puis réutilisée telle quelle en test. Le problème est particulièrement aigu sur les instructions composites du type "fais A, puis B" : un passage de relais mal chronométré propage une erreur en cascade sur toutes les étapes suivantes. CaB modélise la complétion comme un objet local à l'événement, sous forme de Boundary-Phase Tokens (trois états : Before, Hit, After), préservant ainsi une preuve bilatérale autour de la frontière de transition plutôt que de la comprimer en un scalaire unique. Le module CaB-When exploite cet objet pour décider quand commuter, tandis que CaB-How le réutilise pour conditionner la génération d'actions et stabiliser le comportement pendant le handoff. Les auteurs évaluent CaB sur un benchmark VLA en vue subjective dans Minecraft, via un protocole E1/E2 tenant compte des interventions, et montrent une amélioration de l'exécution composite et de la qualité des transitions à capacité égale. L'enjeu industriel est réel : la majorité des benchmarks VLA mesurent l'exécution d'une tâche atomique, mais les déploiements réels enchaînent des dizaines d'étapes. Sans mécanisme de complétion robuste, un agent peut dépasser sa cible, réexécuter une action terminée, ou passer au mauvais moment sur l'instruction suivante. Le choix d'un régime à faible calibration est significatif : il contraint la méthode à être directement déployable sans fine-tuning par site, ce qui est exactement ce que demande un intégrateur industriel. Le point faible identifié dans l'approche scalaire classique, la fragilité face aux "polarity shifts" entre tâches hétérogènes, est un problème concret que les praticiens connaissent bien mais rarement formalisent. À noter que les expériences restent sur Minecraft et non sur robot physique : le gap sim-to-real n'est pas adressé ici. CaB s'inscrit dans un courant de recherche dense autour des VLA multi-étapes, porté notamment par pi-0 de Physical Intelligence (qui gère déjà des workflows longue durée), GR00T N2 de NVIDIA, et les travaux d'OpenVLA. Le problème de la détection de fin de tâche est connexe aux travaux sur la segmentation temporelle en imitation learning (skill boundaries, option termination dans les HRL). Minecraft est un benchmark établi pour les agents langage-action (cf. STEVE-1, Voyager), ce qui facilite les comparaisons mais éloigne de la manipulation physique. La suite logique serait une validation sur des manipulateurs réels avec des instructions composites de type pick-and-place, terrain où des acteurs comme Enchanted Tools ou Pollen Robotics en Europe pourraient trouver un intérêt direct à intégrer ce type de module de complétion dans leurs pipelines VLA.

RechercheOpinion
1 source
FlipItRight : retournement par lancer vers une pose cible stable sur des objets variés
3003arXiv cs.RO 

FlipItRight : retournement par lancer vers une pose cible stable sur des objets variés

FlipItRight est un framework académique présenté sur arXiv (arXiv:2606.01713, juin 2026) pour la manipulation par lancer-retournement ciblé avec un bras robotique à haute liberté de mouvement (high-DoF manipulator). L'objectif est de projeter un objet en l'air afin qu'il atterrisse dans une pose planaire précise et prédéterminée. Le système décompose la tâche en deux niveaux : un planificateur objet génère des états de lâcher candidats compatibles avec la pose d'atterrissage souhaitée, tandis qu'un planificateur robot évalue la faisabilité d'exécution et construit une trajectoire de swing réalisable. Validé sur une plateforme réelle avec des objets de formes, tailles et masses variées, le système atteint un taux de succès de 90% sur 120 essais. Aucune donnée préalable ni modèle appris n'est nécessaire, ce qui permet un déploiement immédiat sur de nouveaux objets et cibles sans calibration environnementale. Ce résultat est notable pour plusieurs raisons. La clé de l'approche est de traiter l'état de lâcher comme une représentation intermédiaire explicite, ce qui permet un filtrage raisonné des candidats, une sélection adaptative des configurations de pré-swing et de lâcher, et une conception structurée du mouvement en fin de swing. En maintenant des vitesses de l'effecteur terminal approximativement constantes durant la phase finale, le système gagne en robustesse face aux incertitudes sur le timing du lâcher, une difficulté classique en manipulation non-préhensile. Pour les intégrateurs, l'absence totale de données d'entraînement est un avantage opérationnel concret : pas de collecte, pas de rejeu, déploiement directement généralisable. La manipulation non-préhensile (lancer, poussée, retournement sans saisie ferme) est un problème de recherche actif depuis les années 1990, mais reste difficile en conditions réelles à cause de la sensibilité aux paramètres dynamiques des objets et du sim-to-real gap. La tendance dominante s'oriente vers des politiques apprises par reinforcement learning ou imitation, notamment chez TRI (Toyota Research Institute), ETH Zurich et des équipes de CMU. FlipItRight prend le contre-pied en proposant une planification purement analytique, sans données, ce qui le positionne comme une alternative légère pour les environnements industriels où la collecte de données est coûteuse. Les études d'ablation confirment la contribution de chaque composant du framework. Les extensions naturelles concerneront les objets déformables, les poses cibles en 3D et l'intégration dans des pipelines pick-and-place pour réorienter des pièces sans préhenseur dédié.

RecherchePaper
1 source
Dynamiques apprises, non dictées : découverte semi-supervisée des géométries latentes pour l'adaptation zéro-shot
3004arXiv cs.RO 

Dynamiques apprises, non dictées : découverte semi-supervisée des géométries latentes pour l'adaptation zéro-shot

Une équipe de chercheurs a publié le 2 juin 2026 le preprint arXiv:2606.02280, proposant une nouvelle méthode d'adaptation zéro-shot pour les politiques de contrôle en robotique. L'enjeu est concret : lorsque les conditions physiques d'un robot changent en déploiement (friction, masse, jeu mécanique, perturbations non modélisées), les politiques entraînées en simulation s'effondrent. Les approches dominantes encodent un vecteur de paramètres physiques explicitement identifiés dans un contexte latent. Les auteurs abandonnent ce paradigme centré sur les paramètres au profit d'une approche centrée sur les résultats : plutôt que de communiquer à la politique ce que sont les dynamiques, ils lui permettent d'apprendre comment ces dynamiques affectent les trajectoires d'interaction. Techniquement, la méthode s'appuie sur une relation monotone démontrée entre le regret dans le domaine cible et la constante de Lipschitz d'un encodeur de trajectoires. Cette constante est majorée en pratique par apprentissage contrastif, produisant une topologie latente lisse et pertinente pour la tâche, sans information privilégiée sur les dynamiques. Les résultats sur les benchmarks MuJoCo montrent une supériorité constante sur les baselines paramétriques sous des changements de dynamiques sévères, y compris des paramètres non modélisés et time-varying. L'apport industriel porte sur la robustesse hors distribution. Un des verrous majeurs du déploiement de politiques apprises en simulation est précisément l'impossibilité d'énumérer à l'avance toutes les variations physiques rencontrées sur le terrain. La méthode ne nécessite pas de spécifier les axes de variation a priori, ce qui la rend adaptable à des environnements industriels où les perturbations sont composites ou inconnues. La démonstration d'une topologie latente interprétable ajoute un argument pour les équipes d'intégration qui cherchent à diagnostiquer les défaillances d'adaptation. Cela dit, les expériences restent confinées à MuJoCo : l'écart sim-to-real sur du matériel physique n'est pas adressé dans ce papier. Ce travail s'inscrit dans un champ de recherche actif depuis la démocratisation des simulateurs physiques rapides. Les approches concurrentes incluent la randomisation de domaine (Domain Randomization), l'identification de système en ligne (e.g., RMA de Kumar et al.), et les méthodes meta-RL (MAML, PEARL). La distinction clé revendiquée ici est l'absence de supervision sur les paramètres physiques pendant l'entraînement du contexte latent. Aucun partenaire industriel ni calendrier de transfert matériel ne sont mentionnés dans le preprint ; l'étape suivante naturelle serait une validation sur robots réels en présence de perturbations non identifiées.

RecherchePaper
1 source
Reconnexion spatio-temporelle pour réseaux multi-robots via des CBFs à temps prescrit adaptatif
3005arXiv cs.RO 

Reconnexion spatio-temporelle pour réseaux multi-robots via des CBFs à temps prescrit adaptatif

Des chercheurs ont publié sur arXiv (ref. 2606.01526) un cadre de contrôle baptisé "adaptive prescribed-time control barrier function" (adaptive PT-CBF) pour les systèmes multi-robots. Le problème central est la gestion de la connectivité du graphe de communication : dans les déploiements réels, imposer à chaque robot de rester en permanence à portée de ses voisins est souvent incompatible avec l'efficacité opérationnelle, notamment lorsque la flotte évolue dans de grands espaces avec des portées radio limitées. Le cadre proposé permet à chaque unité de se déconnecter temporairement du réseau maillé, puis de revenir dans la plage de communication dans un délai fini, ajustable et garanti formellement. Les auteurs introduisent également un mécanisme de déclenchement de reconnexion qui pondère deux critères simultanément : l'urgence de la tâche en cours et l'urgence de la reconnexion, ce qui permet de décider de façon raisonnée à quel moment un robot doit interrompre sa mission pour rejoindre le graphe. Les résultats expérimentaux montrent une amélioration de l'efficacité des tâches avec des reconnexions respectant les délais prescrits. Ce travail s'attaque à une limitation structurelle des flottes AMR et des robots de recherche distribuée : la contrainte de connectivité permanente force souvent les robots à des trajectoires sous-optimales, réduisant le throughput global. En garantissant mathématiquement la reconnexion dans un temps fini configurable, ce cadre ouvre la voie à des politiques de déploiement plus souples sans sacrifier la cohérence de l'information au niveau de l'équipe. Pour les intégrateurs industriels, cela signifie potentiellement des architectures de flotte où des robots peuvent s'aventurer en zones de faible signal pour des tâches d'inspection ou de pick, puis revenir dans le réseau selon un budget-temps maîtrisé. Le mécanisme de déclenchement basé sur une double urgence est particulièrement pertinent pour les systèmes à contraintes temporelles (livraison, surveillance d'événement). Les control barrier functions (CBFs) sont depuis plusieurs années un outil central en robotique à sécurité critique, permettant de formuler des garanties formelles sur les contraintes d'état. Les PT-CBF, ou CBFs à temps prescrit, en sont une extension permettant de borner non seulement la satisfaction d'une contrainte, mais aussi l'horizon temporel de cette satisfaction. Ce papier s'inscrit dans un courant de recherche actif, notamment en concurrence avec des approches de consensus distribué et de communication opportuniste développées par des équipes aux États-Unis, en Europe et en Chine. Les suites naturelles incluent la validation sur des flottes physiques hétérogènes, l'extension à des topologies dynamiques et l'intégration dans des planificateurs de tâches multi-agents. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans la prépublication.

RecherchePaper
1 source
CloSE : une représentation d'état du tissu indépendante de la forme géométrique
3006arXiv cs.RO 

CloSE : une représentation d'état du tissu indépendante de la forme géométrique

Des chercheurs ont publié sur arXiv (arXiv:2504.05033, version 3) une nouvelle représentation de l'état de déformation des textiles pour la manipulation robotique, baptisée CloSE (Cloth StatE). La méthode repose d'abord sur un intermédiaire appelé dGLI disk : une grille circulaire sur laquelle sont calculés des indices topologiques pour chaque segment de bord du tissu. La carte de chaleur (heatmap) ainsi générée fait apparaître des motifs stables qui caractérisent l'état du tissu indépendamment de sa forme, de sa taille ou de son orientation. Ces motifs sont ensuite condensés en une représentation circulaire compacte et continue : CloSE. Les auteurs démontrent que cette représentation prédit correctement l'emplacement des plis sur plusieurs jeux de données de simulation de vêtements, et qu'elle s'applique à deux tâches concrètes : l'étiquetage sémantique des parties du vêtement et la planification de tâches à haut et bas niveau. Le code et les données sont disponibles publiquement. La manipulation de textiles reste l'un des problèmes non résolus de la robotique industrielle : contrairement aux objets rigides, un tissu peut prendre un nombre quasi infini de configurations déformées, ce qui rend la prise de décision et la planification de trajectoire extrêmement difficiles. L'apport principal de CloSE est d'être agnostique à la géométrie du vêtement, ce qui signifie qu'un même pipeline de perception et de planification peut théoriquement s'appliquer à un T-shirt, une chemise ou un pantalon sans réentraînement. Pour un intégrateur ou un équipementier du secteur textile, c'est une propriété clé : elle réduit le coût de généralisation entre références produits. La représentation compacte facilite également son intégration dans des boucles de contrôle temps réel. Ce travail s'inscrit dans un effort académique soutenu autour de la manipulation de tissus, aux côtés d'approches comme les réseaux de points déformables (DenseFusion, FlingBot) ou les méthodes basées sur les graphes de tissu. La plupart des résultats présentés ici restent en simulation, ce que les auteurs n'occultent pas, mais la nature topologique des indices dGLI est conçue pour faciliter le transfert sim-to-real. Aucun déploiement industriel ou partenariat n'est annoncé à ce stade. Les prochaines étapes naturelles seraient une validation sur robot physique et une extension aux tissus opaques ou fortement déformés.

RecherchePaper
1 source
Reconnaissance gestuelle multimodale interprétable pour la téléopération de drones et robots mobiles par fusion de rapports de vraisemblance
3007arXiv cs.RO 

Reconnaissance gestuelle multimodale interprétable pour la téléopération de drones et robots mobiles par fusion de rapports de vraisemblance

Une équipe de recherche a publié sur arXiv (réf. 2602.23694, troisième révision) un framework de reconnaissance gestuelle multimodale destiné à la téléopération sans contact physique de robots mobiles et de drones en environnements dangereux. Le système combine des données inertielles issues d'Apple Watches portées aux deux poignets -- accéléromètre, gyroscope et orientation -- avec des signaux de capacitance provenant de gants instrumentés développés spécifiquement pour l'étude. L'architecture repose sur une fusion tardive fondée sur le rapport de vraisemblance logarithmique (log-likelihood ratio, LLR), appliquée à un vocabulaire de 20 gestes distincts inspirés des signaux de balisage utilisés par les marshalls aéroportuaires. Les chercheurs publient simultanément un dataset synchronisant vidéo RGB, données IMU et capteurs capacitifs pour l'ensemble de ces 20 gestes. L'intérêt principal de cette approche réside dans sa robustesse face aux conditions qui font défaillir les systèmes purement visuels : occultations, variations d'éclairage, arrière-plans encombrés -- autant de contraintes courantes sur les sites industriels ou en zone de catastrophe. Les résultats expérimentaux indiquent des performances comparables à une baseline vision state-of-the-art, avec une empreinte computationnelle, une taille de modèle et un temps d'entraînement significativement réduits, ce qui le rend compatible avec du contrôle robotique temps réel. Le mécanisme LLR apporte également une propriété d'interprétabilité rare dans ce domaine : il quantifie la contribution de chaque modalité à la décision finale, ce qui peut intéresser les intégrateurs soumis à des exigences de traçabilité ou de certification. La téléopération par gestes fait l'objet d'une compétition active, notamment entre les approches EMG (électromyographie), les interfaces cerveau-machine et la reconnaissance visuelle pure. Ce travail positionne la fusion IMU-capacitance comme une alternative robuste et légère, sans nécessiter de caméra orientée vers l'opérateur. Il s'agit pour l'instant d'un preprint non encore évalué par les pairs, sans déploiement annoncé sur du matériel de production. Aucun partenaire industriel n'est mentionné, et les prochaines étapes logiques seraient une validation sur des robots commerciaux (AMR, drones quadrotors) dans des conditions terrain réelles, ainsi qu'une intégration avec des middlewares robotiques standards tels que ROS 2.

RecherchePaper
1 source
Contrôle de posture par apprentissage par renforcement profond pour robots à double direction Ackermann en conditions d'incertitude
3008arXiv cs.RO 

Contrôle de posture par apprentissage par renforcement profond pour robots à double direction Ackermann en conditions d'incertitude

Des chercheurs présentent une méthode de contrôle de pose complète pour robots mobiles à double direction Ackermann, basée sur l'apprentissage par renforcement profond (DRL), en ciblant directement l'un des obstacles centraux à l'industrialisation du DRL : l'écart de performance entre simulation et monde réel. Partant du cadre ManeuverNet, l'équipe étend son objectif initial (contrôle de position) vers un contrôle de pose complet, position et orientation combinées, ce qui constitue une tâche sensiblement plus exigeante. Les robots à double direction Ackermann, utilisés notamment en logistique lourde et inspection industrielle, imposent des contraintes non-holonomes strictes liées à la géométrie du châssis. Les résultats quantifient précisément le problème : une politique entraînée avec des modèles d'actionnement simplifiés atteint 100 % de succès dans PyBullet, mais chute à 25 % dans Gazebo sous des conditions d'évaluation plus strictes, une dégradation qui illustre le sim-to-real gap à un stade intermédiaire, avant même le passage sur robot physique. La contribution principale repose sur une approche "sim-to-sim-to-real" : les effets d'actionnement caractéristiques de Gazebo sont modélisés, puis réinjectés dans l'environnement d'entraînement PyBullet. Combinée à un entraînement multi-environnements via les algorithmes SAC (Soft Actor-Critic) et CrossQ, cette stratégie remonte le taux de succès à 92 % dans Gazebo (69 % sous seuils stricts) et permet un transfert direct sur robot réel sans réajustement supplémentaire. Ce résultat intéresse directement les intégrateurs d'AGV et AMR : il suggère que la modélisation fine de l'actionnement, davantage que la complexité architecturale du réseau, constitue le levier principal pour réduire l'écart sim-to-real sur des plateformes non-holonomes. Le problème de la double direction Ackermann reste moins étudié que les bases omnidirectionnelles ou les rovers différentiels, malgré sa pertinence pour les chariots élévateurs autonomes et les véhicules industriels de grande taille. SAC et CrossQ représentent l'état de l'art en DRL hors politique (off-policy) ; leur combinaison avec une approche sim-to-sim structurée sur ce type de plateforme constitue une contribution nouvelle. L'article est publié en preprint arXiv (2606.00313) et n'a pas encore été évalué par les pairs ; les conditions exactes du test sur robot réel, notamment la diversité des scénarios testés, restent à préciser avant toute conclusion définitive sur la robustesse industrielle de la méthode.

RecherchePaper
1 source
DAG-Plan : génération de graphes de dépendances acycliques orientés pour la planification coopérative à deux bras
3009arXiv cs.RO 

DAG-Plan : génération de graphes de dépendances acycliques orientés pour la planification coopérative à deux bras

Une équipe de chercheurs propose DAG-Plan, un framework de planification de tâches pour robots à deux bras qui utilise un graphe orienté acyclique (DAG, Directed Acyclic Graph) comme représentation centrale de la coordination. Publiés sur arXiv (identifiant 2406.09953v4), les travaux font état d'un taux de réussite supérieur de 48 % par rapport aux méthodes à séquence linéaire sur système bi-bras, et d'une efficacité d'exécution en hausse de 84,1 % face aux approches à requêtes LLM itératives. L'évaluation a été conduite sur un benchmark de cuisine bi-bras, un scénario de manipulation multi-étapes comportant des dépendances non linéaires entre sous-tâches. Le principe clé : le LLM n'est sollicité qu'une seule fois, pour traduire une instruction en langage naturel en DAG structuré, puis le système assigne dynamiquement les noeuds candidats à chaque bras selon les observations en temps réel de l'environnement. L'intérêt industriel est réel, car le goulot d'étranglement des systèmes bi-bras actuels n'est pas mécanique mais algorithmique. Les méthodes linéaires échouent dès qu'une tâche impose du parallélisme ou une adaptation en cours d'exécution ; les méthodes itératives basées sur des appels LLM répétés génèrent une latence incompatible avec les cadences industrielles. DAG-Plan tranche ce compromis en séparant la phase de raisonnement sémantique (une seule inférence LLM hors-ligne) de la phase d'exécution adaptative (décisions locales basées sur l'observation). Pour les intégrateurs et les équipes R&D en robotique, cela suggère qu'un LLM peut jouer un rôle de planificateur structurel sans devenir un point de défaillance en temps réel. Les gains annoncés sont néanmoins à contextualiser : le benchmark cuisine reste un environnement contrôlé, et les vidéos de démonstration présentées sur le site du projet sont sélectionnées, ce qui ne permet pas d'évaluer la robustesse sur des variations de scène réelles. La planification de tâches pour robots bi-bras est un terrain de recherche actif depuis plusieurs années, avec des approches concurrentes comme Task and Motion Planning (TAMP) ou les méthodes de raisonnement LLM développées dans le cadre de SayCan (Google), Code-as-Policies ou Inner Monologue. DAG-Plan s'inscrit dans la vague des frameworks qui exploitent les LLM comme parseurs sémantiques plutôt que comme planificateurs en boucle fermée, une direction explorée aussi par des travaux comme RoboScript ou LEGO-PLAN. Aucun partenaire industriel ni déploiement hors-labo n'est mentionné dans la publication ; il s'agit d'une contribution académique avec code ouvert, disponible sur le site du projet. Les suites naturelles seraient une validation sur des robots commerciaux (FANUC, Universal Robots, ABB) et des scènes moins structurées que la cuisine, pour tester la généralisation du formalisme DAG à des environnements à perturbations stochastiques.

RecherchePaper
1 source
Représentations sémantiques et géométriques des tâches pour la manipulation bimanuelles : des démonstrations humaines à la planification robotique
3010arXiv cs.RO 

Représentations sémantiques et géométriques des tâches pour la manipulation bimanuelles : des démonstrations humaines à la planification robotique

Des chercheurs ont publié une approche pour apprendre des représentations structurées de tâches bimanuelles directement à partir de démonstrations humaines, sans annotation manuelle des actions. Le système, baptisé représentation sémantique-géométrique par graphe, combine un encodeur de type Message Passing Neural Network (MPNN) avec un décodeur Transformer. L'encodeur opère sur un graphe de scène temporel : il capture les identités des objets, leurs relations sémantiques mutuelles et l'historique de leurs mouvements. Le décodeur, conditionné par le contexte d'action, prédit l'action suivante, les objets impliqués et leurs trajectoires. L'ensemble a été évalué sur onze tâches bimanuelles issues de deux jeux de données distincts, et déployé avec succès sur deux tâches réelles en boucle fermée, via un planificateur couplant les prédictions à des Probabilistic Movement Primitives (ProDMP). L'apport principal réside dans le découplage entre encodeur et décodeur : l'encodeur produit des représentations dites agnostiques à la tâche, réutilisables sur différents robots via un simple fine-tuning du décodeur sur un petit dataset robot. En pratique, cela réduit significativement le coût de ré-entraînement lors d'un changement de plateforme ou d'effecteur. Les résultats montrent que le bénéfice des représentations sémantiques-géométriques sur les modèles séquentiels plus simples s'accentue avec la variabilité des tâches : plus l'ordre des actions et les objets impliqués varient d'une exécution à l'autre, plus l'avantage est marqué. Le système surpasse des baselines incluant un Transformer pur, un décodeur seul, et des modèles vision-langage fine-tunés (VLM), ce qui est notable même si les benchmarks utilisés restent internes aux auteurs et non standardisés dans la communauté. Ce travail s'inscrit dans un effort plus large visant à combler le fossé entre manipulation bimanuelle en laboratoire et déploiement industriel, là où la reproductibilité d'exécutions variables reste un verrou. Il fait écho à des approches concurrentes comme les Vision-Language-Action models (VLA) de Google DeepMind ou les travaux sur les graphes de tâches de l'ETH Zurich, mais se distingue par son orientation vers le transfert inter-robots à faible coût de données. Les auteurs n'annoncent pas de partenaire industriel ni de timeline de déploiement commercial ; il s'agit d'un résultat académique, présenté en version révisée sur arXiv (v2, janvier 2026), dont les suites probables incluent une extension à des scènes plus encombrées et à des horizons de planification plus longs.

RecherchePaper
1 source
PLanAR : raisonnement à base d'agents ancré dans la planification et le langage pour la manipulation robotique
3011arXiv cs.RO 

PLanAR : raisonnement à base d'agents ancré dans la planification et le langage pour la manipulation robotique

Des chercheurs ont présenté PLanAR (Planning-Language-Grounded Agentic Reasoning), un framework agent pour la manipulation robotique long-horizon en environnements ouverts, publié sous forme de préprint arXiv (2602.01662v4). Le système utilise des modèles vision-langage (VLMs) comme moteur de raisonnement, mais les contraint via une interface de planification symbolique structurée en trois composants : des prédicats d'objets encodant l'état de la scène, des schémas d'action définissant les compétences du robot avec leurs préconditions et effets attendus, et des plans symboliques servant de représentations intermédiaires exécutables. Après chaque action, PLanAR vérifie si les effets symboliques attendus ont été atteints via les observations embarquées, ce qui lui permet de détecter les échecs et de replanifier en cas de déviation. Les évaluations couvrent plusieurs morphologies de robots et backends VLM sur des tâches allant de l'empilement d'objets à la résolution de mots croisés, en passant par des séquences cuisine long-horizon. La manipulation long-horizon reste un défi majeur de la robotique incarnée : les architectures VLA (Vision-Language-Action) pures, comme Pi-0 (Physical Intelligence) ou OpenVLA, échouent souvent lorsque les séquences s'allongent et que les conditions d'exécution changent. PLanAR adresse ce problème en introduisant une boucle de vérification étape par étape qui sépare explicitement raisonnement et exécution, une propriété absente des approches end-to-end. Cette architecture hybride neurosymbolique est directement pertinente pour les intégrateurs industriels travaillant en environnements non contrôlés, car elle permet au robot de détecter et corriger ses propres erreurs sans intervention humaine. Les auteurs reconnaissent eux-mêmes que PLanAR révèle des limitations importantes dans le raisonnement incarné des VLMs actuels, une posture analytique rare dans la littérature récente. PLanAR s'inscrit dans une longue tradition d'approches TAMP (Task and Motion Planning) cherchant à combiner planification symbolique et exécution motrice, aux côtés de SayCan (Google DeepMind, 2022), Code as Policies (2023) et GR00T N2 (NVIDIA, 2025) qui intègre également un module de raisonnement symbolique. La distinction clé réside dans l'interface de planification formelle imposée au VLM, qui réduit l'espace de recherche au prix d'une expressivité moindre. Le preprint ne mentionne ni partenariat industriel ni timeline de déploiement, et les expériences restent en laboratoire : le passage à l'échelle en conditions réelles demeure la question ouverte centrale pour valider l'approche au-delà du benchmark académique.

IA physiqueOpinion
1 source
Seq-DeepIPC : captation séquentielle pour le contrôle de bout en bout dans la navigation de robots à pattes
3012arXiv cs.RO 

Seq-DeepIPC : captation séquentielle pour le contrôle de bout en bout dans la navigation de robots à pattes

Des chercheurs présentent Seq-DeepIPC (arXiv:2510.23057v2), un modèle de navigation bout-en-bout pour robots à pattes reposant sur une fusion multi-modale RGB-D et GNSS. Contrairement aux approches classiques qui séparent perception et contrôle, le système prédit conjointement la segmentation sémantique et l'estimation de profondeur à partir d'entrées séquentielles, puis génère directement les commandes moteur. L'estimation du cap global est assurée non pas par une centrale inertielle (IMU), jugée trop bruitée, mais par une analyse différentielle de coordonnées GNSS successives. Pour le déploiement embarqué, un encodeur léger réduit la charge de calcul sans dégradation significative de précision. Le système a été validé sur un robot quadrupède sur deux types de terrain, route et gazon, à partir d'un jeu de données collecté spécifiquement pour couvrir cette diversité. Le code sera mis en accès libre sur GitHub (github.com/oskarnatan/Seq-DeepIPC). L'apport principal réside dans l'extension de la navigation end-to-end, jusqu'ici dominée par les robots à roues, aux systèmes à pattes, beaucoup plus complexes cinématiquement. Les études ablatives confirment que les entrées séquentielles améliorent à la fois la perception et le contrôle dans Seq-DeepIPC, alors que les baselines testées n'en bénéficient pas, ce qui suggère une dépendance forte à la temporalité propre à la démarche quadrupède. La suppression de l'IMU est un choix architectural audacieux: elle simplifie l'intégration matérielle et évite la dérive gyroscopique, mais le papier reconnaît une fiabilité moindre du cap GNSS-seul en environnement urbain dense. Pour un intégrateur, cela signifie que le système est crédible en extérieur ouvert, mais nécessiterait une fusion sensorielle supplémentaire en milieu confiné ou bâti. La navigation end-to-end pour robots à pattes s'inscrit dans un effort de recherche plus large visant à réduire le gap de spécialisation entre planification et locomotion. Des travaux comme DeepIPC (dont Seq-DeepIPC est la suite directe) ou les architectures VLA (Vision-Language-Action) de Boston Dynamics, Unitree et ANYbotics explorent des pipelines similaires, avec des approches différentes sur la représentation de l'espace et la gestion de la mémoire temporelle. Seq-DeepIPC se distingue par sa sobriété sensorielle et sa cible embarquée, mais reste un prototype de laboratoire validé en conditions semi-contrôlées. La prochaine étape logique serait un test en environnements plus adversariaux, notamment urbains, pour quantifier les limites réelles du cap GNSS différentiel annoncées dans le papier.

RecherchePaper
1 source
OSCAR : courbes de survie aux obstacles pour la navigation adaptative des robots
3013arXiv cs.RO 

OSCAR : courbes de survie aux obstacles pour la navigation adaptative des robots

Des chercheurs ont publié le 1er juin 2026 sur arXiv (réf. 2606.00990) un framework de navigation adaptative baptisé OSCAR (Obstacle Survival Curves for Adaptive Robot Navigation), conçu pour les robots mobiles naviguant sur des graphes de routes prédéfinies. Le problème ciblé est précis : quand un obstacle temporaire bloque un nœud critique du graphe, le robot doit décider d'attendre ou de recalculer un itinéraire alternatif. OSCAR répond à cette décision en apprenant, par expérience en ligne, des distributions statistiques de durée de présence selon la classe d'obstacle (piéton, chaise, poubelle, chariot, tube). Ces modèles de survie, y compris les observations censurées à droite (cas où le robot reroutait avant d'observer la libération effective de l'obstacle), alimentent un planificateur de graphe temporel qui calcule un seuil de patience par arête bloquée. En simulation, la politique apprise converge à moins de 1 % d'un oracle disposant des distributions réelles de dégagement après moins de 20 observations par classe d'obstacle, surpassant tous les heuristiques de référence. En déploiement réel dans un atrium universitaire, le système améliore ses seuils de patience au fil de 50 épisodes de navigation. L'intérêt pour les intégrateurs de robots mobiles autonomes (AMR) est direct : les systèmes actuels appliquent soit de la réactivité locale (évitement d'obstacles à l'instant T), soit des règles fixes de type "attendre X secondes puis rerouter", sans modéliser la sémantique temporelle de l'obstacle. OSCAR comble cet écart en montrant qu'un modèle de survie conditionné à la classe, mis à jour en ligne, suffit à se rapprocher du comportement optimal sans connaissance a priori des distributions réelles. Cela réduit concrètement les temps morts dans des environnements semi-dynamiques comme les entrepôts, les hôpitaux ou les campus, où la majorité des blocages sont transitoires mais de durée variable selon leur nature. OSCAR s'inscrit dans un courant de recherche qui vise à dépasser la navigation réactive pure pour introduire de la mémoire contextuelle dans la planification. La littérature existante sur la navigation en graphe traite généralement les obstacles comme statiques ou entièrement imprévisibles ; les modèles de survie, issus de la biostatistique et de la fiabilité industrielle, restent rares dans ce domaine. Les concurrents fonctionnels incluent les approches de navigation socio-consciente (social force models, ORCA) et les planificateurs probabilistes à horizon temporel (POMDP), mais ces derniers sont computationnellement coûteux. OSCAR se positionne comme une alternative légère et incrémentale, compatible avec des plateformes AMR standard. La prochaine étape naturelle serait de tester la généralisation à des environnements à plus forte densité d'obstacles ou à des classes non vues à l'entraînement.

RecherchePaper
1 source
Placement adaptatif des tâches selon la QoS en périphérie : un contrôle en boucle fermée pour les systèmes multi-robots
3014arXiv cs.RO 

Placement adaptatif des tâches selon la QoS en périphérie : un contrôle en boucle fermée pour les systèmes multi-robots

Des chercheurs ont publié le 2 juin 2026 un preprint arXiv (identifiant 2606.00552) décrivant un contrôleur de placement adaptatif de tâches, baptisé ATP (Adaptive Task Placement), conçu pour les systèmes multi-robots (MRS). Le banc d'essai repose sur des nœuds Raspberry Pi interconnectés et évalue un pipeline caméra-vers-manipulateur dans trois configurations : exécution locale sur le robot, délestage statique vers un nœud edge partagé, et placement adaptatif piloté par ATP. Le contrôleur ATP calcule, sur des fenêtres de contrôle de deux secondes, un score de coût multi-métriques combinant latence normalisée, utilisation CPU et coût de commutation, puis sélectionne le nœud d'exécution optimal en boucle fermée. Le banc est instrumenté avec une synchronisation d'horloge sub-milliseconde et une émulation réseau afin de reproduire fidèlement la gigue et les contentions de ressources réelles. Les résultats expérimentaux sous contraintes de stress computationnel et de fautes réseau montrent que le délestage statique vers le edge réduit bien la charge CPU embarquée, mais amplifie la latence de queue et le nombre de dépassements d'échéance, un point critique pour les applications de commande en temps réel comme l'asservissement visuel. En revanche, ATP réduit de manière consistante ces deux indicateurs en arbitrant dynamiquement le placement selon des seuils mesurés. Pour un intégrateur ou un architecte de système cyber-physique industriel, ce résultat valide un principe qui était souvent posé en hypothèse : l'orchestration statique des charges de travail edge est insuffisante dès que le réseau ou la ressource partagée connaissent une variabilité, et une boucle de rétroaction fermée est nécessaire pour tenir des SLA temps-réel. Ce travail s'inscrit dans le domaine émergent du Cloud-Edge Robotics, où AWS RoboMaker, Azure IoT Edge et des initiatives open-source comme ROS 2 with DDS cherchent à standardiser la décomposition des pipelines de perception. L'architecture proposée reste à l'état de preprint académique sur matériel Raspberry Pi, pas encore un produit industriel validé à l'échelle, mais pose des lignes directrices de conception concrètes pour des déploiements fog/edge en robotique collaborative et en systèmes multi-robots industriels. Les prochaines étapes logiques incluraient une validation sur hardware embarqué plus représentatif (NVIDIA Jetson, x86 edge servers) et une intégration avec des frameworks d'orchestration comme Kubernetes ou ROS 2 Managed Nodes.

RecherchePaper
1 source
S2M-Trek : du transport mono-sphère au multi-sphère par Deep Sets par image sur un robot roues-pattes
3015arXiv cs.RO 

S2M-Trek : du transport mono-sphère au multi-sphère par Deep Sets par image sur un robot roues-pattes

Une équipe de recherche présente S2M-Trek, un système permettant à un robot quadrupède à roues et pattes de transporter jusqu'à cinq sphères libres simultanément sur son dos, sans grilles, pinces ni butées mécaniques. L'article arXiv (2606.01332) adresse un problème précis en apprentissage par renforcement : plusieurs sphères identiques forment un ensemble non ordonné dont l'ordre peut changer à chaque frame d'historique, créant une symétrie de permutation par frame que les encodeurs Deep Sets à concaténation d'historique (HCDS) classiques ne capturent pas. Entraîné avec PPO sur un budget fixe, le HCDS de référence plafonne à deux sphères sans randomisation des assignations balle-slot ; les MLP plats et encodeurs par branche aussi. La solution proposée, Per-Frame Deep Sets (PFDS), applique un pooling invariant aux permutations à l'intérieur de chaque frame avant lecture temporelle, et les auteurs prouvent formellement son invariance et son approximation universelle des politiques continues invariantes. PFDS atteint le stade cinq sphères avec 100 % de transport sans chute en simulation sur cinq seeds aléatoires. Une distillation via DAgger produit TactSet, qui remplace l'état privilégié des sphères par une carte de contact booléenne 16×16, compacte et naturellement invariante. Ce résultat révèle un biais structurel non trivial dans les encodeurs d'ensembles temporels : HCDS exploite les indices de slot comme raccourci de curriculum, simulant une généralisation sans apprendre une dynamique vraiment multi-objets sans identité persistante. L'ablation 2×2 (architecture × randomisation des données) montre que les deux corrections ne sont pas interchangeables : PFDS résout le problème architecturalement, indépendamment de l'augmentation de données. Pour les décideurs travaillant sur la manutention d'objets interchangeables en entrepôt ou en logistique, cela suggère que des politiques entraînées sur des configurations identifiées risquent d'échouer en déploiement réel où les objets sont physiquement indiscernables. S2M-Trek s'inscrit dans la montée des robots à locomotion hybride roues-pattes capables de coupler dynamiquement locomotion et manipulation sans contrainte physique externe. L'approche TactSet, utilisant des cartes de contact binaires basse résolution pour remplacer des observations d'état simulées, ouvre une voie vers le déploiement hardware sans instrumentation coûteuse. Les travaux connexes incluent Transporter Networks et les approches d'RL équivariant, mais ce papier se distingue par le contexte de locomotion active sur objets libres non contraints. L'étape critique restante est le transfert sim-to-real : l'ensemble des résultats est exclusivement en simulation, et les auteurs ne rapportent aucune expérience physique sur robot réel.

RecherchePaper
1 source
ShelfAware : localisation sémantique en temps réel dans des environnements quasi-statiques avec des capteurs bas coût
3016arXiv cs.RO 

ShelfAware : localisation sémantique en temps réel dans des environnements quasi-statiques avec des capteurs bas coût

Des chercheurs ont publié sur arXiv (2512.09065v2) ShelfAware, un filtre particulaire sémantique conçu pour la localisation globale de robots mobiles dans des environnements dits quasi-statiques : des espaces dont la géométrie générale est stable mais dont les contenus changent continuellement, comme les rayons d'un supermarché ou les allées d'un entrepôt logistique. Le système fusionne une vraisemblance de profondeur avec une similarité sémantique centrée sur les catégories d'objets, et génère des hypothèses de pose via des propositions inverses précalculées intégrées dans un cadre Monte Carlo Localization (MCL). Évalué dans un environnement de vente fictif rigoureusement contrôlé, ShelfAware atteint un taux de succès de localisation globale de 97 % et maintient un taux de suivi de 66 % dans des conditions d'occultation variées (chariot, dispositif portable, obstruction dynamique). Dans un second test mené dans un supermarché opérationnel de 325 m², le système s'appuie sur un pipeline de vision à vocabulaire ouvert et surpasse significativement les approches géométriques seules ainsi que les méthodes sémantiques à points de repère fixes. L'ensemble tourne sur du matériel vision bas coût, sans capteur LiDAR. Ce qui est notable ici, c'est moins la performance brute que l'approche architecturale. La grande majorité des systèmes de localisation sémantique traitent les objets comme des landmarks discrets et fixes : un objet identifié = une position dans la carte. ShelfAware modélise à la place la sémantique de manière distributionnelle, comme une évidence statistique sur des catégories, ce qui le rend résilient aux changements de stock, aux réorganisations et au désordre dynamique. Pour un intégrateur déployant des AMR (autonomous mobile robots) en grande distribution ou en logistique de dernier kilomètre, cela signifie une localisation sans infrastructure additionnelle (pas de QR codes, pas de balises UWB), avec un hardware limité au seul RGB-D ou monoculaire. L'article s'inscrit dans un effort de recherche plus large visant à combler le fossé entre les environnements de laboratoire et les déploiements réels dans des espaces peuplés et changeants. Les approches concurrentes incluent les méthodes SLAM visuelles (ORB-SLAM3, OpenVINS) et les systèmes sémantiques basés sur des réseaux de neurones comme Nice-SLAM ou Semantic-NeRF, qui offrent de meilleures représentations mais exigent des ressources computationnelles bien supérieures. ShelfAware opte pour un compromis pragmatique : représentation légère, généralisation par le vocabulaire ouvert (CLIP ou équivalent), et intégration native dans MCL. Il s'agit d'une contribution académique préprint, pas d'un produit commercialisé : aucun déploiement industriel ni partenariat industriel n'est annoncé à ce stade. Des acteurs comme Simbe Robotics ou Badger Technologies, positionnés sur la robotique de retail avec infrastructure propriétaire, constituent le référentiel concurrentiel naturel face auquel une telle approche sans infrastructure prendrait de la valeur.

RecherchePaper
1 source
SoFiE : un exosquelette de doigt souple pour la préhension intelligente
3017arXiv cs.RO 

SoFiE : un exosquelette de doigt souple pour la préhension intelligente

Des chercheurs ont présenté SoFiE, un exosquelette doux et modulaire pour l'index, conçu pour assister la flexion du doigt lors de tâches de préhension chez des personnes ayant une fonction manuelle réduite. Le système repose sur des matériaux flexibles imprimés en 3D, ce qui lui confère un profil compact et léger. L'actionnement est assuré par un mécanisme à tendons entraîné par un moteur DC miniature, tandis que l'extension passive est gérée par un ressort conducteur élastique, baptisé StretchSense. Ce composant joue un double rôle : il assure le retour en extension tout en faisant office de capteur proprioceptif, sa résistance électrique variant en fonction de la déformation. Une seconde modalité sensorielle, MagSense, est introduite : une paire aimant-magnétomètre intégrée dans la pulpe souple du doigt permet d'estimer à la fois la force de contact et la compliance des objets saisis. L'ensemble est entièrement sans fil, piloté par un microcontrôleur embarqué, et complété par un retour encodeur moteur pour l'estimation de l'état du système. L'intérêt principal de SoFiE réside dans la combinaison de deux types de sensing en un dispositif portable et non-filaire : la proprioception via StretchSense et la perception tactile via MagSense. Cette dualité permet au système de distinguer des matériaux de rigidité différente et de générer des signatures sensorielles distinctes selon le type de prise, ce qui constitue une base sérieuse pour des stratégies de contrôle adaptatif et sécurisé. Pour les intégrateurs en robotique d'assistance, c'est une architecture prometteuse : la modularité de la conception laisse entrevoir une extension à d'autres doigts sans refonte complète du système. Le domaine des exosquelettes de main souples est actif dans plusieurs laboratoires universitaires à l'échelle mondiale, avec des acteurs comme Roam Robotics, Bioservo Technologies ou encore des projets issus du MIT et de l'ETH Zurich sur des dispositifs comparables. SoFiE reste pour l'instant un démonstrateur de faisabilité, publié en preprint sur arXiv (2606.00397), sans partenaire industriel ni timeline de commercialisation annoncée. Les prochaines étapes attendues seraient une validation clinique sur des profils patients (AVC, lésions médullaires), ainsi qu'une extension du système à plusieurs doigts pour couvrir des prises complexes au-delà du pincement index-pouce.

ExosquelettesPaper
1 source
Intégration IA-IoT-Robotique : panorama des frameworks, tendances émergentes et voie vers la robotique connectée
3018arXiv cs.RO 

Intégration IA-IoT-Robotique : panorama des frameworks, tendances émergentes et voie vers la robotique connectée

Une équipe de chercheurs a publié début juin 2026 sur arXiv (réf. 2606.01015) une revue de la littérature consacrée à l'intégration conjointe de l'intelligence artificielle, de l'Internet des objets (IoT) et de la robotique, trois domaines qui progressaient jusqu'ici principalement deux à deux. Les auteurs recensent les travaux existants autour de combinaisons établies, l'AIoT (IA et IoT) et l'Internet of Robotic Things (IoRT, couplant IoT et robotique), et constatent l'absence persistante de cadres de conception unifiés orchestrant les trois disciplines simultanément. Leur principale contribution est une architecture modulaire où des petits modèles de langage (SLM, Small Language Models) assurent l'inférence locale en bordure de réseau (edge), tandis que des grands modèles de langage (LLM) hébergés dans le cloud prennent en charge le raisonnement de haut niveau et la prise de décision autonome. Pour les intégrateurs industriels et les responsables techniques B2B, l'architecture hybride SLM-LLM proposée répond à deux contraintes opérationnelles majeures : réduire la latence en traitant localement les données capteurs, et limiter la dépendance réseau dans des environnements de production. La revue identifie des verrous encore ouverts, notamment l'interopérabilité entre protocoles hétérogènes et la boucle de contrôle par retour d'information dans des systèmes multi-agents distribués. Il convient de souligner que ces résultats restent à ce stade conceptuels : le papier propose un cadre et une taxonomie, pas un système validé en déploiement réel, et l'absence de benchmarks reproductibles est explicitement signalée comme une limite. Ce travail s'inscrit dans un courant académique et industriel que NVIDIA a popularisé sous le terme de Physical AI, désignant des systèmes capables d'agir dans le monde physique via des robots ou des actionneurs connectés. La robotique connectée que dessine ce survey fait écho aux développements de plateformes cloud-robot portés par des acteurs comme Boston Dynamics, ou en Europe par des intégrateurs spécialisés comme Exotec dans les AMR et Enchanted Tools dans la robotique collaborative. Les auteurs identifient eux-mêmes comme prochaine étape la validation expérimentale de leur cadre sur des cas d'usage réels, condition nécessaire pour que l'architecture proposée dépasse le statut de roadmap et devienne une référence opérationnelle pour l'industrie.

IA physiquePaper
1 source
IA incarnée : intégration du risque sémantique dans les champs de distance et les CBF pour un contrôle monoculaire en ligne
3019arXiv cs.RO 

IA incarnée : intégration du risque sémantique dans les champs de distance et les CBF pour un contrôle monoculaire en ligne

Une équipe de chercheurs a publié en juin 2026 (arXiv:2606.01605) un framework de navigation sûre qui intègre le risque sémantique directement dans la représentation spatiale utilisée par les contrôleurs basés sur les Control Barrier Functions (CBF). Le système fonctionne à partir d'une unique caméra RGB monoculaire, reconstruit la géométrie 3D dense en temps réel via un front-end SLAM fondé sur un modèle de fondation, puis fusionne une segmentation sémantique par pixel dans cette géométrie. Le tout est converti en un champ de distance signé euclidien (ESDF) enrichi sémantiquement, où chaque classe d'obstacles impose un gonflement spatial proportionnel à son niveau de risque avant le calcul du champ. Le pipeline tourne en ligne à 10-20 Hz et a été validé en simulation et sur du matériel réel, en téléopération et en navigation autonome. L'intérêt opérationnel est précis : les architectures CBF classiques appliquent la même marge de sécurité à tous les obstacles cartographiés, qu'il s'agisse d'une pile de cartons ou d'un opérateur humain. En encodant le risque sémantique dans l'ESDF avant l'optimisation du contrôleur, et non en ajustement aval, les objets à risque élevé exercent une influence spatiale plus grande dès la représentation du monde. Pour un intégrateur ou un COO industriel, cela signifie un robot capable de moduler automatiquement ses marges de sécurité selon le contexte sans reconfiguration manuelle des paramètres de contrôle, ce qui est pertinent pour des environnements mixtes homme-machine. Les CBF sont un outil mathématique bien établi pour garantir la sécurité des systèmes dynamiques, et leur usage dans la robotique mobile croît depuis une dizaine d'années. La littérature existante exploitait déjà les ESDF pour alimenter ces contrôleurs, mais la fusion sémantique restait marginale ou traitée en post-processing. Ce travail reste au stade preprint sans déploiement industriel annoncé, et les vidéos de démonstration sélectionnées ne permettent pas d'évaluer la robustesse en conditions réelles dégradées. Les prochaines étapes naturelles sont l'évaluation sur des scènes avec occultations et des classes d'obstacles plus nombreuses, ainsi qu'une comparaison quantitative avec des baselines sémantiques concurrentes.

IA physiquePaper
1 source
WALL-WM : modélisation des actions du monde aux points d'articulation d'événements
3020arXiv cs.RO 

WALL-WM : modélisation des actions du monde aux points d'articulation d'événements

Une équipe de chercheurs a publié le 2 juin 2026 sur arXiv (arXiv:2606.01955) les travaux portant sur WALL-WM, un World Action Model (WAM) qui propose de repenser la manière dont les modèles Vision-Language-Action (VLA) sont entraînés pour la robotique généraliste. Là où les approches dominantes, comme celles exploitées par Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2), optimisent des "chunks" d'actions à longueur fixe conditionnés sur l'observation courante, WALL-WM substitue à cette unité temporelle arbitraire l'événement sémantique : une séquence d'actions cohérente du point de vue du sens (attraper un objet, ouvrir un tiroir), extraite automatiquement par des légendes au niveau événementiel et un échantillonnage cluster-balancé. Le modèle expose deux modes d'inférence : un mode "event" qui consomme des descriptions de l'événement suivant et produit des chunks à longueur variable, et un mode "unified" qui applique un mécanisme baptisé Staircase Decoding pour conserver une inférence à longueur fixe tout en maintenant un chemin VLA à gradient continu. Le tout est entraîné à grande échelle via l'optimiseur Muon, et les auteurs revendiquent des performances état de l'art sur une évaluation de généralisation en monde réel à large échelle, sans préciser les benchmarks ni les données de déploiement. L'intérêt de l'approche réside dans le diagnostic qu'elle formule : le désalignement de granularité entre langage (objectifs sémantiques), vision (dynamique de scène continue) et actions (timescales de contrôle) transforme l'entraînement VLA classique en simple fitting de corrélations à court horizon, ce qui explique les difficultés de généralisation observées hors distribution. En traitant l'événement comme unité atomique d'apprentissage, WALL-WM offre une piste sérieuse pour réduire le sim-to-real gap et améliorer le transfer sur des tâches et des scènes non vues, deux verrous majeurs qui bloquent le passage à l'échelle industrielle des robots manipulateurs. Il convient cependant de rester prudent : il s'agit d'un preprint sans revue par les pairs, sans données de déploiement terrain, et sans détail sur les benchmarks précis utilisés pour établir la supériorité annoncée. WALL-WM s'inscrit dans une vague de recherche sur les WAMs qui a pris de l'ampleur depuis 2024, portée notamment par Physical Intelligence avec Pi-0 et Pi-0.5, Google DeepMind avec RT-2 et ses successeurs, et NVIDIA avec GR00T N2 pour les humanoïdes. Ces modèles partagent l'ambition de pré-entraîner des politiques robotiques générales sur des données hétérogènes avant de les affiner par tâche. La contribution de WALL-WM est théoriquement propre et l'infrastructure Muon suggère un effort de calcul significatif, mais l'absence de résultats quantitatifs détaillés dans le résumé limite l'évaluation externe. Les prochaines étapes attendues sont une publication complète avec benchmarks reproduisibles (LIBERO, OpenVLA-OFT, RoboMimic) et, idéalement, des partenariats industriels pour validation en environnement de production.

IA physiqueOpinion
1 source
Tous les points ne se valent pas : synthèse de scènes LiDAR 4D avec conscience de l'incertitude
3021arXiv cs.RO 

Tous les points ne se valent pas : synthèse de scènes LiDAR 4D avec conscience de l'incertitude

Une équipe de chercheurs a publié en juin 2026 sur arXiv un cadre de génération de scènes LiDAR 4D baptisé U4D (arXiv:2606.02510), conçu pour l'IA incarnée (embodied AI) et la simulation de véhicules autonomes. Le constat de départ : dans un seul scan LiDAR, la difficulté perceptuelle varie considérablement selon les régions ; surfaces distantes, contours occultés et petits objets présentent une incertitude géométrique bien plus élevée que les structures bien observées. U4D quantifie cette incertitude point par point via l'entropie de Shannon, extraite d'un segmenteur neuronal pré-entraîné, pour produire des cartes d'incertitude spatiale par point. Le pipeline adopte un ordonnancement "du difficile au simple" : un premier stage de diffusion non conditionnelle synthétise les zones à haute entropie avec précision géométrique, puis un stage de complétion conditionnelle remplit les régions restantes en s'appuyant sur ces structures comme priors. Un bloc MoST (Mixture of Spatio-Temporal) assure la cohérence inter-images en équilibrant détail spatial et continuité temporelle. Les validations sur les benchmarks nuScenes et SemanticKITTI affichent des résultats revendiqués état de l'art en fidélité de scène, cohérence temporelle et performances sur les tâches aval de perception. L'approche corrige une limite fondamentale des générateurs LiDAR existants, qui allouent une capacité de modélisation uniforme sur l'ensemble de l'espace, traitant de fait un trottoir proche et un piéton à 60 mètres avec le même effort de synthèse. En concentrant la puissance générative sur les zones les plus incertaines, U4D vise à améliorer la qualité des données synthétiques pour l'entraînement de percepteurs embarqués, enjeu critique pour les intégrateurs de systèmes autonomes cherchant à réduire le coût de collecte et d'annotation de données réelles. La robustesse sur SemanticKITTI, jeu de données distinct des conditions d'entraînement principales, suggère une certaine généralisation, bien que les résultats demeurent limités à des expériences académiques sans déploiement industriel annoncé ni évaluation publique indépendante. La génération de LiDAR synthétique est un champ actif depuis l'essor des modèles de diffusion appliqués à la 3D, avec des travaux antérieurs comme LiDARGen, UltraLiDAR ou DriveDreamer couvrant partiellement ce problème. U4D se distingue en introduisant explicitement l'incertitude dans le processus génératif, concept emprunté à la littérature sur l'apprentissage actif et la calibration de réseaux. Aucun acteur européen n'est cité dans l'article, mais des laboratoires comme le CEA-List ou des startups de perception comme Outsight pourraient intégrer de tels outils dans leurs pipelines de validation sim-to-real. La prochaine étape naturelle sera d'évaluer U4D sur des capteurs et environnements hors distribution, et de l'intégrer dans des pipelines de World Model pour la planification autonome à grande échelle.

RecherchePaper
1 source
Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides
3022arXiv cs.RO 

Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides

Une équipe de chercheurs publie MRO-GWM (Multi Rigid Object Gaussian World Model), un modèle de monde action-conditionnel capable de prédire en 3D les effets des actions d'un robot sur des objets rigides. Déposé sur arXiv (réf. 2606.01950), le travail combine Gaussian splatting et apprentissage de dynamique : chaque objet de la scène est décrit par un ensemble de gaussiennes dans un référentiel canonique propre, son mouvement étant modélisé comme une transformation de corps rigide (rotation et translation). Un transformateur spatio-temporel prédit la trajectoire future des objets à partir de leur historique gaussien et des actions planifiées par le robot. L'architecture gère les occlusions partielles grâce à un entraînement sur reconstructions multi-vues. Les évaluations portent sur des datasets synthétiques d'objets ménagers en interaction avec un effecteur robot, et sur des tâches de manipulation non préhensile (pousser un objet sans le saisir) dans le cadre d'un contrôle prédictif par modèle (MPC), le tout exclusivement en simulation. L'association de modèles de monde action-conditionnels et de Gaussian splatting est pertinente : les premiers permettent de planifier sans essai-erreur coûteux, le second offre une représentation 3D différentiable adaptée à des géométries complexes sans maillage explicite. La décomposition objet-centrique améliore en théorie la généralisation à de nouvelles configurations de scène, contrairement aux encodages holistes. La validation sur manipulation non préhensile est notable car pousser un objet vers une cible est considéré comme un benchmark difficile : les contacts sont instables et mal modélisés par la plupart des simulateurs physiques. Ces résultats restent toutefois entièrement simulés et limités aux objets strictement rigides, sans aucun transfert sim-to-real documenté. Le Gaussian splatting connaît une adoption rapide en robotique depuis la publication de 3DGS (Kerbl et al., 2023), avec des travaux concurrents comme SplatSim, GaussianWorld ou des approches combinant NeRF et planification. MRO-GWM se distingue par son traitement explicite de la dynamique multi-objets avec interactions physiques, un axe moins couvert que la navigation ou la préhension isolée. Le gap sim-to-real demeure le verrou principal : une validation sur bras réel (type Franka ou UR5) constituerait l'étape naturelle, tout comme une extension aux objets articulés ou semi-rigides, aujourd'hui hors périmètre du modèle.

RecherchePaper
1 source
Coordination du changement de tâches dans un système multi-agents robotique à l'aide d'arbres de comportement
3023arXiv cs.RO 

Coordination du changement de tâches dans un système multi-agents robotique à l'aide d'arbres de comportement

L'équipe ThundeRatz de l'Universidade de São Paulo a publié en juin 2026 un article (arXiv:2606.01170) présentant une nouvelle architecture de coordination pour ses robots de football miniature, dans le cadre de la catégorie IEEE Very Small Size Soccer (VSSS). Ce format de compétition met en jeu deux équipes de trois robots chacune, évoluant dans un environnement particulièrement dynamique. Pour gérer les changements de rôle et de comportement en temps réel, l'équipe a remplacé son système historique à base d'automates finis (FSM, Finite State Machine) par une architecture fondée sur des arbres de comportement (Behavior Trees, BT). La comparaison entre les deux approches a été conduite sur le simulateur FIRASim, puis validée lors d'une compétition académique réelle. Le passage FSM vers BT représente un choix architectural significatif dans le domaine de la coordination multi-agents en robotique. Les FSM sont réputés fragiles à mesure que le nombre d'états croît : chaque nouvelle transition requiert une mise à jour manuelle de l'ensemble du graphe, ce qui génère rapidement un code difficile à maintenir dans des environnements où les comportements doivent être recomposés dynamiquement. Les Behavior Trees offrent, à l'inverse, une structure modulaire et hiérarchique qui facilite le changement de tâche en cours d'exécution. Appliqué au football multi-robots, cela signifie une meilleure réactivité aux situations de jeu imprévues, attaquant, défenseur, gardien pouvant échanger leurs rôles de manière coordonnée sans régression comportementale. Ce type de résultat, même dans un cadre académique et à petite échelle, alimente directement les travaux sur la coordination de flottes de robots industriels (AMR, bras collaboratifs) où la commutation de tâche est un point de défaillance récurrent. La compétition VSSS existe depuis plusieurs années sous l'égide de l'IEEE et constitue un banc d'essai reconnu en robotique collective, notamment en Amérique du Sud. ThundeRatz est l'une des équipes historiques du circuit, et ses publications alimentent régulièrement la littérature sur la coordination embarquée à faibles ressources. Sur le plan concurrentiel, les approches BT sont désormais adoptées par plusieurs frameworks robotiques majeurs, dont ROS 2 via BehaviorTree.CPP, ainsi que par des acteurs industriels comme Boston Dynamics pour la gestion comportementale de Spot. L'article ne détaille pas de métriques de performance chiffrées dans son résumé, ce qui rend difficile toute comparaison directe avec d'autres travaux ; les résultats complets restent à consulter dans le corps du papier.

RecherchePaper
1 source
Clonage comportemental de la commande prédictive pour manipulateurs robotiques à 3 degrés de liberté
3024arXiv cs.RO 

Clonage comportemental de la commande prédictive pour manipulateurs robotiques à 3 degrés de liberté

Une équipe de chercheurs présente dans un preprint arXiv (2606.00383, soumis début juin 2026) une étude empirique sur l'application du Behavior Cloning pour approximer les politiques de commande prédictive par modèle (MPC) sur un manipulateur robotique à 3 degrés de liberté (DOF). Le principe : entraîner un réseau de neurones à imiter le comportement d'un contrôleur MPC classique, couplé à de la cinématique inverse, afin de produire une politique de substitution nettement moins coûteuse en calcul. Plusieurs architectures ont été évaluées, des régresseurs classiques aux réseaux profonds (Deep MLP) en passant par des architectures récurrentes (RNN), selon des protocoles d'évaluation en ligne et hors ligne. Le meilleur résultat atteint une réduction de latence d'inférence d'un facteur 3 par rapport au MPC original, avec un taux de succès de 84,98 % sous tolérances relâchées. Point notable : les architectures statiques (MLP) surpassent les variantes temporelles (RNN), ce qui suggère que l'observation instantanée de l'état est suffisante pour cette tâche. Ce résultat est significatif pour les systèmes embarqués temps réel, où le MPC est souvent jugé trop gourmand en ressources pour tourner en boucle fermée sur du matériel contraint. La distillation de politique MPC via l'imitation ouvre la voie à des contrôleurs légers déployables sur des microcontrôleurs ou des SoC industriels sans sacrifier l'essentiel de la qualité de trajectoire. Cependant, la réserve éditoriale s'impose : les 84,98 % de succès sont mesurés sous tolérances relâchées. Sous tolérances strictes, les auteurs observent un écart de précision résiduel, notamment sur l'erreur en régime permanent, ce qui limite pour l'instant l'applicabilité à des tâches d'assemblage de haute précision. Le Behavior Cloning appliqué au contrôle de bras robotiques s'inscrit dans un courant plus large de distillation de contrôleurs optimaux vers des politiques neuronales légères, parallèle à la tendance des VLA (Vision-Language-Action models) qui cherchent à généraliser plutôt qu'à optimiser. Des travaux antérieurs ont exploré des approches similaires sur des robots à plus grand nombre de DOF, mais l'originalité ici réside dans l'analyse comparative systématique des architectures et la quantification rigoureuse du compromis latence/précision. Ce preprint n'est pas encore évalué par les pairs ; les prochaines étapes naturelles incluent la validation sur manipulateurs réels à 6 ou 7 DOF et le test sous charges variables.

RecherchePaper
1 source
Mémoire spatio-sémantique dynamique et résiliente avec localisation hybride pour la manipulation mobile
3025arXiv cs.RO 

Mémoire spatio-sémantique dynamique et résiliente avec localisation hybride pour la manipulation mobile

Une équipe de recherche a publié sur arXiv (réf. 2606.00576) DREAM, un framework de manipulation mobile robotique pour environnements intérieurs dynamiques, fonctionnant sans carte pré-construite. Le système construit en temps réel une mémoire voxel spatio-sémantique à partir d'observations RGB-D enregistrées par un backend SLAM hybride LiDAR-inertiel-visuel. Pour retrouver des objets cibles, DREAM combine retrieval 3D conditionné par le langage naturel, détection à vocabulaire ouvert, et vérification sémantique par un grand modèle de langage multimodal (MLLM). Sa contribution technique centrale est le RMP (Redundancy-Aware Memory Pruning), un mécanisme d'élagage conscient du pose-graph qui propage les corrections de pose aux observations historiques tout en maintenant l'empreinte mémoire bornée. Testé sur robot réel dans quatre scènes de laboratoire dynamiques, DREAM améliore les taux de succès sur tâches longue durée : de 40-60% avec le système de référence DynaMem à 55-70%, avec une empreinte mémoire de 0,37 à 0,63 Go et un temps de mise à jour de 0,43 à 0,53 seconde par scène. Ce résultat adresse un blocage fondamental de la manipulation mobile en conditions réelles : les systèmes existants supposent un environnement statique, des estimations de pose précises ou une carte pré-construite, trois hypothèses qui s'effondrent dès qu'un objet est déplacé ou qu'une correction de trajectoire intervient. DREAM répond à ce demo-to-real gap en propageant dynamiquement les corrections de pose à toute la mémoire historique, et en s'appuyant sur un MLLM pour la vérification sémantique plutôt qu'une simple correspondance géométrique. Nuance nécessaire toutefois : un taux de succès de 55-70% signifie encore 30-45% d'échecs en conditions de laboratoire contrôlées, et les tâches exactes testées ne sont pas détaillées dans l'abstract disponible, ce qui rend toute extrapolation à des environnements industriels ou domestiques réels prématurée. DynaMem constitue la référence directe de comparaison. La manipulation mobile autonome en milieu non-structuré est un axe actif chez plusieurs acteurs commerciaux : Figure avec son robot Figure 03, Physical Intelligence avec pi-zero et pi0.5, Boston Dynamics ou encore Agility Robotics. L'approche de DREAM, combinant SLAM dense, mémoire sémantique interrogeable en langage et vérification par LLM, s'inscrit dans la tendance VLA (Vision-Language-Action) qui cherche à combler le sim-to-real gap non par l'entraînement massif mais par une représentation du monde plus dynamique et cohérente. Aucune institution ni partenariat industriel n'est mentionné dans le résumé disponible, classant ce travail pour l'instant comme recherche académique pré-publication, sans timeline de déploiement annoncée.

RecherchePaper
1 source
Filtres de Kalman neuronaux pondérés par fréquence
3026arXiv cs.RO 

Filtres de Kalman neuronaux pondérés par fréquence

Une équipe de chercheurs a publié le 2 juin 2026 sur arXiv (arXiv:2606.02251) les travaux décrivant le FW-NKF, pour Frequency-Weighted Neural Kalman Filter, un filtre hybride qui combine estimation d'état classique et apprentissage profond pour supprimer les bruits périodiques et les interférences électromagnétiques qui dégradent les capteurs en conditions réelles. L'architecture intègre un opérateur de mise en forme spectrale causal directement dans le résidu de mesure du filtre de Kalman, tout en entraînant conjointement des réseaux de transition et d'observation sur l'espace latent. Testé sur quatre benchmarks hétérogènes, dont des systèmes chaotiques multi-dimensionnels de type Lorenz et de l'estimation de pose corporelle complète par unités inertielles (IMU), le FW-NKF affiche une réduction de l'erreur de localisation allant jusqu'à 10 % ainsi que des gains mesurables en précision d'orientation. Les études d'ablation confirment que la pondération fréquentielle et la modélisation latente profonde contribuent chacune de façon indépendante aux gains observés. Pour les intégrateurs de systèmes robotiques et les équipes d'autonomie, ce résultat est pertinent car les filtres de Kalman classiques, y compris leurs variantes étendues (EKF), ne disposent d'aucun mécanisme explicite pour atténuer les composantes de bruit bande-limitée, vibrations de capteurs ou interférences RF, qui sont pourtant omniprésentes sur les plateformes industrielles, les drones et les robots humanoïdes. Une réduction de 10 % de l'erreur de localisation reste modeste mais significative dans des contextes où la dérive d'odométrie est cumulative, notamment pour la navigation longue durée ou la manipulation précise. Cela suggère qu'une intégration légère d'un filtre spectral appris peut se substituer à des chaînes de prétraitement signal ad hoc souvent coûteuses à calibrer. Le filtre de Kalman, introduit en 1960, reste la colonne vertébrale de l'estimation d'état en robotique et en aérospatiale. Les variantes Deep Kalman Filter (DKF) ont tenté depuis 2015-2016 d'y greffer des représentations apprises pour gérer la non-linéarité des dynamiques, mais sans traiter explicitement le domaine fréquentiel. Le FW-NKF s'inscrit dans cette lignée en comblant ce manque précis. La publication est un preprint non encore soumis à peer-review, et les benchmarks choisis, bien que diversifiés, ne couvrent pas de plateformes hardware réelles comme les IMU de Boston Dynamics ou les capteurs embarqués sur Figure ou Unitree, ce qui laisse ouverte la question du sim-to-real gap. Les prochaines étapes naturelles seraient une validation sur robot physique et une comparaison directe avec des filtres adaptatifs classiques comme le Sage-Husa.

RecherchePaper
1 source
Apprentissage de politiques de trajectoire multi-modales pour la manipulation robotique efficace en données
3027arXiv cs.RO 

Apprentissage de politiques de trajectoire multi-modales pour la manipulation robotique efficace en données

Des chercheurs ont publié le 1er juin 2026 sur arXiv (2606.01047) MATE (Multi-Modal Trajectory Policies), un cadre de prédiction de trajectoires pour la manipulation robotique construit sur une architecture Mixture-of-Experts (MoE). MATE traite simultanément des entrées hétérogènes, observations visuelles, instructions en langage naturel et représentations de trajectoires, en introduisant un routeur cosinus cross-modal qui garantit une affectation stable entre experts spécialisés, indépendamment de l'échelle des représentations. Un mécanisme de routage à température contrôlée avec injection de bruit stochastique prévient l'effondrement prématuré des experts (expert collapse). Sur le benchmark LIBERO, MATE améliore le taux de succès moyen de 4,75% par rapport aux politiques guidées par trajectoires existantes, particulièrement dans des scénarios à faible volume de données d'entraînement. Des tests en conditions réelles sur un robot jouant au ping-pong complètent la validation expérimentale. Le problème ciblé est la "modality interference" : quand une politique transformer unique traite dans le même espace de paramètres des signaux aussi disparates que des images RGB, du texte et des coordonnées de trajectoire, les représentations se perturbent mutuellement et les performances chutent. C'est un goulot d'étranglement bien documenté dans le développement des VLAs (Vision-Language-Action models) : les données de démonstration de qualité coûtent cher à collecter en environnement industriel. En proposant un découplage fin au niveau sub-token par spécialisation d'experts, MATE réduit cette interférence sans nécessiter de données supplémentaires. Pour les équipes robotique opérant avec des budgets de téléopération limités, c'est un signal positif, bien que les gains absolus (+4,75%) restent modestes et mesurés sur un benchmark académique contrôlé. La manipulation robotique généraliste est sous forte compétition depuis l'émergence des architectures transformer dédiées à la robotique vers 2022-2023. Des travaux comme ACT, Diffusion Policy, puis les VLAs OpenVLA (Berkeley/Stanford), pi0 de Physical Intelligence et GR00T N2 de NVIDIA ont progressivement unifié vision, langage et action. L'approche MoE reste moins explorée en robotique qu'en LLMs (GPT-4, Mixtral, DeepSeek-MoE), et MATE tente d'en résoudre les instabilités de routage propres aux modalités hétérogènes. Le benchmark LIBERO, développé par des institutions académiques américaines, est devenu une référence standard pour évaluer la généralisation en manipulation. À ce stade, il n'y a pas de déploiement industriel ni de partenariat annoncé : MATE est une preuve de concept académique, avec validation réelle limitée à un robot de ping-pong.

RechercheOpinion
1 source
Planification du mouvement multi-robots par modèle de diffusion guidé par apprentissage par renforcement multi-agents
3028arXiv cs.RO 

Planification du mouvement multi-robots par modèle de diffusion guidé par apprentissage par renforcement multi-agents

Une équipe de chercheurs propose, dans un préprint arXiv (2606.00933) publié début juin 2026, un cadre de planification de trajectoires pour flottes de robots mobiles combinant modèles de diffusion génératifs et apprentissage par renforcement multi-agents (MARL). Concrètement, chaque robot génère indépendamment des trajectoires candidates via un modèle de diffusion entraîné sur des données mono-agent, puis une fonction de valeur centralisée, apprise par MARL, oriente le processus de débruitage par gradient pour réduire les conflits entre agents. Ce mécanisme dit d'"exponential tilting" pousse la distribution de débruitage vers les trajectoires associées au meilleur retour collectif attendu. Évalué en simulation sur un labyrinthe avec quatre robots mobiles, le système réduit le taux d'interférence inter-agents de 55,4 % à 41,8 %, sans nécessiter de ré-entraînement du modèle génératif ni de planification jointe centralisée. Ce résultat attaque directement le compromis historique entre planification centralisée (précise mais peu scalable à mesure que la flotte grossit) et planification décentralisée (scalable mais aveugle aux autres agents). Le fait que la coordination soit injectée via un signal de guidage externe sans modifier le planificateur diffusion de base ouvre la voie à des architectures modulaires : on entraîne une fois le modèle de trajectoire mono-agent, puis on greffe la coordination selon l'environnement de déploiement. Pour les intégrateurs de systèmes multi-robots en entrepôt ou en manufacture, cela suggère qu'un découplage entre planification locale et coordination globale est techniquement praticable, ce qui simplifierait la mise à l'échelle des flottes hétérogènes sans refonte complète du pipeline. Le domaine est depuis longtemps dominé par des méthodes à base de graphes comme CBS (Conflict-Based Search) ou des approches réactives décentralisées comme ORCA, avec des tentatives d'apprentissage profond restées limitées en conditions réelles. L'application des modèles de diffusion à la génération de trajectoires robotiques constitue un courant émergent, illustré notamment par Diffusion Policy (Chi et al., 2023) en manipulation, mais rarement couplé au MARL pour la coordination de flotte. Ce travail reste pour l'instant une preuve de concept en simulation sur quatre robots dans un environnement simple, et la généralisation à des scènes dynamiques, à des flottes plus larges ou à des robots hétérogènes demeure un défi non adressé. Les prochaines étapes naturelles incluent la validation sur hardware réel et la confrontation aux benchmarks de référence du MAPF (Multi-Agent Path Finding).

RecherchePaper
1 source
Mécanisme passif de préhension universelle basé sur une coque en éversion
3029arXiv cs.RO 

Mécanisme passif de préhension universelle basé sur une coque en éversion

Une équipe de chercheurs a soumis sur arXiv (preprint 2606.00470, juin 2026) la conception d'un préhenseur passif monolithique basé sur l'éversion d'une coque bistable élastiquement déformable. Le mécanisme fonctionne sans commande active pendant la saisie : au contact d'un objet, la coque bascule spontanément de son premier état stable vers son second (éversion), forçant des bras composés de segments de poutres flexibles à envelopper l'objet et à former une enceinte fermée. Le système reste verrouillé dans cette configuration jusqu'à une actuation explicite pour libérer l'objet, éliminant ainsi le besoin d'énergie continue en phase de maintien. La charge utile (payload) dépend de la rigidité des bras, la taille maximale préhensible de leurs dimensions. Le mécanisme est conçu pour saisir des objets rigides de forme quelconque, sans adaptation de trajectoire ni paramétrage géométrique préalable. L'intérêt de cette approche tient à sa double propriété : universalité et passivité. La plupart des préhenseurs polyvalents requièrent une actuation active (pneumatique, moteurs, câbles) ou de l'intelligence embarquée pour s'adapter à la géométrie de l'objet. La compliance distribuée des bras, c'est-à-dire la flexibilité répartie sur toute leur longueur plutôt que concentrée en un point, permet à la structure de se conformer à la forme de l'objet sans exercer de force excessive, réduisant le risque d'endommagement de pièces fragiles. Pour un intégrateur industriel, cela représente un préhenseur potentiellement moins coûteux, tolérant aux variations dimensionnelles en production, et ne consommant pas d'énergie pendant la tenue d'objet. L'approche exploite la mécanique des structures bistables, déjà éprouvée dans les micromécanismes MEMS et les structures spatiales déployables, mais son application à la préhension robotique reste entièrement à valider expérimentalement. Les préhenseurs adaptatifs passifs constituent un axe de recherche actif depuis les travaux sur les mains underactuées (Barrett Hand, DLR, Université Laval) dans les années 2000. Les approches concurrentes incluent les doigts souples en silicone (Soft Robotics Inc., Festo Bionic Cobot), le jamming granulaire (Universal Robots, Piab) et les structures compliant issues de l'impression 3D. Ce preprint se distingue par son mécanisme à snap-through bistable, proche des travaux récents sur les actionneurs à énergie stockée en origami et morphing structures. Point important : le résumé publié ne présente ni prototype physique ni résultats expérimentaux, ce qui situe le travail au stade de la conceptualisation théorique. Les prochaines étapes attendues sont la fabrication d'un prototype (élastomère ou impression 3D multi-matériaux) et la caractérisation expérimentale des paramètres de payload et de taille maximale d'objet en fonction de la géométrie des bras.

RecherchePaper
1 source
Enrichir le contexte spatial et temporel pour l'apprentissage par imitation robotique avec des graphes de scène
3030arXiv cs.RO 

Enrichir le contexte spatial et temporel pour l'apprentissage par imitation robotique avec des graphes de scène

Des chercheurs ont publié le 1er juin 2026 sur arXiv (2606.01072) une méthode d'apprentissage par imitation qui exploite des graphes de scène dynamiques comme mécanisme de mémoire structurée pour les robots mobiles. Le principe : pendant l'exécution d'une tâche, le robot maintient un graphe de scène mis à jour en continu, qui encode les relations entre objets et leur évolution dans le temps. Plutôt que de traiter uniquement les observations courantes du capteur, le système capitalise sur l'historique accrété de l'environnement pour inférer des politiques d'action. Les validations couvrent deux régimes : manipulation mobile en simulation (environnements à grande échelle spatialement) et manipulation sur table en conditions réelles. Les auteurs rapportent une amélioration substantielle des performances par rapport aux baselines, particulièrement sur des tâches nécessitant un raisonnement à long terme, sans donner de métriques chiffrées précises dans l'abstract. Ce travail s'attaque à deux verrous persistants du déploiement de robots apprenants dans des environnements non-structurés. Le premier est l'observabilité partielle : dans un appartement ou un bureau, le champ de vision d'un robot ne capture qu'une fraction de l'espace pertinent, et les objets manipulés disparaissent régulièrement du cadre. Le second est l'horizon temporel : des tâches comme "ranger la cuisine" enchaînent des dizaines de sous-tâches dont les dépendances ne sont pas localement visibles. En substituant un graphe de scène explicite et structuré à une mémoire implicite (fenêtre d'observations brutes, état caché LSTM), l'approche donne au robot une représentation interprétable et modulaire du contexte. Pour les intégrateurs industriels et les équipes qui déploient des politiques d'imitation dans des environnements semi-structurés, c'est une piste crédible pour réduire le gap entre démo de labo et robustesse opérationnelle, même si les expériences restent pour l'instant confinées à la simulation et au tabletop. L'apprentissage par imitation (behavioral cloning, GAIL, DAgger) a connu un regain d'intérêt majeur avec l'essor des Visual Language Action models (VLA) comme Pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA. Les graphes de scène sont une technique éprouvée en vision par ordinateur et en navigation robotique (travaux de Armeni, Rosinol, Chang notamment), mais leur intégration dans des pipelines d'imitation learning reste peu explorée. Les approches concurrentes pour gérer la mémoire à long terme incluent les transformers avec attention sur un historique d'observations, les représentations de tâches hiérarchiques (task graphs), et les world models latents. Ce preprint n'étant pas encore évalué par les pairs, ses résultats méritent confirmation sur des benchmarks plus larges et des environnements réellement non-structurés avant de pouvoir orienter des décisions d'architecture. Les auteurs n'annoncent pas de code public ni de suite industrielle à ce stade.

RechercheOpinion
1 source
Cuttlebot : démonstration d'une plateforme pour nageurs complexes, autonomes et bio-inspirés
3031arXiv cs.RO 

Cuttlebot : démonstration d'une plateforme pour nageurs complexes, autonomes et bio-inspirés

Des chercheurs ont présenté le Cuttlebot, un robot autonome inspiré de la seiche, conçu pour l'exploration sous-marine en utilisant six actionneurs à élastomère diélectrique (DEA) comme muscles artificiels. Ces DEA, qui se déforment sous l'effet d'un champ électrique, sont particulièrement adaptés aux environnements des grands fonds grâce à leur tolérance à la pression et aux basses températures, ainsi qu'à leur structure souple compatible avec les écosystèmes marins fragiles. L'équipe a développé en parallèle la plateforme embarquée CORE, capable de piloter simultanément ces six muscles tout en intégrant des capteurs visuels et spatiaux. Le robot dispose de quatre muscles principaux dans ses nageoires, qui génèrent une nage ondulatoire en trois dimensions, complétés par un préhenseur souple inspiré des tentacules de la seiche. Lors des tests en piscine, en mode filaire et autonome, le Cuttlebot a atteint une vitesse de translation de 2,5 cm/s et une vitesse de rotation de 10 degrés par seconde, des performances modestes mais cohérentes avec un premier démonstrateur académique. La plateforme CORE démontre par ailleurs un contrôle de force et de couple sur six axes. La contribution principale de ce travail réside moins dans les performances brutes que dans l'intégration réussie des DEA dans un système autonome complet. Ces muscles à élastomère diélectrique sont connus depuis longtemps pour leurs propriétés prometteuses (légèreté, silence, biocompatibilité), mais leur intégration dans des architectures robotiques embarquées reste un verrou technique majeur : ils nécessitent des signaux électriques haute tension difficiles à miniaturiser. Le CORE apporte une réponse concrète en proposant une électronique de contrôle dédiée, embarquant à la fois l'actionnement et la perception. Pour les acteurs de l'exploration sous-marine ou de la surveillance environnementale, cette architecture ouvre la voie à des robots plus silencieux et moins intrusifs que les AUV à propulsion mécanique classique, qui perturbent la faune par leurs vibrations et leur bruit. L'intérêt croissant pour les ressources des grands fonds (minéraux, données sismiques, biodiversité) renforce la demande de plateformes robotiques légères et peu invasives, dans des zones où les ROV câblés conventionnels restent coûteux à déployer. Plusieurs équipes travaillent sur des approches comparables, notamment les robots souples de l'ETH Zurich et de Harvard, ou les plateformes bio-inspirées du MIT. Le Cuttlebot se distingue par l'accent mis sur l'autonomie embarquée plutôt que sur la seule démonstration cinématique en laboratoire. La prochaine étape logique serait une évaluation en milieu réel, avec des contraintes de courant, de pression et de turbidité que les tests en piscine ne reproduisent pas.

RecherchePaper
1 source
Cinématique inverse corps entier par diffusion sur graphe
3032arXiv cs.RO 

Cinématique inverse corps entier par diffusion sur graphe

Une équipe de chercheurs publie sur arXiv (identifiant 2606.00086, daté du 2 juin 2026) GraphDiff-IK, un framework de diffusion sur graphe pour résoudre la cinématique inverse (IK) sur des robots à morphologies variées. L'IK est un problème fondamental : il s'agit de calculer les configurations articulaires permettant à l'effecteur d'atteindre une pose cible dans l'espace. GraphDiff-IK représente le robot comme un graphe cinématique construit directement depuis son fichier URDF, où chaque noeud correspond à une articulation actionnée et chaque arête encode une dépendance cinématique. Sur cette structure, le framework formule l'IK comme un processus de diffusion conditionnelle qui génère directement des configurations articulaires. Il intègre un raisonnement hiérarchique par passage de messages par étapes successives, un conditionnement explicite du torse pour les robots multi-branches, ainsi qu'un retour de cinématique directe bruitée et une supervision dans l'espace des tâches pour renforcer la cohérence géométrique pendant le débruitage. L'approche couvre les bras simples, les systèmes bimanuel et les robots articulés avec torse ou taille. L'intérêt technique est réel : les solveurs IK classiques, qu'ils soient analytiques ou numériques (KDL, trac-IK, OpenRAVE), sont performants mais spécialisés par morphologie et peinent à représenter la nature multi-modale du problème, c'est-à-dire l'existence de plusieurs configurations articulaires valides pour une même pose cible. Cette multi-modalité est précisément ce que la diffusion capture de manière naturelle, ce qui ouvre la voie à des solveurs IK généralisables à une large gamme de plateformes sans ré-entraînement par robot. Pour les systèmes redondants comme les humanoïdes complets, dont le nombre de degrés de liberté dépasse les contraintes de la tâche, cette capacité à explorer l'espace des solutions est particulièrement précieuse. Ce travail s'inscrit dans une vague plus large d'application des modèles de diffusion à la robotique : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les politiques de diffusion pour le contrôle en sont les exemples les plus visibles. Appliquer ce paradigme à l'IK, plutôt qu'aux politiques de haut niveau, est une extension logique mais non triviale. Il convient cependant de noter qu'il s'agit d'un preprint non encore évalué par les pairs, sans validation sur hardware industriel ni déploiement annoncé. Les prochaines étapes naturelles seraient une intégration dans des pipelines de planification de mouvement et des tests sur des plateformes physiques, notamment des humanoïdes commerciaux dont la cinématique whole-body reste un goulot d'étranglement opérationnel.

RecherchePaper
1 source
Détection et atténuation proactives-réactives des pannes intermittentes dans les essaims de robots
3033arXiv cs.RO 

Détection et atténuation proactives-réactives des pannes intermittentes dans les essaims de robots

Des chercheurs ont publié sur arXiv (2509.19246v2) une méthode de détection et mitigation des pannes intermittentes dans les essaims de robots. Ces erreurs transitoires et sporadiques (défaillances de capteurs, interférences radio) ont été largement ignorées par la littérature sur la tolérance aux fautes, qui se concentrait sur les pannes permanentes. L'approche exploite le paradigme SoNS (self-organizing nervous systems), permettant à un essaim de maintenir des structures réseau persistantes plutôt que des topologies ad hoc éphémères. Les auteurs proposent une stratégie proactive-réactive : avant toute panne, chaque robot construit dynamiquement des chemins de communication de secours adaptatifs ; en cas d'anomalie, des one-shot likelihood ratio tests sur un réseau multiplex détectent le problème et reroutent la communication de façon auto-organisée jusqu'à résolution. Validée en simulation sur des scénarios de contrôle de formation avec données positionnelles erronées, la méthode atteint une haute précision de détection avec un faible taux de faux positifs, sans perturber la convergence des formations. Ce travail comble un manque réel dans la recherche : les pannes intermittentes sont précisément les plus fréquentes dans les déploiements industriels (erreurs de localisation sporadiques sur AMRs, coupures réseau fugaces, dérives de capteurs), mais leur caractère transitoire les rendait indétectables par les algorithmes classiques basés sur timeout ou silence prolongé. Le fait que la méthode s'appuie sur des topologies réseau persistantes la rend potentiellement applicable à des flottes industrielles semi-supervisées en logistique ou en inspection automatisée, là où les architectures d'essaims purement ad hoc peinent à maintenir la traçabilité des fautes. Le paradigme SoNS a émergé ces dernières années comme alternative aux architectures d'essaims entièrement décentralisées, en introduisant une couche de structure topologique dynamique. Ce preprint (v2, septembre 2025) est vraisemblablement en cours d'évaluation par les pairs. Dans le paysage industriel, les essaims auto-organisés restent majoritairement académiques : des acteurs comme Exotec en AMR de picking ou des frameworks de coordination multi-robots semi-centralisés dominent les déploiements réels. Les auteurs ne citent ni pilotes terrain ni partenaires industriels, et la généralisation à des essaims hétérogènes ou à grande échelle en environnements RF dégradés reste à démontrer.

RecherchePaper
1 source
Gradients de valeur pour la conception de robots à morphologies multiples
3034arXiv cs.RO 

Gradients de valeur pour la conception de robots à morphologies multiples

Des chercheurs ont publié le 2 juin 2026 sur arXiv (référence 2606.00702) une méthode visant à accélérer la conception de robots via ce qu'ils nomment les "value gradients". Le principe consiste à entraîner une unique fonction de valeur issue du reinforcement learning sur un ensemble varié de morphologies robotiques, puis à utiliser cette fonction, une fois gelée, comme proxy différentiable pour optimiser de nouveaux designs sans relancer de cycle d'apprentissage complet. Les expériences portent sur des modèles entraînés sur jusqu'à 50 robots distincts, couvrant des espaces de conception de plus de 1 100 paramètres continus d'embodiment: longueurs de membres, configurations articulaires, propriétés mécaniques. La méthode a été évaluée sur des variantes perturbées d'un même robot mais aussi sur des morphologies entièrement nouvelles appartenant à des classes non vues à l'entraînement, testant ainsi sa capacité de généralisation. Le problème que ce travail adresse est central en co-conception robotique: optimiser conjointement la morphologie d'un robot et son contrôleur nécessite traditionnellement de relancer un cycle complet de reinforcement learning pour chaque design candidat, une opération computationnellement prohibitive qui freine l'exploration de l'espace de conception. En gelant la fonction de valeur après un premier entraînement généralisé, les auteurs la transforment en oracle différentiable, permettant d'optimiser directement les paramètres physiques via descente de gradient, sans resimulation coûteuse. Au-delà de l'optimisation, l'analyse des gradients permet d'identifier quels paramètres de design ou de contrôle limitent les performances, une capacité analytique précieuse pour les ingénieurs souhaitant localiser des goulots d'étranglement avant d'engager des cycles de prototypage physique coûteux. La co-conception robotique est un domaine actif depuis plusieurs années, avec des approches concurrentes allant des algorithmes évolutionnaires aux méthodes de simulation physique différentiable explorées notamment par MIT CSAIL, ETH Zurich ou Google DeepMind. La particularité de cette contribution est de ne pas exiger de simulateur différentiable lors de l'optimisation: seule la fonction de valeur préentraînée suffit, la rendant potentiellement compatible avec des pipelines de simulation standard non différentiables. Les suites naturelles concernent l'extension à des espaces de conception encore plus larges, des tâches multi-objectifs et des morphologies plus complexes comme les manipulateurs industriels ou les humanoïdes. Il s'agit à ce stade d'une contribution purement académique, sans partenariat industriel ni déploiement annoncé.

RecherchePaper
1 source
Transfert simulation-réel pour robots à actionneurs musculaires via réseaux d'actionneurs généralisés
3035arXiv cs.RO 

Transfert simulation-réel pour robots à actionneurs musculaires via réseaux d'actionneurs généralisés

Une équipe de chercheurs a publié sur arXiv (référence 2604.09487) une méthode de transfert simulation-réel (sim-to-real) pour robots à actionnement musculaire, une classe d'actionneurs rarement intégrée dans les systèmes robotiques industriels malgré leurs avantages théoriques. La méthode, baptisée Generalized Actuator Network (GenAN), a été validée sur PAMY2, un bras robotique à 4 degrés de liberté (DOF) entraîné par tendons et alimenté par des muscles artificiels pneumatiques (PAM). Trois tâches ont été déployées avec succès sur le robot réel à partir de politiques entraînées entièrement en simulation : atteinte de cibles dynamiques, ball-in-a-cup et tennis de table. Les auteurs revendiquent une première mondiale, à savoir le premier transfert sim-to-real réussi pour un bras à actionnement musculaire à 4 DOF. L'obstacle historique aux robots PAM est leur comportement fortement non-linéaire, avec friction et hystérésis, qui rend leur modélisation analytique difficile et a jusqu'ici bloqué l'application des techniques de reinforcement learning en simulation. GenAN contourne ce problème en apprenant un réseau de neurones qui identifie le modèle d'actuation directement depuis des trajectoires de position articulaire, sans capteurs de couple, coûteux et fragiles. Ce modèle appris est ensuite couplé à une simulation rigide classique pour les dynamiques du bras. Cette architecture valide l'hypothèse qu'il est possible de dissocier la modélisation des actionneurs complexes du reste de la chaîne cinématique, et ouvre potentiellement la voie à des robots plus rapides et plus sûrs en interaction humain-robot. Les muscles artificiels pneumatiques sont connus depuis des décennies dans la recherche, mais leur adoption industrielle est restée marginale face aux actionneurs électriques en raison de la difficulté de contrôle. PAMY2 est une plateforme académique, et ce travail est publié sous forme de preprint, non encore soumis à revue par les pairs confirmée. Les acteurs dominants du sim-to-real, Boston Dynamics, Figure ou Unitree, s'appuient sur des actionneurs électriques pour lesquels les outils de simulation sont matures. GenAN se distingue par sa capacité à généraliser le modèle d'actuation à d'autres robots musculaires, ce qui pourrait intéresser des laboratoires explorant des actionneurs hybrides pour l'humanoïde souple. La prochaine étape logique serait une validation sur des tâches plus complexes et une généralisation à d'autres plateformes PAM.

RecherchePaper
1 source
Vers une navigation aérienne VLA précisément alignée sur l'intention via GRPO guidé par des experts
3036arXiv cs.RO 

Vers une navigation aérienne VLA précisément alignée sur l'intention via GRPO guidé par des experts

Une équipe de chercheurs publie aujourd'hui sur arXiv (réf. 2606.02313) un framework d'apprentissage par renforcement destiné à améliorer la navigation aérienne autonome de drones via des modèles Vision-Language-Action (VLA). Le coeur du dispositif, baptisé EG-GRPO (Expert-Guided Group Relative Policy Optimization), combine un entraînement par renforcement en ligne avec un petit ensemble de trajectoires expertes (few-shot). Résultat annoncé : un taux de succès multiplié par 2,13 par rapport à la baseline en fine-tuning supervisé classique (SFT), et une amélioration de 60,9 % sur l'alignement avec les instructions humaines complexes. Le pipeline hétérogène développé en parallèle simulation/inférence réduit le temps de collecte de rollouts de 43,5 %, point critique quand l'entraînement RL doit couvrir un espace de vol tridimensionnel continu. L'enjeu industriel est réel : les modèles VLA, qui mappent directement des instructions en langage naturel vers des actions motrices, peinent jusqu'ici sur les UAV. Contrairement à la manipulation robotique en espace contraint, la navigation aérienne implique un espace d'exploration quasi-infini où le SFT classique souffre de rareté des données et d'une supervision trop grossière pour des intentions fines ("survole le bâtiment, puis pivote à 90° avant la ligne rouge"). EG-GRPO adresse ce problème en guidant l'exploration par quelques démonstrations expertes plutôt qu'en s'appuyant sur une exploration purement aléatoire. Cela représente une avancée potentielle pour les opérateurs de flottes de drones industriels, les intégrateurs en logistique, inspection d'infrastructures ou intervention en zones difficiles. La note de prudence s'impose cependant : les métriques sont issues de simulations, et le gap sim-to-real sur les UAV reste un problème non résolu dans la littérature. Ce travail s'inscrit dans un mouvement plus large d'application des VLA à la robotique physique. GRPO est la méthode d'optimisation popularisée par DeepSeek-R1 pour les LLM raisonneurs ; son adaptation à l'action physique aérienne suit le chemin tracé par des modèles comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, mais ceux-ci ciblent la manipulation en espace clos. Côté drones, les travaux de navigation autonome par langage naturel restent majoritairement académiques. Ce preprint n'annonce ni déploiement, ni partenaire industriel, ni timeline commerciale : c'est une contribution de recherche fondamentale, dont la valeur dépendra des résultats en conditions réelles.

RechercheOpinion
1 source
CLAW : un cadre vision-langage-action (VLA) pour la préhension robotique adaptée au poids
3037arXiv cs.RO 

CLAW : un cadre vision-langage-action (VLA) pour la préhension robotique adaptée au poids

Des chercheurs ont publié sur arXiv (arXiv:2509.14143) un framework baptisé CLAW (CLIP-Language-Action for Weight), conçu pour permettre à un robot de saisir des objets en respectant des seuils de poids définis en langage naturel. L'architecture repose sur deux composants distincts : un modèle CLIP affiné qui joue le rôle de générateur de directives symboliques en lisant en continu l'affichage numérique d'une balance, et le modèle VLA π₀ (Pi-zéro), une politique à base de flux développée par Physical Intelligence, qui intègre ces directives avec des observations caméras multi-vues pour produire des commandes motrices continues. Le système a été validé sur trois configurations expérimentales couvrant la saisie d'objets uniques et des tâches mixtes nécessitant une manipulation bi-bras. Dans toutes les conditions, CLAW surpasse à la fois π₀ brut et π₀ affiné sans le module de surveillance, sans que les auteurs ne précisent les marges de performance ni les volumes de données d'entraînement utilisés. L'enjeu central que CLAW cherche à résoudre est une limitation structurelle des VLA actuels : entraînés de façon bout-en-bout, ces modèles peinent à respecter des contraintes numériques précises comme "arrête-toi quand le poids dépasse 500 grammes", car leur mapping observation-action est implicitement façonné par les données d'entraînement et ne dispose d'aucun mécanisme explicite de surveillance de conditions. En découplant l'évaluation de condition (symbolique, légère) de la génération d'action (continue, haute fréquence), CLAW ouvre une voie pour intégrer une logique de contrôle de procédé dans des pipelines VLA, ce qui est directement pertinent pour des applications industrielles comme le tri pondéral, le conditionnement, ou l'assemblage qualifié par masse. C'est une réponse concrète au "demo-to-reality gap" : les vidéos de démos de manipulation VLA sont souvent réalisées dans des conditions contrôlées sans contraintes mesurables ; CLAW introduit un critère d'arrêt objectif et vérifiable. π₀ est le modèle phare de Physical Intelligence (Pi), startup fondée en 2023 par Sergey Levine et d'anciens chercheurs de Google Brain et DeepMind, qui a levé 400 millions de dollars en 2024. Le choix de π₀ comme base n'est pas anodin : c'est l'un des rares modèles VLA publiquement documentés capables de manipulation dextre généraliste. CLAW s'inscrit dans une tendance plus large de travaux qui cherchent à hybrider des couches symboliques légères avec des politiques neuronales denses, à l'image des travaux de Physical Intelligence sur le grounding multi-modal ou des approches modulaires comme OpenVLA. Aucun déploiement industriel n'est annoncé ; le travail reste au stade de la preuve de concept académique avec des setups de laboratoire, et une vidéo de démonstration est disponible sur YouTube. Les prochaines étapes naturelles seraient une évaluation sur des capteurs variés (au-delà de la balance numérique) et une généralisation à d'autres contraintes métriques comme la force ou la température.

RechercheOpinion
1 source
NDPP-Grasp : préhension dextérique orientée tâche guidée par contraintes de plausibilité physique non-différentiables
3038arXiv cs.RO 

NDPP-Grasp : préhension dextérique orientée tâche guidée par contraintes de plausibilité physique non-différentiables

Des chercheurs ont publié le 2 juin 2026 sur arXiv un cadre baptisé NDPP-Grasp pour améliorer la génération de préhensions dextres orientées tâche. Le défi est double : une préhension dextre doit être physiquement plausible (pas de collision de doigts, forces équilibrées) et fonctionnellement adaptée à la manipulation spécifiée (saisir un couteau par le manche, pas par la lame). Les méthodes actuelles basées sur la diffusion traitent ces deux exigences de façon séquentielle : un modèle de diffusion est d'abord entraîné pour l'alignement tâche, puis un raffinement post-génération corrige la plausibilité physique. NDPP-Grasp change cette logique en injectant les contraintes de plausibilité physique directement dans le processus de débruitage (denoising), y compris lorsque ces contraintes sont non-différentiables, c'est-à-dire qu'elles ne peuvent pas être intégrées via une simple rétropropagation du gradient. L'impact technique est concret. Appliquer des corrections physiques après génération laisse la trajectoire de débruitage aveugle aux contraintes, produisant des préhensions sous-optimales que le raffinement corrige imparfaitement. En guidant le processus génératif lui-même, NDPP-Grasp améliore la qualité des préhensions sans sacrifier l'alignement tâche. C'est particulièrement pertinent pour les mains robotiques multi-DOF à haute dextérité (Shadow Hand, Allegro Hand notamment), où l'espace des configurations valides est étroit et où une mauvaise initialisation génère directement des échecs de saisie en conditions réelles. La méthode adresse aussi un verrou technique : intégrer dans un pipeline de diffusion des métriques physiques issues de simulateurs ou de vérificateurs de contact qui ne fournissent pas de gradient analytique. La génération de préhensions dextres mobilise la communauté depuis des décennies, mais l'essor des modèles de diffusion depuis 2022-2023 a renouvelé les approches avec des travaux comme UniDexGrasp ou GraspDiffusion. NDPP-Grasp s'inscrit dans ce courant, concurrent aux méthodes de guidance par classificateur (classifier guidance) appliquées à la manipulation. Le résumé arXiv ne précise pas l'affiliation institutionnelle ni les benchmarks utilisés ; les expériences sont décrites comme "extensives" sans détail sur les architectures de mains testées ni les jeux de données d'évaluation. La validation sur hardware réel, et le transfert sim-to-real associé, restera l'épreuve déterminante pour mesurer l'utilité pratique de ce cadre.

RecherchePaper
1 source
Problèmes d'optimisation infaisables et méthode lagrangienne augmentée hiérarchique en apprentissage par imitation
3039arXiv cs.RO 

Problèmes d'optimisation infaisables et méthode lagrangienne augmentée hiérarchique en apprentissage par imitation

Une équipe de chercheurs propose, dans un preprint déposé sur arXiv (arXiv:2506.00730), une méthode pour stabiliser l'entraînement de politiques robotiques par imitation lorsque les contraintes imposées au problème d'optimisation sont infaisables. L'apprentissage par imitation (IL) est une technique répandue pour entraîner des politiques robotiques complexes à partir de démonstrations humaines. Des travaux récents ont introduit des contraintes dures dans ces problèmes d'optimisation pour garantir sécurité, stabilité et robustesse de la politique apprise. Or, les auteurs montrent que ces contraintes peuvent être mutuellement incompatibles dans certaines configurations, ce qui rend le problème d'optimisation infaisable et génère des dynamiques d'entraînement instables ou divergentes. La solution proposée repose sur une adaptation de la méthode du Lagrangien augmenté, récemment théorisée pour des contextes infaisables, organisée de manière hiérarchique. La méthode est illustrée sur un exemple de conduite autonome combinant une contrainte d'accélération totale et des contraintes de sécurité piéton, un scénario où l'infaisabilité peut survenir naturellement même lorsqu'une politique sûre reste atteignable en théorie. L'apport principal pour les praticiens de la robotique est la notion de "closest-feasible problem" : plutôt que d'échouer ou de produire une politique non contrainte quand les contraintes sont contradictoires, la méthode converge vers la solution la plus proche du problème contraint réalisable, avec des garanties théoriques. Pour les équipes qui développent des politiques de manipulation ou de navigation avec des exigences de sécurité formelles, cela offre un mécanisme de repli raisonné en cas de spécification incohérente des contraintes, un cas fréquent en environnement industriel réel. Cela adresse indirectement le problème du sim-to-real gap : les contraintes formulées en simulation peuvent devenir infaisables une fois confrontées aux distributions de données réelles. L'apprentissage par imitation contraint est un domaine actif, notamment porté par des groupes comme DeepMind, Berkeley (avec des approches GAIL, AIRL et leurs variantes contraintes) et des laboratoires travaillant sur les VLA (Vision-Language-Action models). Ce travail s'inscrit dans la continuité des travaux sur le Lagrangien augmenté en optimisation non convexe et complète des approches comme la méthode de pénalité ou les méthodes de points intérieurs. Les auteurs annoncent une validation sur exemple jouet ; des expériences sur des systèmes réels ou des benchmarks robotiques standards (IsaacGym, MuJoCo) constitueraient des étapes naturelles pour en évaluer la portée industrielle.

RecherchePaper
1 source
Modélisation d'actions généralement covariante : construction de variétés généralisées par découplage spatio-temporel
3040arXiv cs.RO 

Modélisation d'actions généralement covariante : construction de variétés généralisées par découplage spatio-temporel

Un préprint soumis sur arXiv le 2 juin 2026 (identifiant 2606.00110) introduit le cadre GAM (Generalized Action Manifold), une approche architecturale pour améliorer la généralisation des politiques robotiques en intelligence incarnée. Le problème ciblé est précis : les méthodes actuelles de Vision-Language-Action (VLA) entraînent les robots à régresser des coordonnées absolues, liant la politique à un style de mouvement et une vitesse d'exécution fixes. GAM résout cela via deux mécanismes orthogonaux. Le premier, l'Arc-Length Parameterizer, sépare la géométrie spatiale d'une trajectoire de sa dynamique temporelle, rendant la politique insensible aux variations de vitesse. Le second, le Schema-Affine-Factorization, projette les trajectoires dans un repère normalisé (pose-normalized coordinate frame), distinguant les schémas géométriques invariants des modulations affines locales. Intégré dans une architecture VLA structurée, GAM permet à un faible nombre de démonstrations de peupler densément un manifold d'actions continu et valide. Les auteurs rapportent des performances supérieures aux baselines geometry-agnostic sur des benchmarks empiriques, sans préciser les robots ou plateformes testés. L'enjeu industriel est direct : la généralisation depuis un nombre limité de démonstrations reste l'un des verrous les plus coûteux du déploiement robotique. Dans les usines où les intégrateurs doivent collecter des milliers de trajectoires par variante de tâche, réduire ce volume a un impact économique concret. Le principe de covariance générale, emprunté à la physique relativiste, stipule qu'une loi ne doit pas dépendre du système de coordonnées choisi. Appliqué à la robotique, cela signifie apprendre la structure géométrique intrinsèque d'une tâche plutôt que les habitudes motrices d'un démonstrateur humain. Si validée à l'échelle, cette approche s'attaquerait directement au demo-to-reality gap et au sim-to-real transfer, deux obstacles persistants pour des systèmes VLA commerciaux comme Pi-0 de Physical Intelligence ou OpenVLA. La recherche VLA s'est accélérée depuis 2024 avec Pi-0, RDT-1B, Octo, et les travaux de NVIDIA sur GR00T N2. GAM se positionne comme une couche d'invariance structurelle compatible avec ces architectures existantes plutôt que comme un modèle concurrent. Ce papier reste à ce stade un preprint non relu par des pairs, sans validation sur des robots physiques identifiés ni données de déploiement réel. Aucun auteur, institution ou partenaire industriel n'est mentionné dans l'abstract disponible, ce qui limite l'évaluation de la crédibilité et de la roadmap concrète. La prochaine étape naturelle serait une soumission à CoRL, ICRA ou RSS avec des expériences sur manipulateurs physiques dans des environnements semi-structurés.

RechercheOpinion
1 source
Validation sim-vers-réel d'une plateforme graphique open source à quatre niveaux de communication pour l'enseignement de la robotique
3041arXiv cs.RO 

Validation sim-vers-réel d'une plateforme graphique open source à quatre niveaux de communication pour l'enseignement de la robotique

Des chercheurs publient sur arXiv (arXiv:2606.00550v1) un article de type Work-in-Progress présentant une architecture de communication à quatre niveaux destinée à l'enseignement de la robotique manipulatrice en laboratoire universitaire. La solution s'appuie sur GOSP (Graphical Open-Source Platform), un environnement graphique open-source, couplé à ROS comme middleware de backend. L'architecture gère la sérialisation, le routage et l'encapsulation des échanges de données entre des environnements visuels conceptuels 3D et des robots physiques réels. Une validation sim-to-real préliminaire, menée sur des trajectoires spatiales multi-axes, conclut que cette encapsulation des pipelines de communication fournit un chemin matériellement agnostique de fidélité jugée suffisante. L'enjeu est structurel : les laboratoires universitaires se heurtent depuis des années à une dichotomie difficile entre twins numériques commerciaux, souvent prohibitifs en coût et rigidement scriptés, et le middleware open-source ROS, dont la courbe d'apprentissage reste abrupte pour les étudiants novices. Cette architecture à quatre niveaux vise à combler ce fossé en découplant l'interface visuelle de la couche de communication bas niveau, ce qui permettrait à des curricula robotiques de monter en échelle sans dépendance à une plateforme matérielle spécifique. Pour les responsables de formations d'ingénieurs, c'est un argument concret : réduire la barrière à l'entrée sans sacrifier la transférabilité vers le hardware réel, à condition que les résultats préliminaires soient confirmés sur un périmètre plus large. Le contexte est celui d'un champ académique en pleine structuration autour de l'accessibilité des environnements de simulation robotique. Des initiatives comme Gazebo, Webots ou MuJoCo ont progressivement amélioré le sim-to-real dans la recherche, mais leur adoption pédagogique reste inégale. GOSP n'est pas encore un produit commercial ni une plateforme déployée à grande échelle : il s'agit d'une preuve de concept académique, et les auteurs signalent eux-mêmes le stade WiP de leurs travaux. Les prochaines étapes logiques impliqueraient une validation sur un spectre plus large de robots et de profils d'étudiants avant toute adoption institutionnelle.

RecherchePaper
1 source
NVIDIA Jetson amène l'IA à base d'agents dans le monde physique
3042NVIDIA Blog Robotics 

NVIDIA Jetson amène l'IA à base d'agents dans le monde physique

Lors du salon COMPUTEX à Taipei le 27 mai 2026, NVIDIA a annoncé JetPack 7.2 et le support de NemoClaw sur la plateforme Jetson, marquant une étape concrète dans le déploiement de l'IA agentique sur des systèmes embarqués physiques. JetPack 7.2 apporte le support du projet Yocto pour une distribution Linux allégée et personnalisable, CUDA 13 sur Jetson Orin, et le support MIG (Multi-Instance GPU) couplé à un noyau temps réel sur Jetson Thor, permettant de réserver des ressources GPU dédiées à des tâches déterministes comme la perception robotique. Le module Jetson AGX Orin 32 Go gagne également 20 % de performances, atteignant 241 TOPS d'inférence IA. NemoClaw, le framework agentique de NVIDIA, se déploie désormais sur Jetson en une seule commande. Deux partenaires sont déjà en production : Solomon, qui utilise NemoClaw pour coordonner raisonnement, perception, fusion de capteurs, locomotion et manipulation sur un robot humanoïde, et Advantech, qui déploie un "cerveau d'usine agentique" dans ses propres lignes de fabrication en combinant NemoClaw, Nemotron 3 et Jetson Thor pour la gestion de flottes robotiques et l'inspection de défauts. L'importance de cette annonce réside dans le passage de l'IA agentique des serveurs vers les systèmes embarqués en production industrielle, un écart que l'industrie peinait à combler. L'architecture en trois couches proposée, OS + compute en base (JetPack), skills d'automatisation développeur au milieu, et NemoClaw en orchestrateur applicatif au sommet, permet aux intégrateurs de construire des workflows agentiques complets sans infrastructure cloud. Pour un COO industriel ou un ingénieur robotique, le gain annoncé est celui du time-to-market : des tâches de déploiement et de configuration qui prenaient plusieurs semaines peuvent désormais être réduites à quelques jours grâce aux agent skills dérivées de la documentation officielle NVIDIA. Le support MIG sur Thor est particulièrement significatif pour les applications robotiques réelles, où l'inférence temps réel ne peut pas être interrompue par des tâches d'IA concurrentes. Il faut toutefois noter que les chiffres de performance et les gains de productivité annoncés proviennent du communiqué de presse NVIDIA lui-même, sans benchmark indépendant disponible à ce stade. La plateforme Jetson est déjà déployée dans des secteurs variés, notamment la robotique industrielle, les drones, les dispositifs médicaux, les machines agricoles et les systèmes humanoïdes, et constitue depuis plusieurs générations, Orin puis Thor, l'un des compute modules embarqués les plus répandus dans l'industrie. NemoClaw s'inscrit dans la stratégie d'NVIDIA de descendre son stack agentique, initialement développé pour les serveurs DGX, vers l'edge et les systèmes physiques autonomes. Sur le plan concurrentiel, cette annonce positionne NVIDIA face à des alternatives edge comme Qualcomm (RB5/RB6 pour la robotique) et Google Coral, mais aussi face aux SOC propriétaires développés par Boston Dynamics, Figure ou 1X pour leurs propres humanoïdes. Les prochaines étapes annoncées incluent l'extension des Metropolis VSS blueprint skills pour l'interprétation visuelle agentique, et la diffusion de l'événement Build-a-Claw à Taiwan, signe que NVIDIA cherche à ancrer son écosystème développeur en Asie du Sud-Est, région clé pour la fabrication électronique et robotique mondiale.

InfrastructureOpinion
1 source
Déployer une IA à base d'agents en périphérie avec efficacité mémoire grâce à NVIDIA JetPack 7.2
3043NVIDIA Developer Blog 

Déployer une IA à base d'agents en périphérie avec efficacité mémoire grâce à NVIDIA JetPack 7.2

NVIDIA a publié JetPack 7.2, une mise à jour de sa suite logicielle pour les modules Jetson, ciblant le déploiement d'agents IA en périphérie (edge computing). La nouveauté centrale est le support natif en une seule commande de NemoClaw, une stack open source qui étend OpenClaw en y ajoutant des couches de contrôle de confidentialité et de sécurité. La version introduit également des "agent skills" pour Jetson, des briques logicielles pré-packagées conçues pour accélérer le développement d'agents autonomes sur matériel embarqué, accompagnées d'optimisations mémoire visant à améliorer les performances dans des configurations à ressources contraintes. Le passage des agents IA vers des environnements physiques impose des contraintes radicalement différentes du cloud : latence faible, connectivité intermittente et enveloppes mémoire restreintes. L'intégration native de NemoClaw dans JetPack 7.2 positionne Jetson comme plateforme de référence pour des agents embarqués avec garanties explicites de sécurité et de confidentialité des données, un argument commercial décisif pour les déploiements industriels, médicaux ou logistiques où les données sensibles ne peuvent quitter le site. Pour les intégrateurs, la simplification à une seule commande réduit significativement la friction d'adoption. NVIDIA commercialise les modules Jetson depuis 2014 et JetPack 7.2 s'inscrit dans sa stratégie de déport progressif de l'inférence IA hors du datacenter. OpenClaw, sur lequel NemoClaw s'appuie, est l'environnement d'exécution agent de NVIDIA pour l'edge. Les concurrents directs sur ce segment incluent Qualcomm avec son AI Hub et son Robotics SDK, ainsi que Hailo, Google Coral et Kneron. L'annonce reste au stade de disponibilité logicielle : aucun chiffre de volume de déploiement ni timeline client n'a été communiqué.

InfrastructureOpinion
1 source
L'ex-directeur tech de Meituan crée un modèle du monde pour la restauration à l'ère de l'IA incarnée
304436Kr 

L'ex-directeur tech de Meituan crée un modèle du monde pour la restauration à l'ère de l'IA incarnée

AtomBite.AI (元节智能), startup chinoise d'intelligence incarnée, vient de boucler un tour d'amorçage de plusieurs dizaines de millions de yuans mené par le fonds Yinno Innovation, avec la participation du Shuimu Tsinghua Alumni Seed Fund. La société cible un terrain peu médiatisé mais à forte récurrence : la cuisine professionnelle de restauration et la chaîne d'exécution des commandes de livraison de repas. Son équipe fondatrice porte l'ADN de Meituan : Wang Dong (CEO, docteur en informatique) y dirigeait l'ingénierie de Meituan Waimai, supervisant mille ingénieurs et des algorithmes traitant des dizaines de millions de commandes quotidiennes ; Li Tao pilotait les systèmes algorithmiques et data de la même division ; Li Haozhe, troisième co-fondateur, est un entrepreneur en série à dimension internationale. La technologie centrale est un "World Action Model" (WAM) dédié à la restauration, décliné en architecture VT-WAM combinant vision et retour tactile, en rupture explicite avec l'approche VLA (Vision-Language-Action) dominante dans le secteur. Un premier déploiement pilote en cuisine professionnelle est attendu d'ici fin 2026, avec plusieurs lettres d'intention déjà signées avec des opérateurs nationaux et internationaux. Le choix de la restauration résulte d'un audit de plusieurs mois conduit en Amérique du Nord et à Singapour. Wang Dong y a identifié un triptyque rare : besoin universel (même problématique en Chine, aux États-Unis et en Asie du Sud-Est), ROI mesurable pour le restaurateur (réduction des erreurs de commande, gains à l'emballage, allègement de la masse salariale) et cycle de décision court chez les PME, contrairement aux scénarios domestiques ou médico-sociaux. L'industrie est structurellement sous pression : hausse soutenue des salaires horaires en Amérique du Nord, turnover chronique et difficultés de recrutement persistantes en Chine. Sur le plan technique, AtomBite.AI conteste le paradigme VLA en affirmant que le contrôle moteur réel ne passe pas par le langage mais par la compréhension visuelle et physique. L'approche VT-WAM fusionne ces deux modalités dans un espace latent pour prédire les conséquences de contact avant exécution : inférer si un gobelet est plein ou chaud modifie les forces de friction et le centre de gravité lors de la saisie, ce que la vision seule ne permet pas de capturer. AtomBite.AI prend le contre-pied de la stratégie "modèle universel d'abord" adoptée par la plupart de ses concurrents. Les opérations répétitives de la cuisine, emballage, tri et transfert de commandes, génèrent un flux naturel de données d'interaction physique difficile à reproduire en simulation, alimentant un cycle d'amélioration continue du modèle depuis le terrain réel. L'architecture se décompose en trois couches : modèle monde incarné pour la perception et la planification d'actions, moteur d'orchestration des tâches, et couche matérielle combinant composants propriétaires et hardware standard. Les gestes récurrents s'exécutent en local sur des modèles légers pour limiter la latence ; le cloud gère les exceptions comme un ingrédient manquant ou un objet détecté hors place. Sur ce segment, Miso Robotics aux États-Unis et Keenon Robotics en Chine sont déjà présents, sur des périmètres différents (friture automatisée, service en salle). La feuille de route prévoit une extension progressive vers le tri, la logistique interne de restaurant, et à terme la cuisine domestique.

Chine/AsieActu
1 source
L'équipe Qwen d'Alibaba entre dans l'IA incarnée avec son modèle VLA
3045Pandaily 

L'équipe Qwen d'Alibaba entre dans l'IA incarnée avec son modèle VLA

L'équipe Tongyi Qianwen d'Alibaba a annoncé en 2026 son entrée dans le domaine de l'IA embodiée avec Qwen-VLA, un modèle vision-langue-action (VLA) destiné à doter robots et appareils intelligents d'une capacité de perception, de compréhension et d'action dans le monde physique. L'architecture unifiée du modèle intègre trois composantes : la perception visuelle, la compréhension du langage naturel, et la planification d'actions physiques. Concrètement, un système embarquant Qwen-VLA serait en mesure d'analyser son environnement via des caméras, d'interpréter des instructions vocales ou textuelles, et de générer les commandes motrices correspondantes. Les applications visées couvrent un spectre large : robots industriels, robots de service, et équipements domestiques connectés. Le modèle s'appuie sur l'expertise accumulée par la série Qwen en LLM et IA multimodale, en étendant ces capacités vers la prédiction d'actions robotiques. Aucune métrique de performance (charge utile, degrés de liberté, temps de cycle) n'a été communiquée à ce stade, ce qui situe clairement cette publication comme une annonce de cap stratégique plutôt que le lancement d'un produit finalisé. L'entrée d'Alibaba reconfigure l'équilibre de la course à l'IA embodiée en Chine, non pas par une approche hardware-first, mais par la couche modèle. Qwen-VLA est positionné comme une plateforme ouverte : Alibaba ne construit pas ses propres robots, mais fournit le "cerveau" que des partenaires matériels peuvent embarquer dans leurs systèmes, quel que soit le facteur de forme. Cette stratégie rappelle davantage celle d'un fournisseur de fondations que celle d'un constructeur robotique intégré. L'atout différenciant réside dans les ressources mobilisables : la puissance de calcul d'Alibaba Cloud, les données réelles issues des opérations logistiques de Cainiao et des flux e-commerce de Taobao, et un écosystème dense de partenaires industriels. Si ces données propriétaires représentent un avantage réel pour l'entraînement et le fine-tuning de VLA, leur exploitation sans friction juridique ou de gouvernance reste à démontrer en pratique. La publication de Qwen-VLA s'inscrit dans une accélération marquée du marché chinois de l'IA embodiée en 2026, portée par la convergence des modèles de fondation, des capteurs et des capacités manufacturières. Alibaba rejoint un champ concurrentiel déjà dense : Unitree Robotics et Deep Robotics sur le hardware, Zhiyuan et AgiBot sur l'intégration système, et des géants tech comme Xiaomi et ByteDance qui investissent de plus en plus dans la robotique généraliste. La stratégie d'Alibaba, modèle ouvert sans robot propriétaire, la distingue de Figure AI ou 1X Technologies aux États-Unis, qui misent sur une intégration verticale complète. Elle se rapproche davantage de l'approche de NVIDIA avec GR00T N2, ou de Physical Intelligence avec Pi-0 côté américain. Les prochaines étapes à surveiller : des partenariats hardware concrets, des benchmarks comparables aux standards du secteur, et d'éventuels pilotes industriels chez des opérateurs logistiques comme Cainiao, qui constitueraient le premier vrai test de passage à l'échelle.

Chine/AsieOpinion
1 source
Doubao payant fin juin, incendie chez SK Hynix, Unitree obtient son IPO : Wang Xingxing vaudrait plus de 14 milliards de yuans
304636Kr 

Doubao payant fin juin, incendie chez SK Hynix, Unitree obtient son IPO : Wang Xingxing vaudrait plus de 14 milliards de yuans

Le 1er juin 2026, la commission d'examen des introductions en bourse de la Bourse de Shanghai a approuvé le dossier d'IPO de Unitree Robotics sur le marché STAR, le segment technologique de la place boursière chinoise. Le fabricant de robots prévoit de lever 4,202 milliards de yuans (environ 575 millions d'euros) répartis sur quatre axes : recherche sur les modèles d'IA embarquée, développement du corps robotique, nouveaux produits humanoïdes et construction d'une usine de fabrication dédiée. Le même jour, lors du GTC Taipei, Jensen Huang, PDG de NVIDIA, a annoncé le H2+, un robot humanoïde présenté comme architecture de référence développée conjointement avec Unitree et désigné sous l'appellation Isaac GR00T System. La plateforme mesure 1,8 mètre pour 68 kilogrammes, embarque 31 degrés de liberté (DOF) sur le corps principal et 25 DOF par main. Huang a déclaré l'intégration système finalisée. Sur le front financier, Alphabet a confirmé une levée de 80 milliards de dollars incluant un placement privé de 10 milliards de dollars souscrit par Berkshire Hathaway à 351,81 dollars l'action de classe A, explicitement destinés à étendre les capacités d'infrastructure IA face à une demande jugée supérieure à l'offre existante. OpenAI a par ailleurs officialisé le même jour son entrée dans la robotique, en se concentrant à court terme sur les robots d'assistance. Pour les intégrateurs et décideurs industriels, la conjonction de l'IPO de Unitree et du partenariat NVIDIA marque un passage vers une commercialisation plus structurée des humanoïdes. Les 575 millions d'euros levés dépassent la quasi-totalité des tours de table récents des fabricants occidentaux hors Tesla, offrant à Unitree un capital de montée en cadence inédit dans le secteur. Le H2+ positionné comme architecture de référence ouverte change la logique d'intégration : NVIDIA apporte la stack logicielle Isaac GR00T et le simulateur Omniverse pour le sim-to-real, Unitree fournit le corps mécanique validé, réduisant le coût d'entrée pour tout OEM souhaitant déployer des humanoïdes sans construire l'ensemble de la chaîne. Les 25 DOF par main ciblent la manipulation fine en assemblage et en logistique pick-and-place, non la manutention de charges lourdes. Ces métriques restent celles d'une annonce de conférence : l'écart entre démonstration et déploiement productif sur des cycles de travail réels demeure à quantifier indépendamment. Unitree s'est imposé sur le marché des quadrupèdes avec les séries Go1, Go2 et B2 avant de lancer les humanoïdes H1 puis G1, construisant une réputation de rapport performance-prix difficile à ignorer. Son fondateur Wang Xingxing voit sa fortune estimée à plus de 14 milliards de yuans après la validation du dossier. NVIDIA avait posé les bases de sa stratégie robotique avec Isaac GR00T, présenté au GTC 2024 comme modèle de fondation pour humanoïdes, et Omniverse pour la simulation; le H2+ est le premier résultat hardware public de cette architecture. Les concurrents directs en Occident incluent Figure AI, Tesla avec Optimus, Boston Dynamics avec Atlas et Physical Intelligence avec son modèle Pi-0; en Chine, Fourier Intelligence et UBTECH couvrent des segments comparables. L'entrée simultanée d'OpenAI dans la robotique pourrait redistribuer les équilibres dans la couche logicielle, chaque acteur hardware cherchant à s'associer au modèle fondation le plus performant. Zhipu AI, spécialiste chinois des grands modèles de langage, a également annoncé le 1er juin son intention de s'introduire sur le marché STAR, signal supplémentaire d'un afflux de capitaux publics vers l'ensemble de la chaîne IA-robotique en Chine.

HumanoïdesActu
1 source
NVIDIA publie de nouveaux outils et des mises à jour pour les développeurs d'IA physique
3047The Robot Report 

NVIDIA publie de nouveaux outils et des mises à jour pour les développeurs d'IA physique

Lors du GTC Taipei et du Computex, NVIDIA a dévoilé un ensemble de nouveaux outils open-source rassemblés sous le nom NVIDIA Agent Toolkit, destinés aux développeurs de systèmes d'IA physique : robotique, véhicules autonomes, vision industrielle et jumeaux numériques. L'objectif affiché est de réduire le coût et la complexité des pipelines de développement en rendant l'ensemble de la pile logicielle de NVIDIA directement orchestrable par des agents IA. Les outils concernés incluent Cosmos 3, le modèle de fondation pour la compréhension du monde physique (vidéo, texte, prédiction d'états futurs), les bibliothèques Omniverse pour la simulation et les jumeaux numériques, Isaac pour la robotique, Metropolis pour la vision IA, Alpamayo pour la conduite autonome, et la plateforme Jetson pour le déploiement embarqué. Le déploiement sécurisé de ces agents est encadré par le blueprint NemoClaw et le runtime OpenShell, qui appliquent des politiques de sécurité et de confidentialité en local comme dans le cloud. L'approche "agent-ready" de NVIDIA marque un changement de paradigme dans le développement de l'IA physique : plutôt que des bibliothèques que les ingénieurs assemblent manuellement, les outils deviennent des briques directement appelables par des agents de codage, capables d'enchaîner automatiquement génération de données, simulation, entraînement et évaluation. Pour les développeurs de véhicules autonomes, cela signifie qu'un agent peut reconstruire des scènes à partir de données de flotte, générer des scénarios de conduite photoréalistes et lancer des boucles de renforcement sans intervention manuelle à chaque étape. Pour les intégrateurs robotiques, des tâches comme l'automatisation de l'entraînement à la navigation ou le tuning de systèmes Jetson deviennent théoriquement scriptables. Rev Lebaredian, vice-président pour la simulation d'IA physique chez NVIDIA, a qualifié Cosmos 3 de "modèle de fondation frontier pour l'IA physique", capable de comprendre vidéo et texte, de prédire les états futurs et de générer des actions, positionnant ce world model comme un candidat généraliste opérationnel, même si aucune métrique de benchmark indépendante n'a été communiquée à ce stade. NVIDIA consolide avec cette annonce sa position d'infrastructure de référence pour l'IA physique, un rôle qu'elle occupe via ses GPU d'entraînement et ses plateformes Isaac Sim et Jetson. La compétition dans ce segment s'intensifie : Google DeepMind pousse MuJoCo et ses dérivés, Boston Dynamics, Figure, Agility Robotics et Physical Intelligence développent leurs propres stacks de simulation et d'apprentissage, tandis que des acteurs industriels comme Siemens ou ANSYS occupent le terrain des jumeaux numériques. En Europe, des entreprises comme Wandercraft ou Enchanted Tools pourraient bénéficier de ces outils si la promesse de réduction de complexité se confirme en pratique. NVIDIA joue ici la carte de la plateforme unifiée plutôt que du modèle de fondation isolé, un positionnement cohérent avec son modèle d'affaires mais qui reste à valider au-delà des démonstrations internes. Les suites annoncées incluent des applications en santé, dont le détail n'a pas été entièrement communiqué lors de l'événement.

InfrastructureOpinion
1 source
ANSCER Robotics boucle un tour de table de série A pour la manutention industrielle
3048Robotics Business Review 

ANSCER Robotics boucle un tour de table de série A pour la manutention industrielle

ANSCER Robotics, startup deeptech fondée à Bengaluru (Inde), vient de boucler un tour de série A de 5,4 millions de dollars (45 crores de roupies), mené par IAN Group avec la participation d'Info Edge Ventures et d'investisseurs angels. Ces fonds sont destinés à accélérer le déploiement mondial de sa flotte de robots mobiles autonomes (AMR) hybrides, ainsi que le développement de son logiciel de gestion de flotte. La société est déjà en déploiement actif en Inde, Thaïlande, Malaisie, Singapour et Indonésie, et vient d'annoncer plusieurs contrats en Amérique du Nord, dont des entreprises de livraison de colis de premier plan. ANSCER sera présente au salon Automate 2026. Ce qui distingue le positionnement d'ANSCER, c'est sa cible explicite : la fabrication industrielle, et non l'entrepôt logistique classique. L'entreprise qualifie ses systèmes d'"hybrides" parce qu'ils combinent la capacité de charge d'un AGV ou d'un chariot élévateur avec la navigation intelligente d'un AMR, conçus pour des environnements complexes, sols d'usine irréguliers, zones de quais de chargement. Le focus affiché sur le "machine tending" (alimentation et déchargement de machines-outils) et le mouvement de matériaux en milieu manufacturier est un pari différenciateur dans un marché dominé par les solutions d'entrepôt. Ce positionnement répond à une demande croissante des intégrateurs industriels qui cherchent des robots capables de naviguer dans des environnements moins structurés que les allées d'un centre de distribution standard. Les affirmations sur la qualité du "navigation stack" et du hardware restent pour l'instant non détaillées publiquement, à vérifier sur les démos terrain à Automate 2026. ANSCER s'inscrit dans une vague de startups AMR issues d'Asie du Sud qui cherchent à s'imposer sur le marché nord-américain, face à des acteurs établis comme MiR (acquis par Teradyne), Locus Robotics ou Seegrid. La levée de 5,4 M$ reste modeste comparée aux rounds récents du secteur (Locus a levé plus de 150 M$ avant ses difficultés), ce qui situe ANSCER dans une phase d'expansion commerciale ciblée plutôt que de croissance agressive. L'entrée sur le marché américain via des contrats avec des opérateurs de livraison de colis est stratégique : ce segment, sous pression sur les coûts de main-d'œuvre, constitue un canal d'acquisition client rapide. Les prochaines étapes à surveiller sont la présence à Automate 2026, les détails sur les contrats nord-américains, et une éventuelle série B pour financer l'industrialisation à plus grande échelle.

IndustrielOpinion
1 source
NVIDIA dévoile une plateforme complète pour robots humanoïdes, robotaxis et usines intelligentes
3049Interesting Engineering 

NVIDIA dévoile une plateforme complète pour robots humanoïdes, robotaxis et usines intelligentes

Lors du GTC Taipei, NVIDIA a dévoilé une plateforme full-stack destinée aux robots humanoïdes, aux véhicules autonomes et à l'automatisation industrielle. Le cœur de l'annonce est Cosmos 3, un omnimodèle fondational open-source construit sur une architecture mixture-of-transformers, capable de traiter simultanément texte, images, vidéo, son et commandes d'action dans un seul système. Il se décline en Cosmos 3 Super, orienté haute précision pour la robotique et les véhicules autonomes, et Cosmos 3 Nano, optimisé pour l'inférence rapide. NVIDIA lance également l'Isaac GR00T Reference Humanoid Robot, un design de référence intégrant le robot Unitree H2 Plus, les mains articulées Sharpa, le calculateur embarqué Jetson Thor et la pile logicielle GR00T, adopté par Ai2, ETH Zurich, Stanford Robotics Center et UC San Diego. La collaboration avec TSMC porte les bibliothèques CUDA-X dans la fab pour la lithographie computationnelle, la simulation de transistors et l'inspection de plaquettes à l'échelle nanométrique. Alpamayo 2 Super, un modèle de raisonnement à 32 milliards de paramètres, cible quant à lui les applications robotaxi. La cohérence verticale de la plateforme est sa principale valeur ajoutée : NVIDIA prétend désormais couvrir l'intégralité de la chaîne de valeur de l'IA physique, de la génération de données synthétiques à la simulation, jusqu'au déploiement en production. Pour les équipes R&D en robotique humanoïde, GR00T Reference Robot réduit potentiellement plusieurs mois d'intégration hardware/software. Cosmos 3 s'attaque par ailleurs au sim-to-real gap en proposant un world model capable de générer des environnements d'entraînement réalistes, l'un des verrous structurels du secteur. Cela dit, les benchmarks avancés ("meilleur modèle ouvert" sur plusieurs évaluations) émanent de NVIDIA lui-même sans validation tierce, ce qui invite à une lecture prudente. L'intégration dans la fab TSMC est plus tangible : des gains d'efficacité mesurables dans la détection de défauts nanométriques signalent une adoption industrielle réelle, pas seulement un proof-of-concept. NVIDIA construit ce positionnement depuis plusieurs années via Isaac Sim, Omniverse et la famille GR00T N2 présentée en 2025. Sur le marché des humanoïdes, les concurrents directs incluent Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), Boston Dynamics (Atlas) et Agility Robotics (Digit). Le choix du robot Unitree H2 Plus, acteur chinois concurrent sur le segment humanoïde, comme base matérielle du design de référence NVIDIA est notable. En Europe, Enchanted Tools (Miroki, France) et Wandercraft pourraient tirer parti de Cosmos 3 pour la génération de données d'entraînement, même si aucun partenariat public n'a été annoncé. Les prochaines étapes incluent l'accès des institutions de recherche à GR00T Reference Robot et la disponibilité de Cosmos 3 via NVIDIA NGC ; aucune tarification ni date de commercialisation n'a été communiquée pour l'ensemble de la plateforme.

IA physiqueOpinion
1 source
Les 10 actualités robotique incontournables de mai 2026
3050Robotics Business Review 

Les 10 actualités robotique incontournables de mai 2026

Mai 2026 a concentré plusieurs avancées concrètes dans la robotique, mises en lumière lors du Robotics Summit & Expo de Boston qui a réuni des milliers de professionnels du secteur. Genesis AI a dévoilé GENE-26.5, un modèle d'IA qu'elle présente comme atteignant des "capacités de manipulation physique au niveau humain", une affirmation à relativiser en l'absence de benchmarks indépendants publiés. Dans le domaine des humanoïdes, 1X Technologies a lancé la production en série de son robot NEO dans une nouvelle usine à Hayward, en Californie, conçu pour fonctionner en dessous du niveau sonore d'un réfrigérateur moderne dans des espaces domestiques. La startup londonienne Humanoid a formalisé un partenariat avec Bosch et Schaeffler pour industrialiser sa production, après un proof of concept conjoint validé en mars 2026. Du côté des capteurs, Ouster a annoncé la famille REV8, basée sur sa puce L4 Ouster Silicon, avec une portée et une résolution doublées par rapport à la génération précédente, et un lidar couleur natif breveté. Automated Tire est sortie de la discrétion avec SmartBay, une plateforme robotique autonome pour le changement de pneus et l'inspection de véhicules, promettant de réduire le temps de service de moitié, soit environ 30 minutes par intervention. Ces actualités illustrent une bifurcation nette dans le secteur: d'un côté, des acteurs humanoïdes comme 1X passent de la démonstration à la production réelle, signal que le "reality gap" se réduit pour certains challengers; de l'autre, des verticaux industriels précis comme la maintenance automobile ou la manipulation dextère cherchent à démontrer un ROI mesurable à court terme. Le partenariat Humanoid-Bosch-Schaeffler est particulièrement notable car il intègre deux équipementiers automobiles de premier plan dans la chaîne d'approvisionnement des humanoïdes, anticipant un marché commercial proche. Hugging Face a également lancé une boîte à outils agentique pour son robot desktop open-source Reachy Mini, permettant de créer des applications fonctionnelles en moins d'une heure sans écrire de code, ce qui signale une démocratisation de la programmation robotique au-delà des équipes d'ingénieurs spécialisés. Le contexte est celui d'une course à la commercialisation qui s'accélère, avec Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), Boston Dynamics et NVIDIA (GR00T N2) en embuscade sur le même marché des humanoïdes polyvalents. Pour structurer les comparaisons, le Fraunhofer IPA a publié un benchmark standardisé pour évaluer objectivement ces plateformes, une initiative qui faisait défaut jusqu'ici. Les RBR50 Innovation Awards 2026, qui fêtent leur 15e édition, ont dressé un panorama des leaders actuels, reflétant la diversité des approches: AMR, cobots, architectures VLA (Vision-Language-Action). Les prochains trimestres seront déterminants: les premiers bilans chiffrés des déploiements chez 1X et Humanoid constitueront des tests de réalité cruciaux avant d'éventuels nouveaux tours de financement.

FR/EU ecosystemeActu
1 source