Aller au contenu principal

Actualités robotique — page 103

5 889 articles au fil, du plus récent au plus ancien.

Guide, Pense, Agit : le raisonnement incarné interactif dans les modèles vision-langage-action (VLA)
5101arXiv cs.RO 

Guide, Pense, Agit : le raisonnement incarné interactif dans les modèles vision-langage-action (VLA)

Des chercheurs ont déposé sur arXiv (arXiv:2605.13632, mai 2026) GTA-VLA (Guide, Think, Act), un framework Vision-Language-Action interactif qui permet d'injecter des indices visuels explicites dans le raisonnement d'un robot avant l'exécution. Contrairement aux VLA classiques qui appliquent un mapping direct perception-action appris sur données d'entraînement, GTA-VLA introduit une étape de raisonnement spatial conditionné : l'opérateur peut fournir des points d'affordance, des boîtes englobantes ou des trajectoires dessinées sur l'image, que le modèle intègre dans une chaîne de pensée (Chain-of-Thought, CoT) avant de générer les commandes motrices. Une tête d'action légère ("reactive action head") assure ensuite l'exécution. Sur le benchmark SimplerEnv WidowX en conditions in-domain, le système atteint un taux de succès de 81,2 %, présenté comme état de l'art sur cette tâche. Les auteurs rapportent qu'une seule interaction visuelle suffit à améliorer substantiellement les performances sous perturbations visuelles ou ambiguïtés spatiales hors distribution (OOD). Ce résultat pointe une limite structurelle des VLA actuels : leur fragilité face aux shifts de distribution, c'est-à-dire dès que l'environnement de déploiement diffère des données d'entraînement. Les approches CoT existantes exposent le raisonnement intermédiaire mais restent aveugles à la guidance humaine, rendant la reprise sur erreur difficile sans réentraînement. GTA-VLA propose une troisième voie : maintenir l'autonomie du modèle tout en ouvrant un canal de correction humain minimal, ciblé sur l'espace visuel. Pour un intégrateur industriel, c'est un argument concret contre le demo-to-reality gap : si le robot échoue, l'opérateur désigne visuellement l'objet cible plutôt que de réécrire une instruction texte. La métrique de 81,2 % sur SimplerEnv mérite toutefois d'être contextualisée : ce benchmark reste un environnement simulé contrôlé, et aucun résultat sur hardware réel n'est communiqué dans le papier. GTA-VLA s'inscrit dans l'effervescence des architectures VLA depuis Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui ont tous cherché à coupler raisonnement de haut niveau et exécution robotique fluide. L'apport spécifique est de rendre ce raisonnement "steerable" via des priors spatiaux explicites, là où Pi-0 ou GR00T N2 restent essentiellement autonomes une fois déployés. Publié en preprint non encore évalué par des pairs, le papier ne mentionne ni déploiement sur plateforme physique ni partenariats industriels annoncés. Les prochaines étapes naturelles seraient une validation sur manipulateurs réels (WidowX physique, Franka) et une évaluation de la robustesse de l'interface de guidance en conditions industrielles réelles.

IA physiqueOpinion
1 source
SECOND-Grasp : préhension dextérique guidée par le contact sémantique
5102arXiv cs.RO 

SECOND-Grasp : préhension dextérique guidée par le contact sémantique

Des chercheurs ont publié en mai 2025 sur arXiv (2605.13117) SECOND-Grasp (SEmantic CONtact-guided Dexterous Grasping), un cadre unifié permettant à des mains robotiques multi-doigts d'adapter leurs stratégies de préhension à des consignes en langage naturel tout en garantissant la stabilité physique du contact. Le pipeline enchaîne un raisonnement vision-langage pour identifier les zones de contact probables, une segmentation multi-vues, puis un module baptisé SGCR (Semantic-Geometric Consistency Refinement) qui raffine ces prédictions par cohérence inter-vues et suppression des régions géométriquement invalides, produisant des cartes de contact 3D exploitables. Ces cartes alimentent un apprentissage de politique via cinématique inverse, entraîné sur le dataset DexGraspNet. Sur des catégories d'objets vus en entraînement, le système atteint 98,2 % de taux de succès au levage ; sur des catégories non vues, 97,7 % ; la préhension guidée par l'intention progresse de 12,8 % et 26,2 % respectivement face aux baselines, validé sur Shadow Hand et Allegro Hand. Le résultat le plus significatif est précisément cette quasi-absence de dégradation entre catégories vues et non vues : cela suggère que le couplage sémantique-géométrique produit des représentations suffisamment abstraites pour généraliser hors distribution, un verrou classique du dexterous grasping. L'intégration native du langage dans la planification de contact, plutôt qu'en couche de sélection aval, place SECOND-Grasp dans la lignée des architectures VLA appliquées à la manipulation fine, comme Pi-0 (Physical Intelligence) ou les travaux récents de DeepMind. Pour un décideur industriel, la promesse est lisible : un système capable de comprendre où et comment saisir selon une tâche verbalisée, sans ré-entraînement par catégorie d'objet. Les métriques restent toutefois issues de benchmarks contrôlés ; le transfert sim-to-real en environnement industriel non structuré n'est pas encore démontré. Le dexterous grasping est un chantier ouvert depuis les années 1990, longtemps fragmenté entre approches analytiques (calcul de wrench space) et méthodes data-driven. L'essor des modèles vision-langage a rouvert la question en conditionnant la préhension par le langage naturel. Les concurrents directs dans cet espace incluent GraspGPT, FoundationGrasp et les travaux de Stanford sur DexArt. En Europe, Enchanted Tools (robot Miroki) explore la manipulation expressive mais n'a pas publié de résultats comparables sur le grasping structuré. La prochaine étape naturelle pour SECOND-Grasp serait une validation sur plateforme physique en scène non contrôlée, potentiellement intégrée dans un pipeline humanoïde ou sur bras industriel polyvalent.

IA physiqueOpinion
1 source
RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
5103arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
ViTacFormer : apprentissage de représentations cross-modales pour la manipulation dextérique vision-tactile
5104arXiv cs.RO 

ViTacFormer : apprentissage de représentations cross-modales pour la manipulation dextérique vision-tactile

Une équipe de chercheurs a publié en juin 2025 ViTacFormer, une architecture d'apprentissage de représentations multi-modales pour la manipulation dextre robotique. Le système couple un encodeur cross-attention fusionnant vision haute résolution et données tactiles avec une tête de prédiction autoregressive des signaux de contact futurs, entraîné selon un curriculum progressif allant des tâches simples aux plus complexes. La représentation apprise pilote un module d'imitation learning pour des mains anthropomorphes multi-doigts. Sur des benchmarks réels en laboratoire, ViTacFormer dépasse les systèmes état de l'art précédents d'environ 50 %, enchaîne jusqu'à 11 étapes séquentielles sans intervention humaine et maintient une opération continue de 2,5 minutes sur des tâches de manipulation de précision. L'architecture répond à un verrou concret de la manipulation fine : les occlusions visuelles rendent la vision seule insuffisante lorsque la main cache l'objet, un problème que les capteurs tactiles résolvent mais que peu de systèmes intègrent de façon apprenante. La prédiction anticipée des contacts plutôt que leur simple détection réactive réduit la latence de contrôle, décisive pour les gestes de précision. La capacité à enchaîner 11 sous-tâches ouvre une voie pour l'assemblage multi-étapes industriel, où les robots classiques nécessitent actuellement une programmation explicite à chaque étape. Ces résultats restent cependant des benchmarks de laboratoire contrôlés ; la distance avec un déploiement en ligne de production réelle, où la variabilité des pièces et la robustesse du capteur tactile dans le temps sont critiques, demeure entière. ViTacFormer s'inscrit dans une vague de travaux combinant modèles VLA (Vision-Language-Action) et retour haptique, explorée également par Google DeepMind (Robotic Transformer), Physical Intelligence (Pi-0) et des startups comme Dexterous AI. Côté matériel, la dépendance aux mains anthropomorphes multi-doigts reste un frein à la commercialisation : Shadow Robot (UK) et Inspire-Robots (CN) dominent ce segment, mais à des coûts et avec une fiabilité mécanique qui limitent encore les déploiements industriels à grande échelle. Le travail est publié sous forme de preprint arXiv (arXiv:2506.15953), sans code ni dataset public annoncé à ce stade ; la transition vers des résultats reproductibles et des pilotes hors laboratoire constitue l'étape critique à surveiller.

RechercheOpinion
1 source
BlockVLA : accélérer les modèles VLA autorégressifs par affinage avec diffusion par blocs
5105arXiv cs.RO 

BlockVLA : accélérer les modèles VLA autorégressifs par affinage avec diffusion par blocs

Une équipe de recherche propose BlockVLA, un framework publié en preprint sur arXiv (identifiant 2605.13382, mai 2026) qui adapte des modèles Vision-Language-Action (VLA) autorégressifs préentraînés en politiques de diffusion discrète efficaces via un paradigme de "diffusion par blocs". Plutôt que de décoder les tokens d'action séquentiellement, BlockVLA maintient les dépendances autorégressives au niveau des blocs tout en activant un débruitage parallèle au sein de chaque bloc. Ce mécanisme permet la réutilisation du cache KV (key-value) sur les blocs complétés, réduisant le coût des itérations de débruitage (NFE, number of function evaluations) sans sacrifier la cohérence causale globale. Évalué sur les benchmarks LIBERO et SimplerEnv, le modèle atteint une accélération d'inférence de 3,3x par rapport aux baselines de diffusion discrète standards, et converge significativement plus vite à l'entraînement, avantage particulièrement marqué sur les tâches longues et complexes. Ce résultat touche directement l'un des verrous opérationnels du déploiement industriel des VLA : la latence d'inférence. Un modèle autorégressif classique décode les tokens d'action un à un, imposant des délais incompatibles avec un contrôle robotique haute fréquence. La réduction du budget de calcul à l'entraînement est également notable d'un point de vue pratique : elle compresse les cycles d'adaptation d'un modèle à une nouvelle tâche, ce qui peut peser dans les décisions d'intégration. Cela dit, les évaluations restent cantonnées à des environnements simulés standard, sans validation en boucle fermée sur robot physique, ce qui laisse ouverte la question du sim-to-real gap. BlockVLA s'inscrit dans un mouvement plus large visant à rendre les grands VLA exploitables en conditions réelles. Des modèles comme OpenVLA, Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA ont démontré des capacités généralisées impressionnantes, mais restent freinés par leur vitesse d'inférence. De l'autre côté, les politiques de diffusion continues, popularisées par Diffusion Policy (Chi et al., 2023), offrent une génération parallèle mais peinent à capitaliser sur les poids de backbone de langage préentraînés à grande échelle. BlockVLA tente de combler ce fossé via un fine-tuning ciblé sur un backbone AR existant, sans nécessiter un réentraînement complet. Il s'agit à ce stade d'un preprint académique sans déploiement annoncé sur hardware réel, mais les gains mesurés sur benchmarks de référence en font une contribution à suivre pour les équipes travaillant sur le déploiement haute cadence de politiques visuomotrices.

RechercheOpinion
1 source
D-VLA : un cadre d'apprentissage par renforcement distribué et asynchrone à haute concurrence pour les modèles vision-langage-action
5106arXiv cs.RO 

D-VLA : un cadre d'apprentissage par renforcement distribué et asynchrone à haute concurrence pour les modèles vision-langage-action

Des chercheurs ont publié sur arXiv (référence 2605.13276) un framework distribué baptisé D-VLA, conçu pour entraîner par renforcement les modèles Vision-Language-Action (VLA) à très grande échelle. Le problème central qu'ils adressent est un goulot d'étranglement systémique : lorsqu'on applique du reinforcement learning (RL) à des VLA de plusieurs milliards de paramètres dans un environnement distribué, la simulation physique haute-fidélité et les calculs d'inférence se disputent les mêmes ressources GPU (VRAM, bande passante), ce qui dégrade le débit global. D-VLA répond par trois mécanismes : un "Plane Decoupling" qui isole physiquement les données d'entraînement haute fréquence du contrôle des poids basse fréquence, un pipeline asynchrone à quatre fils d'exécution ("Swimlane") permettant le chevauchement complet des phases de sampling, d'inférence, de calcul de gradient et de distribution des paramètres, et un système dual-pool de gestion VRAM couplé à une réplication "topology-aware". Sur le benchmark LIBERO, le framework surpasse significativement les solutions RL dominantes en débit et en efficacité d'échantillonnage pour des modèles à l'échelle du milliard de paramètres. Des tests de passage à l'échelle trillion de paramètres indiquent une stabilité maintenue et un speedup linéaire. L'enjeu industriel est concret : les modèles VLA sont désormais au coeur des architectures robotiques génériques (manipulation, navigation, planification multimodale), mais leur entraînement par RL reste prohibitif en ressources. Un framework qui résout le conflit simulation/optimisation et atteint un speedup linéaire à l'échelle du trillion de paramètres lève l'un des principaux verrous pour entraîner des agents polyvalents sans multiplier les clusters GPU de façon exponentielle. C'est une brique infrastructure, pas un robot, mais elle conditionne directement la vitesse à laquelle des systèmes comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les VLA internes de Figure AI peuvent être affinés par RL dans des environnements simulés réalistes. Ce travail s'inscrit dans une course à la scalabilité du RL pour l'embodied AI, où les frameworks existants (IsaacLab, RLlib, sample-factory) n'ont pas été conçus pour les contraintes spécifiques des VLA massifs. Les auteurs ne mentionnent pas d'affiliation institutionnelle clairement identifiable dans l'abstract, et le papier est un preprint non encore évalué par les pairs. Aucun déploiement réel ni partenariat industriel n'est annoncé à ce stade. Les prochaines étapes naturelles seraient une validation sur des tâches robotiques plus complexes que LIBERO et une intégration avec des simulateurs comme Isaac Sim ou MuJoCo à grande échelle.

IA physiqueOpinion
1 source
BiPneu : conception et contrôle d'un système pneumatique à pression bipolaire pour robots souples
5107arXiv cs.RO 

BiPneu : conception et contrôle d'un système pneumatique à pression bipolaire pour robots souples

Des chercheurs ont publié sur arXiv (ref. 2605.12804) BiPneu, un système pneumatique multicanal capable de gérer simultanément des pressions positives et négatives pour actionner des robots souples. L'architecture repose sur un contrôleur à modes glissants dual (DM-SMC, Dual-Mode Sliding-Mode Controller) couplé à une sélection de mode supervisée par hystérésis, dérivé d'un modèle électro-pneumatique hybride. En tests expérimentaux, le DM-SMC atteint une erreur absolue moyenne de 1,44 kPa sur des références en échelon, et de 4,23 kPa en suivi sinusoïdal, soit des réductions respectives de 11,9 % et 35,6 % par rapport à un PID bien calibré. Le système surpasse également un contrôleur prédictif (MPC) avancé, tout en réduisant l'effort de commande, le taux de commutation des électrovannes et le temps de réponse transitoire. Deux démonstrations physiques valident l'approche : manipulation dynamique d'une balle avec un manipulateur parallèle souple, et téléopération en temps réel d'un actionneur à soufflets piloté par éléments finis (FEM). La régulation bipolaire -- pression positive pour gonfler, pression négative pour aspirer -- est le point dur de la robotique souple : les dynamiques d'inflation et de dégonflement sont asymétriques, les électrovannes introduisent des non-linéarités, et les transitions génèrent des perturbations de débit difficiles à compenser. BiPneu s'attaque directement à ces trois problèmes dans un seul framework scalable et économique, compatible avec les écosystèmes logiciels standards (ROS implicitement). Pour un intégrateur ou un laboratoire de R&D, cela signifie qu'il devient possible de déployer des actionneurs souples bipolaires sans développer un contrôleur bas niveau sur mesure, ce qui était jusqu'ici le principal frein à la standardisation de ces systèmes. La robotique souple pneumatique s'appuie depuis une décennie sur des régulateurs PID éprouvés, mais les limites de cette approche face aux dynamiques non linéaires des actionneurs à chambre variable ont poussé plusieurs équipes vers le MPC ou les contrôleurs adaptatifs. BiPneu positionne le DM-SMC comme une alternative plus robuste et moins coûteuse en calcul que le MPC, tout en restant plus précis que le PID. Il n'existe pas à ce stade de déploiement industriel annoncé ni de partenariat commercial mentionné -- il s'agit d'une contribution académique de type preprint, dont la robustesse reste à valider hors laboratoire sur des cycles prolongés et des géométries d'actionneurs variées.

RecherchePaper
1 source
Modèle du monde multimodal pour interactions physiques : prédictions visuelles et tactiles simultanées pour une précision accrue
5108arXiv cs.RO 

Modèle du monde multimodal pour interactions physiques : prédictions visuelles et tactiles simultanées pour une précision accrue

Des chercheurs ont publié sur arXiv (2304.11193v2) une étude portant sur l'intégration du retour tactile dans les modèles prédictifs de perception pour la manipulation robotique. L'approche, baptisée "visuo-tactile prediction", consiste à entraîner un modèle de monde capable de générer simultanément des prédictions visuelles et tactiles à partir d'observations de poussée d'objets. Pour alimenter ces travaux, deux jeux de données inédits ont été constitués à l'aide d'un capteur tactile à base magnétique : le premier contient des objets visuellement identiques mais aux propriétés physiques différentes (masse, rigidité), isolant explicitement l'ambiguïté physique ; le second reproduit les benchmarks classiques de robot-pushing avec des regroupements d'objets du quotidien. Le code source et les données sont mis à disposition publiquement. Le résultat central de cette recherche remet en question un postulat implicite de nombreux systèmes de world models robotiques : la vision seule ne suffit pas pour prédire fidèlement les interactions physiques dès lors que les objets sont visuellement indiscernables. Dans ces régimes ambigus, l'intégration tactile améliore significativement la précision et la robustesse des prédictions. En revanche, lorsque la dynamique est visuellement déductible, les gains tactiles restent limités. Pour les intégrateurs et équipes de R&D en manipulation, cela signifie que le retour tactile n'est pas un luxe mais une nécessité sélective : son déploiement est justifié précisément là où la vision échoue, typiquement lors de la manipulation d'objets déformables, transparents ou de densité variable. Ce travail s'inscrit dans un effort plus large de la communauté robotique pour dépasser les modèles de monde purement visuels, qui montrent leurs limites dans les tâches de contact. Des travaux concurrents comme ceux de Meta AI (v-jepa), de Google DeepMind (RT-2) ou de Physical Intelligence (Pi-0) explorent également les représentations multimodales, mais restent majoritairement centrés sur la vision et le langage. L'usage d'un capteur magnétique plutôt que optique (comme ceux de GelSight/Digit popularisés par Meta) constitue un choix technique notable, potentiellement plus robuste en conditions industrielles. La mise à disposition des données en accès libre ouvre la voie à des évaluations comparatives plus rigoureuses, un manque criant dans le domaine de la manipulation tactile.

RecherchePaper
1 source
TouchAnything : jeu de données et framework pour l'estimation tactile bimanuelle en vidéo égocentrique
5109arXiv cs.RO 

TouchAnything : jeu de données et framework pour l'estimation tactile bimanuelle en vidéo égocentrique

Une équipe de chercheurs a publié EgoTouch (arXiv 2605.13083), un dataset égocentrique à grande échelle combinant vidéo multi-vues et supervision tactile dense pour l'interaction bimanuelle main-objet. Le jeu de données couvre 208 tâches de manipulation réparties en 1 891 épisodes collectés en environnements intérieurs et extérieurs variés, synchronisés avec trois flux RGB simultanés (une caméra montée sur la tête et deux caméras fixées aux poignets), une estimation 3D de la pose des deux mains et des cartes de pression continues issues de capteurs tactiles portables. Sur cette base, les auteurs proposent TouchAnything, un modèle de prédiction vision-to-touch qui utilise la vue égocéntrique comme entrée principale et intègre optionnellement les vues poignet à l'inférence. Les gains mesurés atteignent 5,0% en Contact IoU et 6,1% en Volumetric IoU par rapport à la vue égocentrique seule. Le dataset, le code et un benchmark seront publiés en open source, sans date précise annoncée. L'absence de modalité tactile dans les datasets égocentriques existants constitue un frein reconnu à l'apprentissage de représentations physiquement ancrées : la vidéo seule ne transmet pas les signaux de contact, de force ou de pression nécessaires pour modéliser les dynamiques réelles d'interaction avec les objets. EgoTouch adresse ce verrou en montrant qu'il est possible d'inférer le retour tactile depuis la seule observation visuelle, ouvrant la voie à une supervision tactile scalable sans déploiement coûteux de matériel instrumenté. Pour les équipes travaillant sur des robots manipulateurs ou des politiques de saisie, cela représente une voie d'entraînement potentiellement peu onéreuse pour des comportements sensibles au contact, problème central dans l'assemblage délicat, le tri de pièces fragiles ou la manipulation de souples. Ce travail prolonge l'essor des datasets égocentriques type Ego4D (Meta, 2022), qui ont établi la valeur des flux vidéo à la première personne pour l'apprentissage embodied. Les datasets tactiles antérieurs, notamment autour de GelSight (MIT) ou DIGIT (Meta), restaient de petite échelle et difficiles à généraliser hors contexte de doigts robotiques instrumentés. TouchAnything se positionne comme une alternative scalable via des capteurs portables grand public. Les concurrents directs incluent les équipes travaillant sur le transfert tactile sim-to-real chez Meta AI et MIT CSAIL, ainsi que les projets VLA tels que pi0 de Physical Intelligence ou OpenVLA, qui intègrent progressivement la modalité tactile dans leurs pipelines d'apprentissage par imitation. Aucun acteur français ou européen n'est impliqué dans ce preprint.

RecherchePaper
1 source
Quand agir, interroger ou apprendre : le pilotage de politique par gestion de l'incertitude
5110arXiv cs.RO 

Quand agir, interroger ou apprendre : le pilotage de politique par gestion de l'incertitude

Une équipe de chercheurs a publié sur arXiv (réf. 2602.22474) un cadre nommé UPS (Uncertainty-Aware Policy Steering), conçu pour adapter le comportement d'un robot au moment du déploiement sans nécessiter de réentraînement complet. Le "policy steering" consiste à utiliser un vérificateur appris qui analyse les échantillons d'actions proposés par une politique pré-entraînée (typiquement une diffusion policy) et ne retient que celles jugées conformes à la tâche. UPS utilise un Vision-Language Model (VLM) comme vérificateur général, mais y ajoute une calibration par prédiction conforme (conformal prediction) pour corriger le biais de surconfiance caractéristique de ces modèles. Le système distingue trois régimes de décision : exécuter une action avec haute confiance, demander une clarification en langage naturel si la consigne est ambiguë, ou solliciter une intervention humaine sur l'action lorsque la politique de base est jugée incapable d'exécuter la tâche. Des expériences ont été menées en simulation et sur plateforme physique. Le problème de la surconfiance des VLMs est concret et rarement traité dans la littérature sur le déploiement robotique. En pratique, un vérificateur qui ne sait pas qu'il ne sait pas valide des actions incorrectes ou bloque des actions valides, dégradant directement la performance opérationnelle. UPS apporte une garantie statistique formelle sur le choix de stratégie, ce qui est significatif pour des intégrateurs industriels qui ont besoin de bornes de fiabilité chiffrées. La composante de residual learning permet au système de progresser à partir des interventions collectées en déploiement, avec un objectif explicite de minimiser le feedback humain coûteux. Cette combinaison calibration plus apprentissage continu différencie UPS des pipelines d'apprentissage actif classiques, qui ne pondèrent pas le coût réel des interruptions. Le policy steering s'est accéléré avec la disponibilité de politiques pré-entraînées génériques comme la diffusion policy, ACT ou pi-0, et de VLMs capables de raisonnement visuel. Les approches précédentes (SayCan, inner-monologue, RT-2) traitaient généralement la planification de haut niveau et l'exécution de bas niveau comme des modules séparés, sans calibration jointe de l'incertitude. UPS tente de combler ce gap en traitant simultanément l'incertitude sémantique et l'incertitude d'action dans un seul cadre probabiliste avec garanties statistiques. Les concurrents directs incluent les frameworks human-in-the-loop comme TAMER ou les approches de gating robotique d'OpenVLA, qui s'appuient sur des heuristiques moins formelles pour décider quand escalader vers un opérateur. Les travaux sont portés par une équipe académique (site de démonstration : jessie-yuan.github.io/ups) ; aucun partenaire industriel ni calendrier de transfert n'est annoncé à ce stade.

RechercheOpinion
1 source
Prismatic World Model : apprentissage de la dynamique compositionnelle pour la planification dans les systèmes hybrides
5111arXiv cs.RO 

Prismatic World Model : apprentissage de la dynamique compositionnelle pour la planification dans les systèmes hybrides

Une équipe de recherche a publié sur arXiv (arXiv:2512.08411v2, décembre 2025) le Prismatic World Model (PRISM-WM), une architecture de modèle du monde destinée à améliorer la planification dans les systèmes robotiques à dynamiques hybrides. Le problème central que PRISM-WM cherche à résoudre est structurel : les mouvements continus sont régulièrement interrompus par des événements discrets, contacts, impacts, transitions de phases (vol vs appui, glissement vs adhérence), qui créent des discontinuités difficiles à modéliser. Les architectures classiques à réseaux neuronaux monolithiques, comme les modèles latents de type RSSM ou DreamerV3, imposent une continuité globale qui lisse ces transitions et génère des erreurs cumulatives lors des simulations à long horizon (rollouts), rendant la planification peu fiable aux frontières physiques. PRISM-WM y répond par un cadre Mixture-of-Experts (MoE) contextuel : un mécanisme de gating identifie implicitement le mode physique courant, et des experts spécialisés prédisent la dynamique de transition associée. Une contrainte d'orthogonalisation latente force la diversité des experts, prévenant l'effondrement de modes. Les expériences portent sur des benchmarks de contrôle continu incluant des humanoïdes haute dimension et des configurations multi-tâches, couplés à l'algorithme d'optimisation de trajectoires TD-MPC. Les résultats montrent que PRISM-WM réduit le drift en simulation lors des rollouts étendus, offrant un substrat de haute fidélité pour les algorithmes d'optimisation de trajectoires. Pour les équipes de contrôle en robotique humanoïde, cela adresse directement le gap simulation-réalité lié à la gestion des contacts, une limitation structurelle des approches model-based existantes. La décomposition en primitives composables ouvre aussi une piste vers des architectures plus interprétables, un enjeu concret pour les déploiements industriels où la robustesse aux variations de terrain ou de tâche est critique. PRISM-WM s'inscrit dans la dynamique des world models pour la robotique, domaine en forte progression depuis les travaux de Hafner et al. sur DreamerV3 et les avancées de TD-MPC sur des tâches de locomotion complexe. L'approche MoE transposée à la dynamique physique rejoint des tendances observées dans les grands modèles de langage (Mixtral, GPT-4). Il n'est pas associé à une entreprise commerciale identifiée ; il s'agit d'une contribution académique pure, sans pilote industriel annoncé. La prochaine étape logique serait une validation sur hardware réel, notamment sur des plateformes humanoïdes où la gestion des contacts reste un verrou technique central de la sim-to-real transfer.

RecherchePaper
1 source
SID : glissement dans la distribution pour une manipulation robotique robuste à partir de peu de démonstrations
5112arXiv cs.RO 

SID : glissement dans la distribution pour une manipulation robotique robuste à partir de peu de démonstrations

Des chercheurs ont présenté SID (Sliding into Distribution), un cadre structuré pour la manipulation robotique capable de généraliser à partir de seulement deux démonstrations humaines. Évalué sur six tâches réelles variées (saisies, manipulations d'objets), SID atteint environ 90 % de taux de succès dans des configurations hors-distribution (OOD), c'est-à-dire avec des poses d'objets, des points de vue ou des conditions d'éclairage non vus lors de l'entraînement. La dégradation reste inférieure à 10 % en présence de distracteurs visuels ou de perturbations physiques externes. Le système s'appuie sur deux composants clés : un champ de mouvement centré sur l'objet, appris depuis des démonstrations "canonicalisées" (normalisées en pose), et une politique d'exécution égocentrique légère entraînée par flow matching conditionné, complétée par une augmentation de données par reprojection de nuage de points cinématiquement cohérente. L'intérêt de SID tient à sa frugalité en données : là où les politiques visuomotrices end-to-end standard (type ACT, Diffusion Policy) réclament des dizaines à centaines de démonstrations, SID opère à deux. C'est un signal fort pour les intégrateurs industriels qui peinent à collecter des données en volume sur cellule réelle. Le mécanisme de correction distributional est particulièrement notable : le champ de mouvement génère de larges corrections quand le robot s'écarte de la trajectoire démontrée, puis s'annule naturellement à l'approche de la zone fiable, avant de passer la main à la politique locale. Ce découplage explicite entre récupération hors-distribution et exécution fine constitue une alternative architecturale aux approches purement régressives. Les résultats suggèrent que le "sim-to-real gap" n'est pas le seul problème à résoudre : gérer le glissement distributional en ligne, sans recollecte de données, est un levier sous-exploité. Cette publication s'inscrit dans une vague de travaux sur la manipulation à faible donnée qui cherchent à dépasser les limites des transformeurs d'actions (ACT, π0 de Physical Intelligence, GR00T N2 de NVIDIA) en introduisant des structures géométriques explicites plutôt que de tout apprendre de bout en bout. Le flow matching, popularisé ces deux dernières années comme alternative plus stable à la diffusion pour la génération de trajectoires, est ici combiné à une représentation canonique de l'objet, une approche qui rappelle les travaux sur les réseaux de catégorie neurale (NCF) ou les politiques basées sur des keypoints. Le papier ne mentionne pas de partenaires industriels ni de timeline de déploiement, et reste pour l'instant au stade de preuve de concept académique sur banc réel. Les prochaines étapes naturelles seraient une extension à des objets déformables et une validation sur des bras commerciaux (Franka, xArm) dans des environnements moins contrôlés que le labo.

RecherchePaper
1 source
Planification de la manipulation pour des activités de construction répétitives
5113arXiv cs.RO 

Planification de la manipulation pour des activités de construction répétitives

Une équipe de chercheurs a publié mi-mai 2026 sur arXiv un framework de planification de manipulation robotique destiné aux tâches de construction répétitives, comme la pose de briques ou l'installation de dalles de plafond. L'approche repose sur un environnement de démonstration en réalité virtuelle (VR) : un opérateur humain réalise une seule démonstration du geste à apprendre, que le système capture puis décompose en une séquence de mouvements à vis constants (screw motions) via la géométrie des vis. À partir de cette représentation, deux algorithmes, la Screw Linear Interpolation (ScLERP) et le Resolved Motion Rate Control (RMRC), génèrent automatiquement les plans de mouvement articulaire pour chaque instance répétée de la tâche. Les expériences ont été conduites sur un bras à 7 degrés de liberté (7-DoF), d'abord en simulation puis sur robot physique, avec deux scénarios concrets : construction de murs de briques en configurations arbitraires et pose de multiples dalles de plafond, chacun déclenché depuis une unique démonstration. Le résultat le plus significatif est la généralisation one-shot à des séquences de longueur arbitraire, un mur peut contenir autant de briques que nécessaire sans nouvelle démonstration. C'est un point directement pertinent pour les intégrateurs industriels : en construction, la variabilité de l'environnement (dimensions de chantier, positions relatives des éléments) est précisément ce qui freine le déploiement des robots. Ici, la représentation par vis capture la structure géométrique du mouvement de façon compacte, ce qui permet une extrapolation robuste plutôt qu'une simple répétition mémorisée. La validation hardware réduit partiellement le sim-to-real gap souvent invoqué pour relativiser les démonstrations purement simulées, bien que les conditions expérimentales (charge utile, tolérance dimensionnelle, matériaux réels) ne soient pas précisément détaillées dans le préprint. La robotique de construction est un secteur en accélération : Hilti, Hadrian X (Fastbrick Robotics), ou encore Dusty Robotics adressent des tâches spécifiques de chantier, mais la plupart restent sur des pipelines hautement programmés et peu flexibles. L'approche par démonstration VR + géométrie des vis s'inscrit dans un courant plus large de Learning from Demonstration (LfD) qui tente de réduire le coût d'intégration sur des tâches manuelles qualifiées. La prochaine étape naturelle serait de tester la robustesse face aux perturbations réelles du chantier (vibrations, tolérances matériaux, occlusions) et d'étendre à des tâches multi-bras ou à manipulation bimane, deux lacunes que le papier ne couvre pas encore.

RecherchePaper
1 source
Follow-Bench : un benchmark unifié de planification de mouvement pour la poursuite sociale de personnes par robot
5114arXiv cs.RO 

Follow-Bench : un benchmark unifié de planification de mouvement pour la poursuite sociale de personnes par robot

Une équipe de chercheurs a publié sur arXiv (référence arXiv:2509.10796v4) Follow-Bench, le premier benchmark unifié consacré au "robot person following" (RPF), c'est-à-dire des robots mobiles capables de suivre et d'assister une personne cible dans un environnement peuplé. L'étude couvre les scénarios représentatifs identifiés dans la littérature (assistance personnelle, patrouille de sécurité, aide aux personnes âgées, logistique), propose un environnement de simulation standardisé reproduisant des configurations variées comme des trajectoires cibles multiples, des dynamiques de foule et des agencements spatiaux différents, et réimplémente huit planificateurs de mouvement RPF issus de travaux existants dans ce cadre commun. Les deux planificateurs les plus performants en simulation ont ensuite été déployés sur un robot réel à entraînement différentiel pour valider les résultats en conditions concrètes. L'absence d'un benchmark partagé rendait jusqu'ici toute comparaison rigoureuse entre méthodes RPF quasiment impossible : chaque équipe évaluait ses planificateurs sur ses propres scénarios avec ses propres métriques, rendant les comparaisons inter-équipes peu fiables. Follow-Bench comble ce vide en standardisant simultanément les scénarios, les métriques de sécurité et de confort, et les planificateurs de référence. Le résultat le plus instructif est la quantification du compromis sécurité-confort : les expériences montrent qu'optimiser la distance de sécurité vis-à-vis des piétons tend à dégrader le confort de la personne suivie, et inversement. Cette tension, souvent évoquée qualitativement dans la littérature, dispose désormais d'une base quantitative reproductible. Pour les intégrateurs travaillant sur des robots d'assistance ou de logistique en milieu humain, cela fournit enfin un cadre commun pour comparer des solutions et cibler des axes d'amélioration précis. Le RPF s'inscrit dans le domaine plus large de la navigation socialement acceptable (social robot navigation), en expansion rapide sous l'effet du vieillissement démographique et de la croissance des entrepôts automatisés. Des plateformes comme celles de Labrador Systems, Ohmni Labs ou certains AMR de Boston Dynamics intègrent des capacités de suivi de personne, mais sans référentiel objectif partagé. Follow-Bench ne livre pas de solution clé en main : les auteurs identifient des défis ouverts non résolus, notamment la robustesse en foule dense et la gestion des occlusions prolongées, qui restent des freins au déploiement industriel à grande échelle.

RecherchePaper
1 source
Localisation de source de gaz sans calibration par robots mobiles : estimation du terme source par classement des concentrations
5115arXiv cs.RO 

Localisation de source de gaz sans calibration par robots mobiles : estimation du terme source par classement des concentrations

Des chercheurs ont déposé sur arXiv (réf. 2605.13208) une méthode de localisation de source gazeuse (GSL) par robot mobile qui élimine la calibration préalable des capteurs chimiques. Le problème central est bien connu : les capteurs bas coût embarqués sur des robots présentent une réponse non linéaire, sensible à l'humidité, à la température et aux interactions chimiques, auxquels s'ajoutent les artefacts liés au déplacement du robot lui-même. La calibration en environnement contrôlé, normalement nécessaire pour corriger ces biais, est souvent impossible en conditions opérationnelles d'urgence. L'algorithme proposé contourne ce problème en substituant les valeurs absolues de concentration par leur classement relatif (ranking) au sein du jeu de données accumulé dynamiquement. Ces rangs sont comparés à ceux issus de modèles physiques de dispersion gazeuse pour estimer une distribution probabiliste des positions de la source sur l'ensemble de l'environnement. La méthode a été validée en simulation haute-fidélité et en expériences physiques, avec une précision de localisation maintenue même avec des capteurs non calibrés, bien que le préprint ne publie pas encore de métriques quantitatives détaillées. L'impact pratique est direct pour les scénarios d'urgence industrielle : fuite de gaz, incident chimique ou inspection de zones contaminées où le déploiement humain est risqué. Les approches probabilistes de GSL existantes, basées sur des modèles de panache gaussien ou des filtres bayésiens, supposent une qualité de mesure fiable, ce qui exige des cycles de recalibration réguliers incompatibles avec un déploiement rapide. En travaillant sur les rangs plutôt que sur les amplitudes, la méthode devient insensible aux dérives capteur et aux variations environnementales, ce qui réduit concrètement les coûts de maintenance et simplifie les procédures de mise en service pour les intégrateurs de robots de sécurité. La localisation de source gazeuse robotisée est étudiée depuis les années 2000, avec des approches allant du hill-climbing aux algorithmes bio-inspirés imitant la navigation olfactive des insectes, puis aux méthodes probabilistes modernes. Ce travail s'inscrit dans une tendance plus large visant à rendre les robots de sécurité industrielle opérationnels en conditions dégradées, sans infrastructure de support dédiée. Les prochaines étapes logiques incluent la validation en environnements dynamiques avec vent variable et obstacles mobiles, ainsi que l'extension à des flottes multi-robots capables de couvrir de larges zones industrielles en parallèle.

RecherchePaper
1 source
DynoJEPP : estimation conjointe, prédiction et planification en environnements dynamiques
5116arXiv cs.RO 

DynoJEPP : estimation conjointe, prédiction et planification en environnements dynamiques

DynoJEPP (Joint Estimation, Prediction and Planning) est un cadre de planification robotique basé sur les graphes de facteurs, publié le 14 mai 2026 sur arXiv (2605.12897), qui optimise simultanément trois modules traditionnellement traités en séquence : l'estimation d'état, la prédiction du comportement des objets environnants, et la planification de trajectoire. Le coeur de la contribution est l'introduction des "facteurs dirigés" (directed factors), un nouveau type de noeud dans le graphe de facteurs imposant un flux d'information strictement unidirectionnel entre les modules. Sans ce mécanisme, les informations issues de la prédiction et de la planification remontent dans l'estimateur d'état, corrompant les estimées et produisant des comportements non désirés. Le framework inclut également une extension baptisée Cooperative DynoJEPP, permettant au robot de modéliser un comportement coopératif des objets mobiles dans sa planification de trajectoire. L'impact le plus saillant ressort des expériences de validation : sans les facteurs dirigés, le robot entre en collision dans la majorité des tests, en environnement statique comme dynamique. Ce résultat pointe un problème fondamental des architectures JEPP existantes : la co-optimisation conjointe crée des boucles de rétroaction non désirées qui dégradent la sécurité opérationnelle. Le module d'estimation d'état, typiquement le composant de référence dans les systèmes de navigation, se retrouve contaminé par des hypothèses issues de la planification, inversant la causalité naturelle du pipeline. Pour les intégrateurs travaillant sur la navigation autonome en entrepôt ou en espace partagé humain-robot, l'approche suggère que la structure des dépendances entre modules est au moins aussi critique que leur optimisation conjointe. Les graphes de facteurs sont une technique établie en robotique depuis le milieu des années 2000, popularisée notamment par Frank Dellaert (Georgia Tech) via la librairie GTSAM pour le SLAM. Les approches JEPP suscitent un intérêt croissant face à la montée des robots en espaces dynamiques (entrepôts, routes mixtes, cobotique). Les concurrents directs incluent les planificateurs MPC à modules séparés, les architectures différentiables de type Wayve ou DreamerV3, et les VLA (Vision-Language-Action) qui intègrent progressivement la modélisation des agents environnants. La contribution de DynoJEPP reste au stade de la recherche académique (preprint sans revue par les pairs), sans déploiement ni pilote industriel annoncé.

RecherchePaper
1 source
MUJICA : architecture de contrôle unifiée multi-compétences pour robots hybrides roues-pattes
5117arXiv cs.RO 

MUJICA : architecture de contrôle unifiée multi-compétences pour robots hybrides roues-pattes

Des chercheurs ont publié sur arXiv (référence 2605.13058) un framework de contrôle unifié pour robots à roues et pattes, baptisé MUJICA (Multi-skill Unified Joint Integration of Control Architecture). L'architecture regroupe en une seule politique trois compétences locomotrices distinctes : déplacement omnidirectionnel, escalade de plateformes élevées et récupération après chute. Chaque compétence est identifiée par des variables indicatrices propres et entraînée conjointement avec une modélisation précise des contraintes des moteurs à courant continu. Un sélecteur de compétences de haut niveau apprend ensuite à choisir dynamiquement la compétence optimale à partir de la seule proprioception, sans caméra ni LiDAR. Les expériences ont été conduites en simulation puis sur le robot Unitree Go2-W, la variante à roues du quadrupède Go2 commercialisé par Unitree Robotics. Ce travail adresse un problème structurel des robots hybrides roues-pattes : alterner entre contrôle roulant et contrôle locomoteur sans transitions abruptes ni dégradation de performance aux limites mécaniques des actionneurs. Le bruit proprioceptif et les contraintes réelles des moteurs rendent cette robustesse difficile à obtenir, particulièrement lors du transfert sim-to-real. MUJICA améliore ce transfert en intégrant un modèle DC-moteur précis dès la phase d'entraînement, ce qui réduit l'écart entre simulation et déploiement physique. Pour un intégrateur industriel ou un COO logistique, cela signifie un robot hybride capable de naviguer de façon autonome dans des environnements non structurés (entrepôts encombrés, chantiers, zones mixtes) sans reconfigurations manuelles entre modes de déplacement. Le Unitree Go2-W est l'une des rares plateformes commerciales hybrides roues-pattes accessibles (le Go2 standard est vendu entre 1 600 et 2 700 USD selon configuration), ce qui en fait un banc de test pertinent pour la reproductibilité. Dans la compétition plus large sur la locomotion adaptative, des acteurs comme ANYbotics (ANYmal), Boston Dynamics (Spot) ou des équipes académiques de l'ETH Zurich et de Carnegie Mellon développent des approches concurrentes, souvent basées sur vision ou LiDAR. MUJICA se distingue par son pari sur la proprioception seule, choix réaliste pour des déploiements sans infrastructure sensorielle lourde. L'article restant un preprint non évalué par des pairs, les métriques de performance en conditions réelles devront être confirmées lors d'une soumission en conférence (IROS, ICRA ou CoRL).

RecherchePaper
1 source
RoboEvolve : co-évolution planificateur-simulateur pour la manipulation robotique avec peu de données
5118arXiv cs.RO 

RoboEvolve : co-évolution planificateur-simulateur pour la manipulation robotique avec peu de données

RoboEvolve est un framework de recherche publié en preprint arXiv (réf. 2605.13775, mai 2025) dont l'objectif est de résoudre la rareté des données d'interaction physique alignées sur les tâches de manipulation robotique. Le système couple un planificateur basé sur un modèle vision-langage (VLM) et un simulateur basé sur un modèle de génération vidéo (VGM) dans une boucle co-évolutive auto-renforçante, opérant à partir de seulement 500 images non annotées, soit une réduction de 50x par rapport aux baselines entièrement supervisées. Le mécanisme alterne une phase d'exploration diurne, qui génère des trajectoires ancrées physiquement via une récompense multi-granulaire à contrôle sémantique, et une phase de consolidation nocturne, qui exploite les échecs "near-miss" pour stabiliser l'optimisation de politique. Les résultats publiés indiquent une amélioration de 30 points absolus sur les planificateurs de base, une hausse de 48 % du taux de succès des simulateurs, et un apprentissage continu robuste sans oubli catastrophique. Ces chiffres adressent directement le principal verrou économique des pipelines de manipulation à grande échelle : la collecte de données téléopérées, qui freine aujourd'hui des systèmes commerciaux comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). La co-évolution VLM-VGM contourne deux limitations bien documentées : les VLM seuls souffrent d'un désalignement sémantique-spatial (compréhension correcte de la tâche mais imprécision dans le positionnement 3D), tandis que les VGM seuls produisent des hallucinations physiques (vidéos synthétiques qui violent les contraintes physiques réelles). Un curriculum progressif automatique fait évoluer le système d'actions atomiques simples vers des tâches composites complexes, approche concrète au problème de généralisation hiérarchique encore non résolu à l'échelle commerciale. Ce travail s'inscrit dans une tendance émergente visant à substituer la génération synthétique de données à la collecte terrain coûteuse, tendance accélérée depuis Diffusion Policy (2023) et l'essor des modèles VLA (vision-language-action). Le résumé disponible ne précise ni affiliation institutionnelle des auteurs ni plateforme matérielle de validation, une limite importante avant tout transfert industriel. Aucun déploiement physique ni partenariat constructeur n'est annoncé : RoboEvolve reste à ce stade une contribution académique dont la transposition sim-to-real sur hardware réel reste entièrement à démontrer.

RechercheOpinion
1 source
Transport d'objets par occlusion autour d'obstacles grâce à un essaim de robots miniatures
5119arXiv cs.RO 

Transport d'objets par occlusion autour d'obstacles grâce à un essaim de robots miniatures

Des chercheurs ont publié sur arXiv (référence 2605.13006) une extension d'une stratégie existante de transport collectif par essaim robotique, permettant désormais aux robots de contourner des obstacles qui bloquent la ligne de vue vers la cible. Le système repose sur une approche dite par occlusion : chaque robot minuscule utilise sa capacité à détecter si l'objet à déplacer masque ou non la lumière émise par la balise-objectif pour décider de sa position et de sa poussée. La nouveauté consiste à permettre à n'importe quel membre de l'essaim de se positionner comme sous-objectif intermédiaire, formant ainsi une chaîne de relais visuels entre l'objet et la destination finale. Le comportement global émerge d'une machine à états finis individuelle et simple, sans aucune communication entre robots et sans coordinateur central. Cinq séries d'expériences simulées démontrent la robustesse du système face à des obstacles convexes et concaves, à des positions de départ variables et à différentes tailles de swarm. Cette approche lève la principale limite pratique des stratégies d'occlusion précédentes, qui exigeaient un couloir dégagé entre l'objet et la cible, une hypothèse rarement vérifiable dans un environnement industriel réel encombré de rayonnages, palettes ou machines. L'absence totale de communication entre agents élimine les goulots d'étranglement réseau et les points de défaillance uniques qui pénalisent les flottes d'AMR classiques dès que la densité de robots augmente. La capacité à traiter des obstacles concaves, géométriquement plus complexes, suggère une transposabilité raisonnable vers des configurations d'entrepôts non standardisés. Il convient cependant de noter que les résultats restent purement simulés : le fossé sim-to-real sur des robots physiques miniatures, avec friction, glissement et variabilité de capteurs, n'est pas encore adressé. La stratégie par occlusion pour transport en essaim a été posée par des travaux antérieurs, notamment dans les groupes travaillant sur les kilobots et les microbots à faibles ressources computationnelles. Ce domaine se distingue des approches multi-robots classiques (ROS 2, planification centralisée) par son paradigme ascendant, plus proche des algorithmes bio-inspirés type stigmergie. Les concurrents directs dans l'espace du transport collectif décentralisé incluent des travaux sur les robots vibratoires de Harvard et les systèmes de manipulation collective du MIT CSAIL. La prochaine étape logique annoncée implicitement par les auteurs est la validation sur hardware réel, où les contraintes physiques des robots miniatures rendront les résultats réellement exploitables par les intégrateurs de solutions de manutention autonome.

RecherchePaper
1 source
COSMIC : optimisation simultanée de la structure, des matériaux et du contrôle intégré pour les systèmes robotiques
5120arXiv cs.RO 

COSMIC : optimisation simultanée de la structure, des matériaux et du contrôle intégré pour les systèmes robotiques

Des chercheurs ont publié sur arXiv (référence 2605.12654, mai 2026) COSMIC, un framework de co-conception par descente de gradient pour robots à treillis structurel (truss-lattice) qui optimise simultanément la topologie, la distribution des matériaux et la politique de contrôle. Contrairement aux approches classiques où structure, matériaux et contrôle sont conçus séquentiellement par des équipes distinctes, COSMIC intègre un contrôleur neuronal directement dans un simulateur différentiable, permettant le calcul automatique des gradients à travers l'ensemble du pipeline de conception. Les variables topologiques et matérielles, de nature mixte (discrètes et continues), sont encodées dans un espace continu, et une optimisation sous contraintes navigue un paysage de solutions hautement non-convexe. Les études de cas démontrent que le framework découvre systématiquement des stratégies de locomotion plus performantes que les approches à conception séparée, tout en s'adaptant à différentes conditions aux limites et exigences fonctionnelles. L'enjeu est fondamental : la quasi-totalité des systèmes robotiques actuels, des bras industriels aux humanoïdes, souffrent d'un déficit de co-conception hérité de la séparation des disciplines mécaniques, matériaux et contrôle. COSMIC s'attaque directement à ce que les biologistes observent depuis des décennies : dans la nature, morphologie et contrôle co-évoluent, et cette interaction produit des solutions inaccessibles à l'optimisation séparée. Pour les équipes R&D, l'approche par différentiation automatique ouvre la voie à des boucles de conception automatisées plutôt que manuelles, réduisant potentiellement les itérations de prototypage. La flexibilité annoncée vis-à-vis des conditions fonctionnelles suggère une applicabilité au-delà de la locomotion (reconfiguration, manipulation), mais ces affirmations restent à ce stade limitées à des validations en simulation. La co-conception robotique est un domaine actif depuis plusieurs années, avec des approches concurrentes issues de la robotique évolutionnaire (travaux de Josh Bongard, NEAT morphologique) et des frameworks différentiables comme DiffTaichi ou Brax de Google DeepMind. COSMIC se distingue par l'intégration simultanée des trois entités dans un cadre gradient unifié, là où la plupart des travaux existants n'en co-optimisent que deux. La lacune critique du papier est l'absence de validation hardware : les robots truss-lattice sont réputés difficiles à fabriquer et à contrôler physiquement, et le gap sim-to-real constitue l'obstacle majeur avant toute application industrielle. Les prochaines étapes annoncées concernent des comportements autonomes complexes, sans timeline ni partenaire industriel mentionnés.

RecherchePaper
1 source
Robot Squid Game : locomotion quadrupède pour traverser des tunnels étroits
5121arXiv cs.RO 

Robot Squid Game : locomotion quadrupède pour traverser des tunnels étroits

Des chercheurs publient sur arXiv (réf. 2605.13665, mai 2026) un framework d'apprentissage par renforcement (RL) permettant à des robots quadrupèdes de traverser de manière autonome des environnements 3D confinés : tunnels, grottes et structures effondrées, avec des applications ciblées en recherche et sauvetage et en inspection d'infrastructures. La méthode repose sur deux mécanismes complémentaires : une génération procédurale de géométries de tunnels pendant l'entraînement, qui expose le robot à une grande diversité de configurations spatiales, et un paradigme enseignant-étudiant (teacher-student) de distillation de politiques. Des politiques expertes spécialisées sur des géométries spécifiques transfèrent leur connaissance à une politique étudiante unifiée, évitant ainsi le reward shaping complexe habituellement requis dans l'entraînement end-to-end. Les résultats sont validés à la fois en simulation et en expériences physiques réelles sur robot quadrupède. L'enjeu est concret : les approches classiques de locomotion quadrupède échouent régulièrement face à des espaces confinés non structurés, en raison d'allures (gaits) rigides et d'hypothèses environnementales trop simplistes. En décomposant une tâche complexe en sous-tâches apprenables indépendamment, le framework réduit la difficulté d'optimisation et améliore la généralisabilité, un résultat que les approches monolithiques end-to-end peinent à atteindre sur des géométries variées. Pour un intégrateur en sécurité civile ou en inspection de réseaux souterrains, ce type de robustesse comportementale dans des tunnels aux contraintes spatiales variables est un pas mesurable vers des déploiements autonomes réels, au-delà des démonstrations sur terrains balisés. La locomotion quadrupède en milieu confiné a été un axe central du DARPA Subterranean Challenge (2018-2021), compétition qui a exposé les limites des approches heuristiques dans des souterrains non cartographiés, avec des équipes impliquant Boston Dynamics, CMU et ANYbotics. Le paradigme teacher-student appliqué à la locomotion RL s'inscrit dans une tendance active initiée notamment par les travaux d'ETH Zurich sur ANYmal et les recherches de DeepMind sur les locomoteurs polyvalents. Ce travail reste une preprint arXiv non encore évaluée par les pairs, sans partenaire industriel annoncé ni calendrier de déploiement mentionné : les résultats présentés sont encourageants mais restent à confirmer sur des plateformes plus variées et des scénarios de terrain réels.

RecherchePaper
1 source
Manipulation d'objets par un système de treillis à topologie variable
5122arXiv cs.RO 

Manipulation d'objets par un système de treillis à topologie variable

Des chercheurs ont publié en mai 2025 sur arXiv (référence 2605.13086) une stratégie de manipulation d'objets pour le Variable Topology Truss (VTT), un robot truss composé de membres actionnés reliés entre eux par des joints sphériques passifs dont la topologie structurale peut être reconfigurée à la demande. Jusqu'ici, cette classe de robot était démontrée pour ses capacités cinématiques, sans méthode formalisée pour saisir ou déplacer des objets. Les auteurs proposent un cadre de contrôle hybride qui régule simultanément position et force, sans découplage explicite entre les deux objectifs. Au niveau de chaque actionneur, un contrôleur à rétroaction de force par capteur génère les forces axiales souhaitées malgré une friction mécanique élevée, problème récurrent dans ces mécanismes. Au niveau de la tâche, les forces appliquées aux noeuds effecteurs sont calculées à partir d'un modèle statique du VTT. Les expériences portent sur un module unitaire puis sur le système complet dans deux configurations de manipulation représentatives, avec évaluation quantitative du suivi combiné position-force. Cette contribution comble un écart méthodologique structurant: les robots truss avaient été identifiés comme des manipulateurs à déploiement rapide, notamment pour des environnements contraints (robotique spatiale, intervention d'urgence, infrastructure adaptative), mais l'absence de stratégie de manipulation fiable les maintenait au stade de démonstrateurs cinématiques. Traiter explicitement la friction élevée des actionneurs via la rétroaction de force rapproche la démarche des contraintes d'un déploiement réel. La validation expérimentale quantitative, plutôt qu'une démonstration vidéo qualitative, renforce la crédibilité des résultats. Il convient toutefois de noter que la publication reste un preprint, non encore soumis à évaluation par les pairs. Les robots truss reconfigurables constituent une voie distincte des manipulateurs sériels classiques (bras 6-DOF type KUKA, UR) et des architectures parallèles (Delta, Stewart): leur avantage théorique réside dans une reconfiguration structurale à la volée, potentiellement utile pour des tâches à géométrie variable. Le VTT s'inscrit dans une lignée de travaux sur les treillis actifs explorés depuis les années 1990 principalement pour la robotique spatiale et les structures adaptatives. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans l'article; les suites naturelles porteraient sur la généralisation à des topologies plus complexes, des charges utiles plus importantes et une validation en environnement non structuré.

RecherchePaper
1 source
CUBic : cadre unifié et coordonné de perception et contrôle bimanuels
5123arXiv cs.RO 

CUBic : cadre unifié et coordonné de perception et contrôle bimanuels

Des chercheurs ont publié CUBic (Coordinated and Unified framework for Bimanual perception and control), un cadre d'apprentissage visuomoteur pour robots à deux bras, déposé sur arXiv en mai 2025 (arXiv:2605.13452). L'objectif : résoudre un verrou classique de la manipulation bimanuelle, où chaque bras doit agir à la fois de façon indépendante et coordonnée avec l'autre. CUBic reformule ce problème comme un défi de modélisation perceptuelle unifiée, en apprenant une représentation tokenisée partagée à travers trois composants : une agrégation perceptuelle unidirectionnelle, une coordination bidirectionnelle via deux codebooks à mapping commun, et une politique de diffusion perception-vers-contrôle. Les expériences sur le benchmark RoboTwin montrent des améliorations nettes sur les métriques de précision de coordination et de taux de succès par rapport aux baselines de référence, sans que les chiffres précis soient disponibles dans l'abstract publié. Le verrou que CUBic adresse est structurel : les approches existantes forçaient un choix binaire, soit déconnecter les deux bras (chacun avec sa propre politique, au détriment de la coordination globale), soit imposer un couplage fort entre eux (risque d'interférences, manque de souplesse). CUBic démontre qu'une représentation partagée apprise de façon émergente, sans couplage codé à la main, suffit à générer simultanément indépendance et coordination. Pour un intégrateur ou un COO industriel, c'est un signal encourageant pour les tâches d'assemblage bimanuel complexes comme le vissage, le pliage ou le conditionnement, qui restent aujourd'hui difficiles à automatiser sans sur-ingénierie du système de contrôle. La manipulation bimanuelle est l'un des fronts les plus actifs de la recherche en robotique apprise. Des cadres comme ACT (Action Chunking with Transformers), Diffusion Policy ou Pi-0 de Physical Intelligence ont progressivement amélioré les performances à un seul bras ; l'extension bimanuelle reste un défi ouvert, notamment pour les robots humanoïdes tels que le Figure 03, l'Optimus Gen 3 ou l'Unitree G1, qui en ont besoin pour les tâches industrielles réelles. CUBic est pour l'instant une contribution fondationnelle validée uniquement en simulation sur RoboTwin, sans déploiement physique annoncé. La prochaine étape logique serait un transfert sim-to-real sur robot physique, qui constitue encore le principal goulot d'étranglement entre publications académiques et applications industrielles concrètes.

RecherchePaper
1 source
SenseTime ouvre un commerce de proximité en IA incarnée avec des robots humanoïdes à Shanghai
5124Pandaily 

SenseTime ouvre un commerce de proximité en IA incarnée avec des robots humanoïdes à Shanghai

SenseTime, l'un des principaux groupes d'intelligence artificielle en Chine, a inauguré en mai 2026 à Shanghai un point de vente de détail entièrement opéré par des robots humanoïdes. La boutique, baptisée "Shaomai Gou" (烧卖购), est installée dans le site touristique Baoshan Riverside Scenic Area. Le protocole client est simple : scanner un QR code pour passer commande depuis son téléphone, puis recevoir le produit directement des mains du robot. Au-delà de la préparation des commandes, les robots seraient capables d'assurer la sélection des références, la tarification et l'analyse des données de réapprovisionnement des stocks. Le magasin a attiré des files d'attente spontanées lors du week-end du 1er mai. Aucun modèle de robot n'est identifié dans l'annonce officielle, et SenseTime ne publie pas de métriques opérationnelles (temps de cycle, taux de succès des saisies, volume de transactions). Ce déploiement est significatif parce qu'il sort les robots humanoïdes du contexte industriel contrôlé pour les placer face à des consommateurs non formés, dans un environnement ouvert et non structuré. La manipulation de produits variés, la gestion des interactions client et le réassort en rayon constituent des tâches difficiles pour un système robotique généraliste. Cela dit, l'absence de données techniques publiées invite à la prudence : l'initiative ressemble davantage à un déploiement pilote à forte valeur marketing qu'à une preuve de passage à l'échelle industrielle. Ce que cela valide en revanche, c'est l'existence d'une voie commerciale pour l'embodied AI dans les services de proximité à forte fréquentation, un segment jusqu'ici dominé par des kiosques automatisés passifs. SenseTime a bâti sa réputation initiale sur la vision par ordinateur et la reconnaissance faciale avant de pivoter vers l'IA incarnée, combinant vision robotique, compréhension du langage naturel et manipulation physique. En Chine, la société fait face à la concurrence de Unitree Robotics, Fourier Intelligence et UBTECH sur le segment humanoïde ; à l'international, les références du secteur restent Figure AI avec le robot 03, Physical Intelligence avec Pi-0 et Boston Dynamics. La prochaine étape logique pour SenseTime sera d'étendre "Shaomai Gou" à d'autres sites et de publier des données de performance qui permettraient de distinguer la démonstration du déploiement opérationnel réel.

Chine/AsieActu
1 source
SenseTime ouvre un magasin de proximité avec des robots à IA physique à Shanghai
5125Pandaily 

SenseTime ouvre un magasin de proximité avec des robots à IA physique à Shanghai

SenseTime, via sa filiale SenseMart, a inauguré à Shanghai (quartier touristique de Baoshan Riverside) un magasin de proximité autonome baptisé "Shaomai Gou" (烧卖购), dont l'affluence lors des congés du 1er mai a confirmé l'intérêt du public. Le client scanne un QR code ; un bras robotique sélectionne et délivre le produit en 15 secondes dans les meilleures conditions annoncées, sans caissier ni gérant sur place. Le point de vente de 15 m² propose plus de 300 références (SKUs) couvrant boissons, café, glaces et plats chauds, produits standardisés et non standardisés confondus. Trois boutiques sont actuellement en exploitation régulière à Shanghai, avec 400 transactions quotidiennes par unité en moyenne. SenseTime vise une extension à d'autres villes chinoises d'ici fin 2026. Ce que ce déploiement démontre pour l'industrie, c'est la viabilité opérationnelle d'une boucle "percevoir-comprendre-décider-exécuter" en environnement retail réel. L'architecture repose sur deux moteurs : SenseMartGalaxy pour la perception visuelle et la compréhension multimodale, et SenseMartGalaxy-EAI, qui intègre la reconstruction 3D par gaussiennes et des world models pour la manipulation physique. Point concret pour les intégrateurs : le système reconnaît de nouveaux produits sans réentraînement, ce qui abaisse le coût d'onboarding des références. Cette capacité s'appuie sur cinq ans d'accumulation de données propriétaires, soit 300 000 modèles 2D produits, 100 000 assets 3D et 1,5 million d'enregistrements de transactions journalières. C'est un avantage structurel difficile à répliquer rapidement par un entrant. SenseTime est historiquement connue pour ses solutions de vision par ordinateur et de reconnaissance faciale ; SenseMart constitue son pivot vers la robotique de service. Le segment du retail autonome est disputé : Amazon Go est en recul commercial en Occident, tandis que Standard AI et AiFi misent sur des formats "grab and go" sans manipulation physique. En Chine, Cainiao (Alibaba) et JD.com explorent des approches similaires, mais l'intégration d'un bras robotique dans un espace aussi réduit reste rare. Les analystes soulèvent des questions légitimes sur la durabilité économique du modèle (coûts de maintenance, taux de pannes, comportements atypiques côté clients) que les chiffres actuels, issus d'un lancement récent dans un cadre touristique contrôlé, ne permettent pas encore de trancher.

Chine/AsieOpinion
1 source
L'automatisation traditionnelle est trop coûteuse et trop rigide, selon Stefan Nusser d'Intrinsic
5126Robotics & Automation News 

L'automatisation traditionnelle est trop coûteuse et trop rigide, selon Stefan Nusser d'Intrinsic

Stefan Nusser, directeur général d'Intrinsic, filiale d'Alphabet dédiée aux logiciels de robotique industrielle, défend une thèse simple mais structurante : l'automatisation traditionnelle, conçue pour des séries longues et des processus répétitifs à l'infini, est devenue inadaptée aux réalités industrielles contemporaines. Dans une interview récente, il souligne que le modèle hérité de l'ère automobile, celui de lignes fixes pilotées par des robots ultra-spécialisés, a certes livré une efficacité remarquable à grande échelle, mais qu'il s'effondre face à des cycles produits raccourcis, des volumes de production fragmentés et une personnalisation croissante des biens manufacturés. L'enjeu est directement industriel : les intégrateurs et les directeurs opérationnels se heurtent à un coût de déploiement et de reprogrammation qui dépasse souvent la valeur générée dès lors que les séries deviennent courtes ou variables. Intrinsic parie sur une couche logicielle unifiée, capable d'abstraire les différences entre bras robotiques de marques distinctes et de réduire le temps de mise en oeuvre, là où aujourd'hui chaque changement de pièce ou de processus peut mobiliser des semaines d'ingénierie. La position de Nusser rejoint un consensus croissant dans le secteur : le goulot d'étranglement de la robotique industrielle n'est plus mécanique, il est logiciel. Intrinsic a été fondée en 2021 comme spin-off interne d'Alphabet (Google), avec pour mission explicite de démocratiser la programmation robotique via des outils logiciels et l'IA. Elle concurrence indirectement des acteurs comme Vention, Wandercraft sur le segment médical, ou encore les initiatives software-first de Fanuc et ABB, qui intègrent eux aussi des couches d'adaptabilité dans leurs écosystèmes. Les prochaines étapes pour Intrinsic tournent autour du déploiement commercial à plus grande échelle et de la démonstration que la flexibilité logicielle peut tenir ses promesses en environnement de production réel, et pas seulement en conditions de laboratoire.

IndustrielOpinion
1 source
Helix-02 assure désormais des quarts de 8 heures en usine sans intervention humaine
5127Interesting Engineering 

Helix-02 assure désormais des quarts de 8 heures en usine sans intervention humaine

Figure AI a annoncé le 13 mai 2026 que ses robots humanoïdes sont désormais capables d'assurer des postes de travail complets de huit heures de façon entièrement autonome, grâce à son système d'IA Helix-02. La startup californienne a publié une vidéo sur X montrant une équipe de robots opérant "à des niveaux de performance humaine" sans intervention humaine. Helix-02 est un réseau de neurones unifié qui fusionne la vision (caméras en tête et dans les paumes), le toucher (capteurs tactiles au bout des doigts), la proprioception et le contrôle du corps entier en un seul système d'apprentissage, remplaçant les architectures traditionnelles qui séparent contrôleurs de mouvement et de manipulation. La société a également présenté "System 0", un contrôleur neuronal corporel entraîné sur plus de 1 000 heures de données de mouvement humain, qui remplace plus de 109 000 lignes de code C++ artisanal. Les robots ont démontré des tâches à motricité fine incluant le dévissage de bouchons, l'extraction de médicaments depuis des organiseurs, le dosage précis de seringues et le tri de pièces métalliques dans des bacs encombrés. En mode multi-robots, deux humanoïdes ont réinitialisé une chambre entière en moins de deux minutes, sans contrôleur centralisé. Si les affirmations de continuité opérationnelle se confirment à l'échelle, ce passage de démonstrations de quelques minutes à des postes de huit heures représente un seuil industriel significatif pour les intégrateurs et les décideurs B2B. La fusion vision-toucher-proprioception dans un seul modèle neuronal constitue une architecture distincte des AMR actuels et adresse directement le "sim-to-real gap" que la plupart des VLA peinent encore à combler dans des environnements non contrôlés. La capacité de coordination inter-robots sans orchestrateur central est également notable pour les scénarios d'entrepôt et de montage à forte densité humaine. Il convient toutefois de souligner que les vidéos publiées sont sélectionnées par l'entreprise, et qu'aucune donnée indépendante sur les taux d'erreur, les interruptions non filmées ou la variabilité des tâches n'est disponible à ce stade. Figure AI s'appuie sur un déploiement réel déjà documenté chez BMW Group Plant Spartanburg, en Caroline du Sud, où ses robots Figure 02 (70 kg, 170 cm, charge utile 20 kg) auraient accompli des postes de 10 heures, contribué au déplacement de plus de 90 000 pièces et soutenu la production d'environ 30 000 véhicules. La société se positionne directement face à Tesla (Optimus), Agility Robotics (Digit) et Apptronik (Apollo), tous engagés dans une course à la commercialisation de robots humanoïdes polyvalents pour l'industrie. La prochaine étape pour Figure AI sera d'étendre ces déploiements au-delà du secteur automobile et de fournir des métriques vérifiables par des tiers, condition sine qua non pour convaincre les intégrateurs industriels d'aller au-delà du pilote.

HumanoïdesOpinion
1 source
Pince robotique inspirée de la pieuvre : souple pour agripper, rigide pour soulever
5128New Atlas Robotics 

Pince robotique inspirée de la pieuvre : souple pour agripper, rigide pour soulever

Des chercheurs de l'université de Pékin, de la National University of Singapore (NUS) et de l'université du Zhejiang ont conçu un préhenseur robotique s'inspirant de la mécanique des tentacules de pieuvre. Le principe : la structure adopte un état mou et déformable pour envelopper et saisir un objet irrégulier, puis se rigidifie pour assurer la prise en charge et le soulèvement. L'article source ne divulgue pas les métriques précises de charge utile ni les temps de cycle, ce qui limite l'évaluation indépendante des performances réelles. Cette approche par rigidité variable s'attaque à l'un des problèmes fondamentaux de la préhension robotique industrielle : un effecteur trop rigide brise les pièces fragiles, trop souple il perd sa charge ou manque de capacité de levage. Les mains humaines résolvent cet antagonisme grâce à la combinaison os-peau-muscles. Reproduire cette propriété en mécatronique ouvre la voie à des manipulateurs capables de traiter indifféremment des objets délicats (alimentaire, pharmaceutique) et des charges lourdes sur une même ligne, sans changement d'outillage. Le domaine des grippers bio-inspirés est actif : Festo (Allemagne) exploite les jets d'eau et structures pneumatiques depuis des années, Harvard Biodesign et Soft Robotics Inc. commercialisent des effecteurs en silicone gonflable, et plusieurs startups comme Soft Robotics (racheté par Piab en 2023) ont déjà industrialisé des solutions souples. Ce travail académique conjoint reste à ce stade une démonstration de laboratoire ; aucun partenariat industriel ni calendrier de transfert technologique n'est annoncé dans la publication disponible.

RecherchePaper
1 source
Automated Tire sort de la confidentialité avec son système robotisé SmartBay de changement de pneus
5129Robotics & Automation News 

Automated Tire sort de la confidentialité avec son système robotisé SmartBay de changement de pneus

Automated Tire, Inc. (ATI), startup américaine se présentant comme une entreprise de "physical AI", sort du mode stealth et annonce SmartBay, une plateforme robotique autonome destinée aux centres de service automobile. Le système cible en priorité trois opérations : le changement de pneumatiques, l'équilibrage de roues, et l'inspection de véhicules. La clientèle visée regroupe les concessions automobiles et les chaînes de service rapide. L'annonce ne communique pas encore de chiffres techniques précis (payload, degrés de liberté, temps de cycle) ni de tarification, ce qui limite l'évaluation concrète des performances réelles. L'automatisation du service bay automobile reste un segment largement sous-mécanisé : la majorité des opérations de montage et d'équilibrage sont encore réalisées manuellement dans les ateliers, avec une forte variabilité de qualité et des contraintes de pénurie de techniciens. Une solution robotique capable d'absorber ces tâches répétitives à cadence fiable représenterait un levier direct sur les coûts salariaux et la productivité pour les opérateurs multi-sites. Toutefois, l'affirmation "industry-first" avancée dans le communiqué mérite réserve : des acteurs comme Fori Automation et plusieurs intégrateurs OEM travaillent depuis des années sur la robotisation partielle de ces opérations. ATI, fondée autour du concept de modernisation du garage traditionnel, s'inscrit dans une vague plus large d'applications robotiques dans les services de proximité, aux côtés d'initiatives comme Machina Labs dans la métallurgie ou Machina Corp dans la logistique. L'entreprise n'a pas encore communiqué sur ses tours de financement, ses pilotes en cours, ni sur ses timelines de déploiement commercial, ce qui positionne cette annonce davantage comme un signal d'existence que comme un produit shipped.

IndustrielOpinion
1 source
Les robots humanoïdes plient, ramassent et manipulent des objets fragiles avec plus de précision grâce à une nouvelle technologie
5130Interesting Engineering 

Les robots humanoïdes plient, ramassent et manipulent des objets fragiles avec plus de précision grâce à une nouvelle technologie

Des chercheurs de Carnegie Mellon University (CMU) et du Bosch Center for AI ont publié un nouveau système d'IA baptisé HTD (Humanoid Transformer with Touch Dreaming), conçu pour améliorer la manipulation d'objets par des robots humanoïdes dans des environnements à contact complexe. Le framework combine l'apprentissage par imitation avec un module de prédiction tactile, permettant au robot d'anticiper l'évolution des forces de contact et du retour haptique avant et pendant la saisie. Testé sur cinq tâches réelles, insertion d'objet en T, rangement de livres, pliage de serviette, ramassage de litière et service du thé, HTD affiche une amélioration relative de 90,9 % du taux de réussite moyen par rapport à la baseline ACT, un modèle d'imitation de référence dans le domaine. Le système repose sur une architecture dissociée : un contrôleur bas-corps entraîné par renforcement en simulation via une méthode teacher-student stabilise l'orientation du torse, la vitesse et l'équilibre, tandis que la cinématique inverse et le retargeting de main gèrent les mouvements du haut du corps et la dextérité digitale. Les représentations tactiles ne sont pas reconstruites brutes mais encodées dans un espace latent compact via un réseau cible mis à jour lentement, ce qui filtre le bruit sensoriel et améliore la stabilité de la manipulation. Ce résultat est notable parce qu'il adresse directement l'un des verrous persistants de la robotique humanoïde : la cohabitation entre locomotion et manipulation fine sans dégradation mutuelle. La séparation architecturale bas/haut corps n'est pas nouvelle en soi, mais son intégration avec un modèle prédictif tactile dans une politique unifiée évite le recours à un pré-entraînement tactile séparé ou à un world model externe, ce qui simplifie le pipeline de déploiement. Les études d'ablation sont particulièrement instructives : incorporer le toucher comme entrée brute supplémentaire ne suffit pas, la prédiction dans l'espace latent apporte 30 % de gain relatif supplémentaire sur le raw tactile. Pour les intégrateurs qui envisagent des humanoïdes dans des cellules de manutention délicate, c'est un signal clair que la qualité de la représentation sensorielle prime sur la quantité de capteurs. HTD s'inscrit dans une vague de travaux cherchant à combler le sim-to-real gap pour la manipulation contact-riche. Le controller bas-corps a été entraîné sur le dataset AMASS, qui fournit des mouvements humains réalistes pour perturber le torse pendant l'apprentissage, une approche de robustification déjà utilisée dans des projets comme Isaac Lab de NVIDIA ou les travaux de Stanford sur whole-body control. Dans le paysage concurrentiel, Figure (Figure 03), Physical Intelligence (Pi-0), Boston Dynamics et 1X Technologies travaillent tous sur des architectures VLA (Vision-Language-Action) pour la manipulation généraliste, mais peu publient des résultats quantitatifs sur des tâches aussi précises que l'insertion de connecteurs ou la manipulation de textiles. CMU n'a pas encore annoncé de partenariat industriel ni de calendrier de transfert vers un produit commercial, mais le Bosch Center for AI comme co-auteur suggère un intérêt applicatif concret dans l'automatisation industrielle à manipulation variable.

RechercheOpinion
1 source
L'IA physique, trait d'union entre rentabilité et durabilité
5131The Robot Report 

L'IA physique, trait d'union entre rentabilité et durabilité

Omar Asali, président et directeur général de Ranpak, prendra la parole le 27 mai 2026 au Robotics Summit & Expo de Boston (Thomas M. Menino Convention & Exhibition Center, 14h30-15h15) pour présenter les résultats chiffrés de l'IA physique appliquée à la logistique d'entrepôt. Les métriques avancées par Ranpak dans des scénarios de déploiement réels sont les suivantes : réduction de 25 % de la consommation de carton ondulé (corrugate), diminution de 75 % du nombre de références boîtes (SKUs) en stock, et multiplication par 4 à 5 du débit de traitement. L'entreprise positionne ces gains comme une réfutation empirique du "dilemme vert", la présupposition largement répandue dans le secteur logistique selon laquelle les objectifs de durabilité entrent nécessairement en conflit avec la rentabilité opérationnelle. Le concept central mis en avant par Ranpak est celui d'IA physique (physical AI) : des systèmes embarqués, pilotés par capteurs, capables de caractériser en temps réel les objets manipulés pour adapter dynamiquement le format d'emballage. Contrairement aux approches purement logicielles (optimisation de tournées, prévision de la demande), l'IA physique agit directement sur le flux matière, ce qui explique l'impact simultané sur les coûts matière, le footprint de stockage et le débit. Pour un intégrateur ou un COO industriel, l'argument est structurant : si les chiffres sont confirmables à l'échelle, cela invalide le trade-off classique entre capex automation et ROI court terme, et rend les critères ESG directement commensurables aux KPIs opérationnels. Il convient toutefois de noter que les métriques présentées émanent d'un communiqué de promotion de conférence, sans méthodologie publiée ni périmètre de déploiement précisé, à vérifier avant toute extrapolation. Ranpak, fondée en 1972 et cotée au NYSE (PACK), est historiquement spécialisée dans les matériaux d'emballage protecteur en papier. L'entreprise a amorcé depuis 2019 un pivot vers l'automatisation, avec des acquisitions dans la robotique d'emballage (notamment Automated Packaging Systems et des partenariats avec des intégrateurs AMR). Sur le segment de l'optimisation d'emballage piloté par IA, Ranpak se positionne face à des acteurs comme Packsize (dimensionneurs on-demand), Sparck Technologies (boîtes sur-mesure automatisées) et, sur le volet logiciel pur, Nulogy ou Paccurate. Aucun acteur français ou européen de premier plan n'est directement cité dans ce contexte, bien qu'Enchanted Tools et Pollen Robotics travaillent sur des segments adjacents de manipulation en entrepôt. La prochaine étape observable sera la présentation elle-même le 27 mai, et d'éventuelles annonces de pilotes ou de partenariats associées au salon.

IndustrielActu
1 source
Alva Industries apporte sa technologie de moteurs sans cadre au Robotics Summit
5132The Robot Report 

Alva Industries apporte sa technologie de moteurs sans cadre au Robotics Summit

Alva Industries, fabricant norvégien de moteurs sans cadre (frameless motors) basé à Trondheim, sera présent au Robotics Summit & Expo 2026 les 27 et 28 mai au Thomas M. Menino Convention & Exhibition Center de Boston, stand 440. L'entreprise y exposera sa famille de moteurs SlimTorq, des moteurs sans cadre et sans encoches (slotless) conçus pour une haute densité de couple, un faible effet de crantage (cogging) et une intégration radiale compacte. La gamme vient de s'élargir avec le modèle STM-190-35, lancé récemment, qui apporte une capacité de couple accrue et une précision améliorée pour les applications d'entraînement direct exigeantes où compacité et liberté de conception sont critiques. Des unités d'évaluation seront disponibles en main sur le stand, avec des démonstrations interactives en continu sur les deux jours. Alva présentera également des échantillons de ses bobinages FiberPrinting, sa technologie propriétaire de fabrication de stators qui permettrait, selon l'entreprise, de produire des moteurs dans quasi n'importe quelle forme ou taille tout en maintenant un encombrement axial minimal et une gestion thermique supérieure, une affirmation à valider indépendamment à l'échelle. Pour les intégrateurs robotiques et les ingénieurs hardware, les moteurs sans cadre constituent un goulot d'étranglement réel dans la conception des articulations de robots humanoïdes et collaboratifs. La combinaison slotless + frameless répond directement au défi d'intégrer des actionneurs compacts à fort couple dans des joints robotiques, des exosquelettes ou des systèmes de positionnement de précision sans surcharge mécanique. Le fait qu'Alva propose des unités d'évaluation physiques au salon est un signal concret pour les équipes R&D en phase de sélection de composants : le discours commercial se confronte à la réalité du test d'intégration. La disponibilité de samples et l'accès direct aux ingénieurs Alva sont plus utiles, en pratique, qu'une keynote sur scène. Alva se positionne sur un marché où les acteurs établis incluent maxon (Suisse, également présent au Summit), Kollmorgen, Tecnotion et Allied Motion. La montée en puissance des robots humanoïdes depuis 2023 a fortement stimulé la demande en actionneurs compacts à fort couple, profitant aux fournisseurs de composants capables de répondre aux contraintes d'intégration des joints. Le Robotics Summit lui-même réunit cette année plus de 70 intervenants confirmés, dont Tesla, Toyota Research Institute, Harmonic Drive et PickNik Robotics, reflétant la convergence croissante entre IA embarquée et hardware. Pour Alva, Boston représente une vitrine stratégique auprès d'une audience d'ingénieurs et de décideurs directement en phase de prototypage ou de sélection de fournisseurs pour leurs prochaines générations de systèmes robotiques.

IndustrielActu
1 source
L'évolution de la connectivité visuelle en robotique : de l'USB et l'Ethernet au GMSL
5133Robotics Business Review 

L'évolution de la connectivité visuelle en robotique : de l'USB et l'Ethernet au GMSL

La connectivité vision dans les systèmes robotiques traverse une mutation structurelle. Pendant près d'une décennie, les intégrateurs ont déployé des caméras USB ou Ethernet (protocole GigE Vision) pour alimenter les pipelines de perception des robots. L'USB, bon marché et universellement supporté, suffisait au prototypage, mais ses contraintes de longueur de câble, sa latence non déterministe et sa charge CPU élevée l'ont rendu inadapté aux plateformes complexes. GigE Vision a ensuite étendu la portée et standardisé les interfaces entre fournisseurs, au prix d'un processeur embarqué sur chaque caméra pour packetiser les données, ajoutant latence et complexité réseau. Aujourd'hui, le GMSL (Gigabit Multimedia Serial Link), conçu initialement pour les systèmes caméra de l'automobile, s'impose comme alternative de référence dans les architectures robotiques de nouvelle génération. Ce standard transmet des images non compressées, un contrôle bidirectionnel et l'alimentation électrique sur un unique câble coaxial ou paire torsadée blindée, sur plusieurs mètres de portée, adapté aux plateformes mobiles et articulées. La tendance est claire : les robots modernes embarquent désormais huit capteurs d'images ou plus, répartis sur l'ensemble de la structure, pour des fonctions allant de l'évitement d'obstacles à la manipulation dextre et à l'interaction humain-robot. L'enjeu pour les intégrateurs et décideurs B2B est celui du déterminisme. Les systèmes USB et Ethernet souffrent d'arbitrage et de buffering qui introduisent une variabilité de latence incompatible avec la perception temps réel : boucles de contrôle pour la manipulation, fusion LiDAR-IMU-caméra, vision stéréo synchronisée. GMSL établit une liaison point-à-point dédiée par caméra vers un calculateur centralisé (GPU embarqué ou FPGA), éliminant ces aléas. C'est un changement d'architecture, pas simplement d'interface : le traitement migre vers un noeud central unique plutôt que d'être fragmenté sur chaque caméra. Pour les plateformes qui doivent fusionner données RGB, LiDAR, radar et IMU avec une synchronisation stricte - typiquement les humanoïdes et les AMR de nouvelle génération - ce déterminisme est une exigence fonctionnelle, pas un confort. Le GMSL est issu de l'industrie automobile, où Analog Devices (ADI), principal promoteur de la technologie, l'a développé pour répondre aux exigences des systèmes ADAS et de conduite autonome : robustesse électromagnétique, temps réel, longues portées de câble. Ce transfert technologique auto-vers-robotique s'inscrit dans une dynamique plus large du secteur, où plusieurs standards automotive (Ethernet TSN, MIPI CSI-2) trouvent des débouchés dans les plateformes robotiques. ADI n'est pas seul sur ce créneau : Texas Instruments et NVIDIA proposent leurs propres écosystèmes de connectivité vision pour la robotique, et le choix d'interface reste un facteur de différenciation dans les appels d'offres industriels. À noter que l'article source est publié par ADI lui-même, ce qui invite à lire les métriques comparatives avec le recul habituel vis-à-vis des communications techniques de fournisseurs. La prochaine étape du secteur sera probablement la standardisation : des consortiums comme MIPI Alliance travaillent à harmoniser les interfaces caméra pour faciliter l'interopérabilité entre fournisseurs de capteurs, de calculateurs et intégrateurs robot.

InfrastructureActu
1 source
GMSL et l'écosystème croissant autour des systèmes de vision pour la robotique
5134Robotics Business Review 

GMSL et l'écosystème croissant autour des systèmes de vision pour la robotique

Le standard GMSL (Gigabit Multimedia Serial Link), longtemps cantonné aux systèmes embarqués automobiles comme l'ADAS, s'impose progressivement dans les architectures de vision robotique industrielle. Selon Stephen Liu, responsable robotique chez Advantech, développeur de systèmes embarqués, environ un tiers des projets robotiques qu'il accompagne utilisent ou envisagent déjà des caméras GMSL. La technologie permet de transporter vidéo haute résolution, signaux de contrôle et synchronisation sur un unique câble léger, avec une latence déterministe et une résistance aux interférences électromagnétiques (EMI) significativement améliorée. Analog Devices (ADI), qui dispose d'un écosystème GMSL structuré -- modules caméra pré-validés, adaptateurs, BSP (Board Support Packages) et plateformes compatibles ROS -- positionne cette offre comme un raccourci entre preuve de concept et production de masse. L'adoption dépasse le stade POC : les plateformes AMR (robots mobiles autonomes) de logistique en sont les premiers utilisateurs en production, suivis par les robots humanoïdes, les stations de picking, les applications agricoles et certains usages en santé et construction. Ce glissement du GMSL vers la robotique répond à une contrainte système qui s'aggrave : à mesure que le nombre de capteurs embarqués augmente (caméras multiples, lidars, IMU), la gestion simultanée de la bande passante, de la latence et de la synchronisation devient le vrai goulot d'étranglement. Un décalage de quelques millisecondes entre les flux capteurs suffit à dégrader la précision de navigation. "Les robots ne font pas que voir, ils doivent décider et agir instantanément", résume Liu, ce qui impose une coordination serrée entre GPU, MPU et système d'exploitation temps réel. Dans des environnements difficiles -- vibrations, poussière, températures extrêmes, câblages longs dans des châssis compacts -- les contraintes d'ESD et d'intégrité de signal rendent les interfaces non-automotive-grade insuffisantes. Le GMSL apporte ici une robustesse éprouvée en conditions réelles, sans surcharger les équipes d'intégration d'une couche de développement bas niveau supplémentaire. La transition depuis l'automobile n'est pas anodine sur le plan industriel. Les chaînes d'outillage ADAS ont absorbé pendant une décennie les problèmes que la robotique affronte aujourd'hui : multiples caméras synchronisées, longues distances de câblage, tolérance zéro aux pannes de perception. ADI capitalise sur cet héritage pour proposer un écosystème directement transposable, réduisant les délais d'intégration de plusieurs mois à quelques semaines selon Advantech. Les concurrents directs sur ce segment -- notamment les acteurs proposant des solutions basées sur MIPI CSI-2 ou USB3 Vision -- restent pertinents pour les robots opérant en conditions contrôlées, mais peinent à répondre aux contraintes des déploiements extérieurs ou mobiles à longue durée. Les prochaines étapes portent sur l'extension vers les humanoïdes et les plateformes agricoles, segments où la densité sensorielle et la rugosité environnementale font du GMSL un candidat naturel face aux architectures plus conventionnelles.

InfrastructureOpinion
1 source
Unitree propose un mecha transformable géant à 650 000 dollars
5135The Verge 

Unitree propose un mecha transformable géant à 650 000 dollars

Unitree, l'un des fabricants de robots les plus prolifiques de Chine, a annoncé le GD01, un exosquelette habité de grande taille commercialisé au prix de 650 000 dollars. L'entreprise le décrit comme "le premier méca habité prêt à la production au monde", ce qui constitue une affirmation marketing significative. La vidéo de présentation montre l'engin démolir un mur de parpaings et basculer entre une posture bipède, évoquant le chariot élévateur piloté par Ellen Ripley dans Aliens, et une configuration alternative non précisée. Unitree n'explicite aucun cas d'usage industriel concret, ce qui est notable pour un produit à ce prix. L'absence de justification fonctionnelle est le premier signal d'alerte pour tout acheteur B2B. À 650 000 dollars, un tel engin se positionne bien au-delà des exosquelettes d'assistance industrielle (Sarcos, SuitX, Ottobock), mais sans les certifications ni les cas d'usage documentés qui légitiment ces prix dans les secteurs de la construction, de la défense ou de la logistique lourde. La démonstration retenue, casser des blocs de béton, est spectaculaire mais révèle peu sur la précision, la durée d'utilisation ou la sécurité opérateur. Le "production-ready" mérite d'être vérifié sur la durée. Unitree s'est imposé sur le marché robotique grand public et industriel avec ses quadrupèdes Go1/Go2 et ses humanoïdes H1 et G1, vendus à des prix nettement inférieurs à la concurrence. Le GD01 représente un pivot stratégique vers un segment radicalement différent, plus proche du concept art que du déploiement industriel immédiat. Dans la course aux robots humanoïdes, des acteurs comme Figure, Agility ou Boston Dynamics restent focalisés sur des plateformes autonomes; Unitree choisit ici de miser sur la curiosité médiatique autant que sur la faisabilité commerciale.

ExosquelettesOpinion
1 source
Comment les humanoïdes apprennent à interpréter leur environnement
5136Robotics Business Review 

Comment les humanoïdes apprennent à interpréter leur environnement

Intégrer un robot humanoïde dans un environnement partagé avec des humains exige une capacité perceptive quasi-instantanée sur plusieurs canaux simultanés. Analog Devices Inc. (ADI) détaille dans une publication récente les contraintes techniques concrètes de cette perception multi-sensorielle, à travers le regard de Geir Ostrem, Fellow ADI au sein de la division Automotive. La vision constitue le premier pilier : des capteurs RGB associés à des modules de profondeur (temps de vol, lumière structurée ou stéréovision) permettent à un humanoïde de cartographier son environnement en continu. Le défi n'est pas tant la capture d'image que le transport et le traitement de ces données en temps réel. Les capteurs étant éloignés du processeur central, le câblage représente une contrainte mécanique non négligeable. ADI y répond avec sa technologie GMSL (Gigabit Multimedia Serial Link), empruntée à l'automobile, capable de transporter plusieurs gigabits par seconde sur un flux unique, tout en permettant un traitement local embarqué plutôt qu'un envoi vers le cloud. L'audio constitue le deuxième pilier : microphones MEMS, beamforming et détection d'événements acoustiques permettent à un robot d'identifier une chute d'objet derrière lui ou d'engager une conversation en langage naturel, réduisant la friction opérationnelle avec les équipes humaines. Ce que cet article met en évidence, c'est que le vrai goulot d'étranglement dans le déploiement d'humanoïdes en milieu industriel n'est pas le mouvement ni la force, mais la latence perceptive et la confiance. Un robot qui réagit avec 200 ms de retard à un opérateur qui traverse son couloir reste dangereux, quelle que soit la sophistication de son bras. La répartition du traitement entre un processeur central et des unités dédiées proches des actionneurs, pattern déjà éprouvé en automotive et en robotique AMR, devient donc une question d'architecture système autant que de composants. Pour les intégrateurs industriels et les décideurs B2B, cela signifie que l'évaluation d'un humanoïde ne peut plus se limiter au payload ou aux degrés de liberté : il faut auditer la chaîne complète vision-audio-force et ses latences bout-en-bout. ADI occupe une position historiquement forte sur les capteurs inertiels (famille ADIS d'IMU), les convertisseurs analogique-numérique haute précision et, plus récemment, sur la transmission vidéo embarquée via GMSL, technologie aujourd'hui omniprésente dans les ADAS automobiles. La transposition de cette stack vers la robotique humanoïde s'inscrit dans une tendance plus large où les fournisseurs de composants automotive cherchent de nouveaux marchés à mesure que le design automobile se stabilise. Il convient de noter que cet article est une publication de contenu éditorial produit par ADI, non une analyse indépendante, ce qui colore naturellement le positionnement technologique présenté. Les concurrents directs sur ces briques (Texas Instruments sur les ToF et GMSL-équivalents, Sony sur les capteurs CMOS, Bosch et STMicroelectronics sur les MEMS audio et inertiels) ne sont pas mentionnés. Les prochaines étapes annoncées restent floues : aucun déploiement client nommé, aucune timeline précise, ce qui positionne ce contenu davantage comme une feuille de route technologique que comme l'annonce d'un produit shipé.

HumanoïdesActu
1 source
La convergence des systèmes de perception, de l'automobile aux robots
5137Robotics Business Review 

La convergence des systèmes de perception, de l'automobile aux robots

Une nouvelle génération de robots mobiles - AMR en entrepôts et hôpitaux, drones à longue autonomie, humanoïdes opérant aux côtés des humains - exige désormais des architectures de perception radicalement différentes de celles des décennies précédentes. Là où les capteurs jouaient autrefois un rôle secondaire dans le contrôle, ils constituent aujourd'hui l'entrée principale : la vision haute résolution guide la navigation et la manipulation dextère, le traitement audio multi-microphones permet la localisation sonore et l'interaction vocale, tandis que les capteurs de force et de toucher affinent la préhension et l'équilibre. Ces modalités doivent être synchronisées en temps réel pour alimenter la fusion sensorielle et les boucles de contrôle fermées. Le vrai défi n'est plus de concevoir un capteur isolé ou un modèle autonome, mais de faire fonctionner ensemble, de manière fiable, la perception, la connectivité, le calcul, l'énergie et la sécurité dans des environnements imprévisibles. Ce défi est précisément celui qu'a résolu l'industrie automobile en traitant le véhicule comme un système nerveux distribué : un réseau intégré de capteurs, de processeurs embarqués, de liaisons de communication et d'éléments de contrôle, conçu pour se comporter de façon prévisible dans des conditions réelles. La robotique converge aujourd'hui vers ce même modèle architectural. Pour les intégrateurs et les décideurs industriels, les implications sont concrètes : les données doivent arriver rapidement et de façon déterministe, les capteurs sont physiquement distribués à travers des articulations mobiles ou de longs câbles, et les défaillances doivent être détectables et localisables en temps réel. Les plateformes qui manquent d'observabilité sur l'intégrité des capteurs ou l'état énergétique deviennent de plus en plus fragiles à mesure que leur complexité augmente, rallongeant les cycles de débogage et rendant les déploiements terrain coûteux. A contrario, une architecture conçue avec des diagnostics embarqués et une connectivité déterministe réduit l'incertitude et transforme la sécurité en accélérateur d'itération plutôt qu'en contrainte. Analog Devices (ADI), fabricant de semi-conducteurs à l'interface des marchés automobile et des nouvelles mobilités, signe cette analyse pour promouvoir le transfert de ses technologies automotive-grade vers la robotique et les drones - un parti pris commercial qu'il convient de garder à l'esprit. Ces composants ont été développés sous des contraintes sévères : conditions électriques difficiles, enveloppes thermiques étroites, durées de vie longues et tolérance zéro aux défaillances silencieuses. Des liaisons vision haute bande passante et faible latence permettent, par exemple, la perception multi-caméra sur de grandes structures robotiques, tandis que des réseaux audio déterministes supportent la localisation sonore et l'interaction naturelle avec les humains. ADI se positionne ainsi face à NVIDIA (Jetson, Isaac), Qualcomm et Texas Instruments dans la fourniture de briques de traitement embarqué pour robots et drones. L'article ne cite aucun déploiement en volume ni chiffre de performance concret - il relève davantage du positionnement stratégique que du retour terrain, et les prochaines étapes évoquées restent au stade des perspectives génériques.

InfrastructureActu
1 source
SAP et Cyberwave déploient des robots autonomes à base d'IA dans un entrepôt logistique SAP
5138Robotics & Automation News 

SAP et Cyberwave déploient des robots autonomes à base d'IA dans un entrepôt logistique SAP

SAP, premier éditeur mondial de logiciels ERP avec plus de 300 000 clients dans 180 pays, et Cyberwave, startup spécialisée en logiciels IA pour la robotique, ont annoncé le déploiement de robots autonomes alimentés par intelligence artificielle dans un entrepôt logistique SAP en activité. Le communiqué ne précise pas les caractéristiques techniques des robots (payload, degrés de liberté, temps de cycle), ni les volumes traités, ni la localisation géographique du site. Cette initiative s'inscrit dans la stratégie "Physical AI" que SAP a formellement annoncée en 2025. Ce déploiement est notable parce qu'il marque un glissement de rôle pour SAP : l'éditeur ne se contente plus de fournir les logiciels WMS (Warehouse Management System) qui orchestrent la logistique, il opère désormais directement des robots autonomes dans ses propres installations. Pour les intégrateurs et les DSI industriels, cela pose une question concrète : SAP cherche-t-il à absorber la couche middleware robotique dans sa suite, réduisant la marge de manoeuvre des spécialistes tiers ? La distinction entre annonce de déploiement et mise en production pérenne reste à confirmer, le communiqué ne donnant pas de métriques opérationnelles vérifiables. Cyberwave, fondée pour développer des couches logicielles d'autonomie pour robots industriels, s'appuie ici sur l'intégration native avec l'écosystème SAP comme argument commercial différenciant. Dans l'espace AMR pour entrepôts, la concurrence est dense : Exotec (France, déjà déployé chez Decathlon et Fnac-Darty), Locus Robotics, Körber et Boston Dynamics se disputent les grands comptes. L'absence de chiffres concrets dans cette annonce invite à attendre une communication plus étoffée avant d'évaluer l'impact réel du partenariat.

FR/EU ecosystemeOpinion
1 source
Festo présente une pince robotique à base d'IA pour la manipulation de produits variés
5139Robotics & Automation News 

Festo présente une pince robotique à base d'IA pour la manipulation de produits variés

Festo, l'équipementier allemand spécialisé en automatisation industrielle, a annoncé le lancement de GripperAI, un logiciel universel basé sur l'intelligence artificielle destiné à piloter des préhenseurs robotiques dans des environnements multi-produits. La solution cible un problème récurrent sur les lignes de production mixtes : lorsqu'une cellule robotisée doit saisir des produits de formes et de tailles variables, l'approche traditionnelle impose une reprogrammation manuelle, une intégration applicative spécifique et le recours à des systèmes de vision 3D coûteux. GripperAI se positionne comme une couche logicielle capable d'absorber cette variabilité sans redéveloppement à chaque référence. L'enjeu industriel est direct : le coût et la durée d'intégration sont aujourd'hui l'un des principaux freins au déploiement de cellules robotisées dans les environnements à forte diversité de SKU, logistique, agroalimentaire, manufacturier léger. Si GripperAI tient sa promesse de réduire la dépendance aux caméras 3D dédiées et à la programmation cas par cas, il pourrait abaisser significativement le seuil d'entrée pour les intégrateurs. Il convient de noter que Festo ne publie pas encore de métriques de cycle ou de taux de succès de préhension dans le communiqué disponible, ce qui rend toute évaluation de performance prématurée à ce stade. Festo est historiquement connu pour ses actionneurs pneumatiques et ses solutions bioinspirées (BionicCobot, Bionic Flying Fox), mais s'oriente depuis plusieurs années vers des briques logicielles pour robot-as-a-service. Sur ce segment des préhenseurs universels pilotés par IA, la concurrence est déjà positionnée : Robai, Righthand Robotics (racheté par BD), ainsi que des solutions vision-first comme Osaro ou CapSen Robotics. La prochaine étape pour Festo sera de démontrer GripperAI sur des configurations réelles en production, avec des données de performance publiées et des références clients vérifiables.

FR/EU ecosystemeOpinion
1 source
Fabrication industrielle par cellules robotisées et solutions de chargement machine
5140Robotics & Automation News 

Fabrication industrielle par cellules robotisées et solutions de chargement machine

Les cellules robotisées et les solutions de machine tending redéfinissent l'organisation des lignes de production industrielles. Ces dispositifs combinent un robot manipulateur, des équipements périphériques (préhenseurs, convoyeurs, systèmes de vision) et une enceinte de sécurité pour automatiser des tâches répétitives : chargement et déchargement de machines-outils CNC, presses, centres d'usinage ou moulage par injection. L'objectif central est de réduire les temps morts machine et de rendre possible le fonctionnement en mode "lights-out", c'est-à-dire sans opérateur présent. L'enjeu industriel est direct : le taux d'utilisation d'une machine-outil tenue manuellement oscille typiquement entre 60 et 70 %, là où une cellule automatisée peut dépasser 90 % sur trois équipes. Pour un intégrateur ou un directeur d'exploitation, c'est le levier de retour sur investissement le plus mesurable de l'automatisation en atelier. La montée en puissance des cobots (robots collaboratifs, sans cage de protection systématique) d'acteurs comme Universal Robots, FANUC ou KUKA abaisse aujourd'hui le seuil d'entrée pour les PME industrielles, qui représentent une part croissante des déploiements. Ce mouvement s'inscrit dans une décennie de convergence entre robotique industrielle classique et flexibilité logicielle. Les principaux fournisseurs de cellules clés en main (ABB, Yaskawa, Stäubli, et en Europe des intégrateurs comme Actemium ou BA Systèmes) proposent désormais des offres modulaires reconfigurables, réduisant les délais de mise en service. La prochaine étape visible du secteur est l'intégration de perception 3D et de planification de trajectoire adaptative, pour traiter des pièces sans fixation rigide, dernier verrou technique majeur avant une adoption plus large dans la sous-traitance mécanique.

IndustrielOpinion
1 source
PL-Universe Robotics dévoile sa gamme de produits d'IA physique industrielle 2.0
5141Pandaily 

PL-Universe Robotics dévoile sa gamme de produits d'IA physique industrielle 2.0

PL-Universe Robotics, start-up chinoise créée il y a seize mois, a présenté ce qu'elle nomme sa "Product Matrix 2.0", articulée autour de deux produits : AcCI, une solution de collecte de données multi-modale affichant une précision annoncée sub-millimétrique, et Dabai, un module robotique dédié au chargement et déchargement industriel intelligent. AcCI combine des interfaces de contrôle VR, maître-esclave et joystick, et capture simultanément des données de force, de couple, de pose, de retour tactile et de vision en boucle fermée. L'annonce s'accompagne d'une stratégie d'écosystème qualifiée d'"all-domain symbiotic" et d'un appel ouvert à des partenaires industriels mondiaux. L'enjeu déclaré est le goulot d'étranglement des données dans le déploiement à grande échelle de l'IA physique, un problème que le secteur reconnaît largement. Une plateforme de collecte end-to-end multi-modale, si elle tient ses promesses, répondrait à un besoin concret pour les intégrateurs cherchant à constituer des jeux de données de démonstration de qualité industrielle. Cependant, cette annonce reste au stade déclaratif : aucun client n'est nommé, aucun volume de déploiement n'est communiqué, et la précision sub-millimétrique est avancée sans conditions de test ni contexte de tâche précisés, ce qui rend toute évaluation indépendante impossible pour l'instant. PL-Universe s'inscrit dans un écosystème très concurrentiel : en Chine, Unitree Robotics et DEEP Robotics avancent sur le déploiement d'humanoïdes industriels, tandis qu'à l'international, Physical Intelligence avec Pi-0, Apptronik et 1X Technologies ont déjà des bases installées ou des contrats actifs sur des pipelines de données robotiques. La société cible un marché qu'elle évalue à "plusieurs milliers de milliards de yuans", une projection ambitieuse et invérifiable à ce stade. Aucune tarification ni date de disponibilité commerciale n'a été précisée ; la prochaine étape annoncée est le recrutement de partenaires d'écosystème à l'échelle mondiale, selon un modèle stratégique que l'entreprise décrit comme "1+N+infini".

Chine/AsieActu
1 source
SEVO : observation virtuelle enrichie sémantiquement pour la manipulation VLA robuste par éclairage actif et collecte de données
5142arXiv cs.RO 

SEVO : observation virtuelle enrichie sémantiquement pour la manipulation VLA robuste par éclairage actif et collecte de données

Des chercheurs publient sur arXiv (arXiv:2605.11114, mai 2025) une méthode baptisée SEVO (Semantic-Enhanced Virtual Observation) visant à résoudre l'un des problèmes les plus documentés des politiques VLA (Vision-Language-Action) et d'apprentissage par imitation : leur effondrement dès qu'elles quittent l'environnement d'entraînement. Sans modification de l'architecture du modèle, SEVO agit sur le flux caméra RGB brut via trois mécanismes combinés : des caméras fixes sur le corps du robot dont les champs de vision couvrent l'intégralité de l'espace de manipulation, un éclairage actif en spectre rouge qui normalise physiquement l'apparence des objets, et une segmentation YOLO en temps réel qui produit une représentation sémantique invariante au fond. Les tests portent sur des bouteilles d'eau transparentes -- objets délibérément difficiles car ils se confondent visuellement avec leur environnement -- dans une tâche de pick-and-place répétée sur deux plateformes mobiles. Avec SEVO, la politique ACT atteint 95 % de succès en environnement d'entraînement et 85 % en environnement inédit ; SmolVLA atteint 83 % et 75 % respectivement. Sans SEVO, ces mêmes politiques plafonnent à 75 %/70 % en entraînement et s'effondrent à 30-35 % hors contexte. Ces résultats remettent directement en cause le paradigme dominant qui consiste à compenser le manque de robustesse par une mise à l'échelle des modèles. Les praticiens de la communauté open source rapportaient déjà des taux de transfert quasi nuls avec les benchmarks ACT et SmolVLA standards, pourtant affichant des scores élevés en laboratoire. SEVO démontre que la conception de l'observation -- ce que le robot "voit" et comment -- combinée à une diversification systématique des données de téléopération (variations d'éclairage, de fond, d'objets distracteurs) constitue le levier de généralisation le plus efficace, bien devant le choix du modèle. Pour un intégrateur ou un COO industriel, l'implication est directe : un robot à bas coût bien "observé" et entraîné sur des données variées surpasse un modèle plus sophistiqué entraîné dans des conditions homogènes. Le contexte est celui de l'essor des toolchains communautaires autour des VLA, notamment les frameworks lekiwi et SO-101 sur lesquels ACT et SmolVLA sont régulièrement évalués. La "sim-to-real gap" et le "domain shift" sont des problèmes ouverts depuis des années dans la manipulation robotique ; des approches comme domain randomization ou data augmentation tentaient déjà d'y répondre par le calcul. SEVO prend le parti inverse : agir sur le hardware d'observation et le protocole de collecte plutôt que sur l'architecture ou la puissance de calcul. Les suites logiques de ces travaux incluent l'extension à des tâches multi-étapes, à des objets plus variés, et potentiellement à des bases mobiles commerciales -- un terrain sur lequel des acteurs comme Boston Dynamics (Spot), AgileX ou les startups européennes de manipulation à coût réduit sont directement concernés.

IA physiqueOpinion
1 source
Correspondance de flux équivariante morphologiquement pour la manipulation mobile bimanuelles
5143arXiv cs.RO 

Correspondance de flux équivariante morphologiquement pour la manipulation mobile bimanuelles

Des chercheurs ont publié en mai 2026 (arXiv:2605.12228) une méthode d'apprentissage par imitation qui exploite la symétrie bilatérale des robots bimanuels mobiles pour améliorer leur efficacité d'entraînement et leur généralisation. L'approche, baptisée C₂-equivariant flow matching, formalise la symétrie réflective inhérente aux robots bimanuels autour de leur plan sagittal (le plan vertical séparant le côté gauche du côté droit) et l'intègre directement dans l'architecture de la politique de contrôle. Deux mécanismes d'application sont proposés : une perte d'entraînement régularisée ou un réseau de vitesse intrinsèquement équivariant. La méthode est évaluée sur des tâches de manipulation planaires et en 6 degrés de liberté (6-DoF), puis validée en conditions réelles sur un robot TIAGo++ de PAL Robotics (Barcelone, Espagne). L'intérêt de cette contribution tient à une observation structurelle peu exploitée : savoir accomplir une tâche dans une configuration donnée détermine mécaniquement la solution pour sa configuration en miroir. Pourtant, la quasi-totalité des méthodes d'imitation learning actuelles (ACT, Diffusion Policy, et leurs dérivés) ignorent cette contrainte. En l'intégrant comme biais inductif, les auteurs montrent que les politiques résultantes sont ambidextres et généralisent à zéro-shot vers des configurations en miroir absentes des données d'entraînement. Concrètement, cela réduit le volume de démonstrations nécessaires et supprime le besoin de collecter symétriquement les trajectoires des deux côtés. Pour un intégrateur ou un opérateur industriel déployant un système bimanuel, c'est un levier direct sur le coût de téléopération et de labellisation des données, deux postes majeurs dans le déploiement de la robotique généraliste. Le flow matching est une alternative aux modèles de diffusion : il apprend un champ de vitesse qui transporte une distribution simple vers la distribution cible des actions, avec une formulation plus directe et un entraînement souvent plus stable. Son efficacité en apprentissage robotique a déjà été démontrée par Physical Intelligence avec pi0, qui en fait le coeur de sa politique généraliste. La contribution ici complète ce cadre en y injectant une contrainte de symétrie morphologique, un biais générique potentiellement applicable à toute architecture équivariante. Face aux approches concurrentes de Stanford (Mobile ALOHA), CMU ou des équipes de Boston Dynamics, la méthode se distingue par son caractère généraliste : les auteurs suggèrent que la symétrie exploitée est extensible à d'autres classes de robots présentant des propriétés géométriques analogues, au-delà des seuls humanoïdes bimanuels.

RecherchePaper
1 source
Hallucination d'action dans les modèles vision-langage-action (VLA) génératifs
5144arXiv cs.RO 

Hallucination d'action dans les modèles vision-langage-action (VLA) génératifs

Des chercheurs ont publié sur arXiv (référence 2602.06339, version 2, février 2026) une analyse théorique des hallucinations d'action dans les modèles VLA (Vision-Language-Action), ces architectures de fondation qui promettent une généralisation large pour le contrôle robotique de bout en bout. L'étude, centrée sur les politiques génératives à variables latentes, identifie trois catégories de barrières structurelles qui provoquent des hallucinations, c'est-à-dire des actions générées violant des contraintes physiques du monde réel : une barrière topologique (liée à la topologie de l'espace d'action), une barrière de précision (résolution insuffisante pour les tâches fines), et une barrière d'horizon (dégradation des performances sur les séquences longues). Ces barrières ne sont pas des artefacts d'implémentation corrigeables à la marge, mais des inadéquations structurelles entre l'espace des comportements robots physiquement réalisables et les architectures de modèles courantes. La portée de ce travail dépasse le cadre académique : il fournit des explications mécanistes aux échecs empiriques régulièrement rapportés lors du déploiement de politiques VLA en conditions réelles, et remet en question une hypothèse dominante du secteur selon laquelle les modèles de fondation généralistes résoudraient intrinsèquement le problème de génération d'action en robotique incarnée. Pour les intégrateurs et les équipes R&D industrielles, cela signifie que des phénomènes observés en déploiement, comme des mouvements incohérents, des échecs sur des tâches longues ou des erreurs de précision fine, ont une origine architecturale identifiable, et non pas seulement un déficit de données d'entraînement. Les auteurs soulignent que ces limitations imposent des compromis inévitables, et non des problèmes résolubles uniquement par le scaling ou l'augmentation des datasets. Le champ des VLAs s'est considérablement densifié depuis 2023 avec des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA (open-source) ou encore RT-2 de Google DeepMind, qui font tous le pari d'une politique robotique unifiée entraînée sur des données massives. Cette étude apporte une perspective critique et formalisée dans un domaine encore largement dominé par des démonstrations en environnements contrôlés, souvent sans publication des métriques d'échec. Les auteurs ne proposent pas d'abandonner l'approche générative, mais tracent des directions pour améliorer fiabilité et robustesse sans sacrifier la puissance expressive de ces architectures, un prérequis non négociable pour franchir le seuil du déploiement industriel réel.

IA physiqueOpinion
1 source
Surmonter l'aveuglement aux dynamiques : correction de vitesse et de trajectoire sans entraînement pour les modèles VLA
5145arXiv cs.RO 

Surmonter l'aveuglement aux dynamiques : correction de vitesse et de trajectoire sans entraînement pour les modèles VLA

Des chercheurs ont publié mi-mai 2026 sur arXiv (référence 2605.11459) une méthode baptisée "Pace-and-Path Correction" pour corriger un angle mort structurel des modèles VLA (Vision-Language-Action). Ces modèles, socle technique des bras manipulateurs de nouvelle génération, sont entraînés sur des observations à image unique (single-frame), ce qui les rend incapables de percevoir les dynamiques temporelles lors de l'exécution d'une séquence planifiée. En pratique, dès qu'un objet bouge pendant que le robot exécute un "action chunk", les performances chutent sévèrement, même après fine-tuning sur des datasets dynamiques. L'opérateur proposé s'applique à l'inférence sans ré-entraînement, comme une couche wrapper autour de tout VLA à action chunking, et se décompose en deux canaux orthogonaux issus d'une minimisation de coût quadratique unique : un canal "pace" compressant l'exécution le long de la trajectoire prévue, et un canal "path" appliquant un décalage spatial orthogonal pour absorber les perturbations dynamiques dans la fenêtre temporelle du chunk. Évalué sur MoveBench, un benchmark conçu pour isoler le mouvement comme seule variable contrôlée, la méthode améliore le taux de succès de 28,8 points de pourcentage en environnement purement dynamique et de 25,9 points en contexte mixte statique-dynamique, surpassant les VLAs de base ainsi que les approches dynamiques-adaptatives existantes. L'enjeu est directement opérationnel : les VLAs actuels comme pi-0 de Physical Intelligence, OpenVLA ou GR00T N2 de Nvidia peinent dès qu'un convoyeur avance ou qu'un opérateur interfère avec la scène, soit le cas standard en environnement industriel réel. Corriger ce "dynamics gap" exigeait jusqu'ici un ré-entraînement coûteux, souvent rédhibitoire pour un intégrateur sans infrastructure ML dédiée. Le caractère training-free de Pace-and-Path Correction signifie qu'elle peut s'intégrer sur un modèle déjà déployé sans modifier les poids ni la pipeline d'apprentissage, abaissant drastiquement la barrière d'adoption pour des déploiements en conditions réelles. La "dynamics-blindness" des VLAs est une critique récurrente depuis l'émergence de pi-0 et OpenVLA en 2024-2025, la majorité des démonstrations publiques ayant lieu sur scènes statiques et laissant ouvert le demo-to-reality gap dès que les conditions industrielles se compliquent. Ce travail s'inscrit dans la course à la manipulation robuste que se livrent Nvidia, Figure (Figure 03), Boston Dynamics et 1X Technologies. Aucun acteur français n'est directement cité, mais les conclusions intéressent des intégrateurs comme Exotec et des équipes de recherche comme le LAAS-CNRS travaillant sur la manipulation en environnement non-structuré. La prochaine étape logique est une validation sur hardware réel - le papier reste à ce stade un benchmark simulé - et une intégration dans des stacks open-source comme LeRobot de Hugging Face.

IA physiqueOpinion
1 source
Combler l'écart d'exécution : des contraintes sémantiques de mouvement au contrôle cinématique
5146arXiv cs.RO 

Combler l'écart d'exécution : des contraintes sémantiques de mouvement au contrôle cinématique

Une équipe de chercheurs publie sur arXiv (réf. 2605.12053, mai 2026) un framework open source baptisé Giskard, conçu pour combler ce que les auteurs nomment le "Motion Execution Gap" : l'écart entre les descriptions symboliques de tâches robotiques, exprimées sous forme de contraintes sémantiques de haut niveau, et les commandes cinématiques réellement exécutables par un robot. La pièce centrale est le concept de Motion Statecharts, une représentation symbolique exécutable permettant d'organiser des contraintes de mouvement, des moniteurs d'état et des statecharts imbriqués en parallèle ou en séquence. L'exécution repose sur une implémentation par MPC linéaire (lMPC) de l'approche task-function, avec des bornes sur le jerk pour assurer des transitions fluides lors des changements de tâche. La généralisation entre morphologies est rendue possible par un modèle cinématique du monde différentiable et unifié, couvrant simultanément le robot et son environnement. La méthode a été déployée et validée sur huit plateformes robotiques distinctes opérant dans des environnements variés. Ce travail s'attaque à un goulot d'étranglement structurel bien identifié dans la communauté : les planificateurs symboliques issus de l'IA cognitive ou de la planification classique décrivent ce qu'il faut faire, mais la translation vers des trajectoires cinématiques sûres et fluides reste un défi persistant. La démonstration sur huit plateformes différentes constitue un signal fort de transferabilité inter-plateformes, là où la majorité des solutions de génération de mouvement restent étroitement liées à une architecture matérielle spécifique. Pour un intégrateur ou un COO industriel, la spécification "world-centric" proposée promet de réduire concrètement le coût de réadaptation lors d'un changement de cellule robotique ou de morphologie. Giskard est issu du groupe CRAM (Cognitive Robot Abstract Machine) de l'Université de Brême, acteur européen de référence en robotique cognitive. L'approche task-function sur laquelle s'appuie le framework est une méthode de contrôle éprouvée, mais son intégration avec une représentation symbolique exécutable et multi-niveaux via statecharts est moins courante. Les solutions concurrentes dans l'écosystème production incluent MoveIt (ROS, très répandu mais limité sur les transitions de tâches complexes) et les planificateurs réactifs à base d'arbres de comportement. Ce document est un preprint arXiv, non encore évalué par les pairs : les résultats sur les huit plateformes restent à confirmer par une reproduction indépendante. La publication du code source sur GitHub (github.com/cram2/cognitive\robot\abstract\_machine) offre toutefois une base tangible pour que la communauté robotique puisse en évaluer la portée réelle.

RecherchePaper
1 source
TMRL : un préentraînement modulé par pas de temps de diffusion pour explorer et affiner efficacement les politiques
5147arXiv cs.RO 

TMRL : un préentraînement modulé par pas de temps de diffusion pour explorer et affiner efficacement les politiques

Une équipe du Weird Lab de l'Université de Washington a publié en mai 2026, sur arXiv (2605.12236), un cadre unifié baptisé TMRL (Timestep-Modulated Reinforcement Learning) pour accélérer le fine-tuning par apprentissage par renforcement (RL) de politiques robotiques pré-entraînées. Le système repose sur deux composantes : Context-Smoothed Pre-training (CSP), qui injecte du bruit de diffusion directe dans les entrées de la politique lors du pré-entraînement, et TMRL lui-même, qui apprend à moduler dynamiquement le pas de temps de diffusion pour contrôler explicitement l'exploration lors du fine-tuning. Les résultats présentés incluent des tâches de manipulation réelle complexes, avec un fine-tuning en conditions réelles achevé en moins d'une heure. Le cadre est compatible avec des entrées hétérogènes : états proprioceptifs, nuages de points 3D ou politiques VLA (Vision-Language-Action) basées sur des images. Le verrou technique adressé est structurel : le pré-entraînement par clonage comportemental (BC), dominant dans la robotique d'apprentissage, produit des distributions d'actions étroites centrées sur les démonstrations existantes, ce qui prive le RL aval de la couverture nécessaire pour explorer efficacement l'espace d'états. TMRL casse ce goulot en faisant du niveau de bruit de diffusion un paramètre entraînable : à fort timestep, la politique explore largement ; à faible timestep, elle exploite avec précision. Le résultat annoncé est une amélioration de l'efficacité en données lors du fine-tuning RL, ce qui est critique pour les déploiements réels où chaque essai coûte du temps machine et de l'usure mécanique. Les métriques précises de sample efficiency et les benchmarks utilisés ne sont pas détaillés dans l'abstract, ce qui rend l'évaluation indépendante difficile sans consulter l'article complet. Ce travail s'inscrit dans une dynamique active autour des politiques de diffusion pour la robotique, popularisées par π0 de Physical Intelligence et les travaux GR00T N2 de NVIDIA. Le problème exploration-exploitation en RL robotique réel reste un obstacle majeur à la commercialisation : les approches existantes comme la perturbation d'action aléatoire ou l'exploration guidée par curiosité peinent à passer à l'échelle sur du matériel réel. TMRL propose une solution intégrée au pipeline de diffusion existant, sans modifier l'architecture de la politique. Le code et les vidéos sont disponibles en open source, ce qui facilitera l'évaluation par la communauté ; les prochaines étapes probables incluent des évaluations sur plateformes humanoïdes et une intégration dans des frameworks comme LeRobot ou OpenVLA.

RechercheOpinion
1 source
Benchmark exclusivement proprioceptif pour l'estimation d'état des quadrupèdes : ATE, RPE et compromis entre filtres et lisseurs
5148arXiv cs.RO 

Benchmark exclusivement proprioceptif pour l'estimation d'état des quadrupèdes : ATE, RPE et compromis entre filtres et lisseurs

Une équipe du laboratoire DLS (Dynamic Legged Systems) de l'IIT (Istituto Italiano di Tecnologia) publie un benchmark comparatif de trois estimateurs d'état proprioceptifs pour robots quadrupèdes : MUSE, le filtre de Kalman étendu invariant (IEKF) et le lisseur invariant (IS). L'évaluation est conduite sur la séquence CYN-1 du GrandTour Dataset, avec trois métriques : l'ATE (Absolute Trajectory Error, précision long terme), la RPE translationnelle et rotationnelle (Relative Pose Error, précision court terme), et le temps de calcul par mise à jour sur un stack matériel et logiciel fixe. Les résultats montrent que les RPE restent comparables entre les trois approches, mais IEKF et IS surpassent MUSE sur l'ATE. Le temps de calcul diffère significativement, exposant des compromis précision-latence concrets selon la méthode choisie. L'ensemble du code d'évaluation est publié en open-source sur GitHub (iit-DLSLab/stateestimationbenchmark) pour une reproductibilité complète. L'estimation d'état proprioceptive, c'est-à-dire sans capteurs extéroceptifs comme lidars ou caméras, est critique pour les quadrupèdes opérant en milieux dégradés ou occludés. Ce travail fournit aux intégrateurs et ingénieurs robotique des critères de sélection concrets : si l'application tolère une latence plus élevée, IS ou IEKF offrent une meilleure cohérence de trajectoire à long terme ; si la contrainte est temps-réel strict, le compromis bascule vers MUSE. La publication du code complet renforce la valeur de l'étude : les équipes peuvent reproduire les benchmarks sur leur propre matériel, ce qui reste rare dans la littérature robotique comparative, où les affirmations de performance sont souvent difficiles à vérifier indépendamment. L'IIT-DLSLab est historiquement actif sur la locomotion dynamique (plateforme HyQ, puis travaux sur des robots de classe Spot), et ce benchmark s'inscrit dans un effort plus large de standardisation de l'évaluation des estimateurs d'état pour robots à pattes via le GrandTour Dataset. IEKF est un classique de l'estimation sur groupes de Lie, IS en est une extension offline à lissage, tandis que MUSE représente une approche plus récente. Des travaux concurrents existent chez ETH Zurich (ANYmal) et Carnegie Mellon, mais peu publient des benchmarks comparatifs indépendants à ce niveau de rigueur méthodologique. La prochaine étape naturelle serait d'élargir l'évaluation à d'autres séquences du GrandTour Dataset, notamment sur des terrains non structurés, pour tester la généralisation des conclusions.

FR/EU ecosystemePaper
1 source
Évaluation hors-ligne des politiques de manipulation via une formulation de vivacité actualisée
5149arXiv cs.RO 

Évaluation hors-ligne des politiques de manipulation via une formulation de vivacité actualisée

Des chercheurs ont publié en mai 2026 (arXiv:2605.11479) un cadre pour l'évaluation hors-ligne de politiques robotiques de manipulation. Le problème : estimer la performance d'une politique sans la déployer en environnement réel à chaque itération. Les systèmes de manipulation modernes cumulent trois obstacles majeurs : récompenses rares (sparse rewards), progression non monotone vers l'objectif (le robot recule avant de réussir), et rollouts d'évaluation de longueur finie. Cette dernière contrainte génère un biais de troncature qui invalide les méthodes classiques fondées sur l'équation de Bellman, conçues pour un horizon infini. Les auteurs proposent un opérateur de Bellman basé sur la liveness (vivacité, issue de la vérification formelle), reformulant l'évaluation comme un problème de complétion de tâche et produisant une fonction de valeur conservative à point fixe garanti par contraction. Les expériences portent sur deux tâches simulées (une politique VLA - Vision-Language-Action - et une diffusion policy), ainsi qu'un pliage de tissu à partir de démonstrations humaines. La méthode surpasse TD(0) et Monte Carlo sur tous les benchmarks, à la fois en fidélité à la progression réelle et en réduction du biais. L'enjeu est concret pour les équipes de déploiement : les rollouts physiques sont lents et coûteux, et une évaluation hors-ligne biaisée contamine les décisions de sélection de modèle. Le biais de troncature est particulièrement insidieux dans les tâches longues : un bras robotique qui récupère après un glissement peut scorer négativement même s'il complète la tâche. La formulation liveness encode la progression vers l'objectif y compris lors de comportements non monotones, sans horizon infini artificiel. Ce type de métrique calibrée est directement utile pour valider des politiques VLA comme pi0 (Physical Intelligence) ou GR00T N2 (NVIDIA), souvent évaluées sur des rollouts courts et sélectifs avant déploiement en atelier. Ce travail s'inscrit dans une problématique active du robot learning : évaluer des politiques sans simulation parfaite ni horizon infini. TD(0), Monte Carlo et importance sampling peinent sur les tâches longues à récompenses éparses, régime typique de la manipulation dextre. Plusieurs équipes adressent l'évaluation hors-ligne, notamment autour du dataset DROID (Berkeley/Stanford) et chez Physical Intelligence, mais sans traitement explicite du biais de troncature. La preuve de contraction de l'opérateur liveness ouvre des pistes vers des pipelines de sélection automatique de politiques et vers la validation à grande échelle avant passage en production.

IA physiquePaper
1 source
RIO : un système d'entrées/sorties robotiques flexible et en temps réel pour l'apprentissage multi-plateforme
5150arXiv cs.RO 

RIO : un système d'entrées/sorties robotiques flexible et en temps réel pour l'apprentissage multi-plateforme

Une équipe de chercheurs présente RIO (Robot I/O), un framework Python open source publié en mai 2026 (arXiv:2605.11564), conçu pour standardiser les flux de travail en apprentissage robotique multi-plateformes. RIO propose des composants modulaires couvrant le contrôle robot, la téleopération, la mise en forme des données, la configuration des capteurs et le déploiement de politiques d'action (policies). Le framework a été validé sur trois morphologies distinctes, bras unique, bimanuel et humanoïde, sur quatre plateformes matérielles combinant divers préhenseurs et caméras. À partir de données collectées par téleopération via RIO, l'équipe a affiné des VLA (Vision-Language-Action models) de pointe, dont π0.5 (Physical Intelligence) et GR00T N2 (NVIDIA), sur des tâches domestiques : saisir-et-déposer, plier du linge et récurer un bol. Le problème central que RIO adresse est structurel et bien documenté dans la communauté : le code robotique est massivement spécifique à chaque configuration matérielle, ce qui rend le partage de données, de modèles et de pipelines entre équipes extrêmement coûteux en temps de reconfiguration. Ce verrou ralentit concrètement la progression vers des capacités cross-embodiment, c'est-à-dire des robots généralistes capables de s'adapter à différentes morphologies sans recodage complet. En proposant des abstractions qui découplent la logique de contrôle du matériel sous-jacent, RIO réduit ce surcoût et ouvre la possibilité de mutualiser des datasets entre utilisateurs disposant de plateformes hétérogènes. Pour les équipes de R&D, cela signifie que des données collectées sur un bras Franka pourraient alimenter l'entraînement d'un humanoïde, sous réserve que les abstractions tiennent à l'échelle réelle. La course aux VLA généralistes s'est accélérée depuis 2024 avec π0 de Physical Intelligence, GR00T de NVIDIA, Helix de Figure AI et OpenVLA de la communauté open source, chacun souffrant du même écueil d'intégration matérielle. RIO s'inscrit dans un courant de standardisation analogue à ce que ROS a accompli pour le middleware, mais centré sur la couche données et déploiement de policies. Des projets concurrents comme RLDS (Google DeepMind), LeRobot (Hugging Face) ou le protocole DROID tentent également de résoudre cette fragmentation. RIO se distingue par sa légèreté et son focus explicite sur le déploiement VLA multi-morphologie. Aucun partenariat industriel ni déploiement commercial n'est annoncé : il s'agit d'une publication académique avec mise en open source intégrale, site de référence à robot-i-o.github.io.

IA physiqueActu
1 source