Aller au contenu principal

Actualités robotique — page 34

4 691 articles au fil, du plus récent au plus ancien.

Unitree entre en bourse : les valorisations à l'épreuve d'un afflux de capital-risque dans la robotique chinoise
1651SCMP Tech 

Unitree entre en bourse : les valorisations à l'épreuve d'un afflux de capital-risque dans la robotique chinoise

Unitree Robotics, fabricant chinois de robots basé à Hangzhou, a obtenu le feu vert de la Commission de régulation des valeurs mobilières de Chine (CSRC) pour une introduction en bourse à la Bourse de Shanghai. Cette approbation intervient environ un mois après que l'entreprise a passé avec succès l'examen du comité de cotation de la place shanghaïenne. Unitree finalise désormais son plan de souscription, la tarification de ses actions et les modalités de souscription en vue d'une entrée en bourse. Le calendrier précis du débuT des transactions reste à confirmer, mais le dossier est désormais dans sa phase finale d'exécution. Cette IPO est scrutée de près car elle doit fixer un référentiel de valorisation pour tout le secteur chinois de l'IA incarnée (embodied AI), qui attire des flux massifs de capital-risque depuis deux ans. Pour les acteurs de la robotique humanoïde et leurs investisseurs, ce sera un premier vrai test de l'appétit des marchés publics pour ce type d'entreprise : est-ce que la valorisation reflète des ventes et déploiements réels, ou surtout une promesse technologique encore largement en phase de développement. Le résultat influencera directement la manière dont les futurs tours de financement et cotations de concurrents seront calibrés, en Chine comme ailleurs. Unitree s'est fait connaître avec ses robots quadrupèdes puis humanoïdes (gammes G1, H1, B2), vendus à la fois à des chercheurs, industriels et grand public à des prix nettement inférieurs à ceux de rivaux occidentaux. Elle s'inscrit dans une vague de commercialisation chinoise de la robotique humanoïde, aux côtés d'acteurs comme UBTech, déjà coté à Hong Kong depuis 2023, et talonnée par des entreprises comme Fourier Intelligence. La prochaine étape attendue est la publication du prix définitif de l'offre avant la cotation effective.

Chine/AsieActu
1 source
X Square Robot mise sur une approche full-stack pour l'IA incarnée et la robotique polyvalente
1652Robotics & Automation News 

X Square Robot mise sur une approche full-stack pour l'IA incarnée et la robotique polyvalente

Le fabricant chinois de robots humanoïdes X Square Robot, basé à Shenzhen, a récemment bouclé quatre levées de fonds consécutives, confirmant l'intérêt soutenu des investisseurs pour l'IA incarnée (embodied AI). La société développe une approche "full-stack" du robot généraliste, c'est-à-dire qu'elle conçoit à la fois le matériel (actionneurs, capteurs, plateforme mécanique) et les modèles d'IA qui pilotent la perception et la manipulation, plutôt que de s'appuyer sur des briques tierces assemblées. L'objectif affiché est de produire des machines capables d'exécuter une large variété de tâches réelles, à l'opposé des robots historiquement programmés pour une application unique et rigide. Cette stratégie d'intégration verticale illustre un basculement plus large du secteur robotique : la course ne se joue plus seulement sur le hardware, mais sur la capacité à faire tenir un modèle d'IA généraliste (de type VLA, vision-language-action) à l'échelle industrielle, du laboratoire jusqu'au déploiement en usine ou en entrepôt. Pour les intégrateurs et décideurs B2B, le succès ou l'échec de ce pari conditionne directement l'arbitrage entre acheter une plateforme fermée type Optimus ou Figure, ou miser sur des acteurs émergents proposant une pile technologique propriétaire complète. Le nombre de tours de financement consécutifs, sans que les montants précis soient encore détaillés publiquement, signale une pression concurrentielle et une conviction des investisseurs chinois sur ce segment. X Square Robot s'inscrit dans un paysage chinois de plus en plus dense sur l'IA incarnée, aux côtés d'acteurs comme Unitree ou UBTech, dans un contexte où Pékin pousse activement la robotique humanoïde comme filière stratégique. Face à elle, la scène occidentale reste dominée par Tesla (Optimus), Figure AI ou encore Physical Intelligence (Pi-0), tandis qu'en Europe des acteurs comme Wandercraft ou Enchanted Tools explorent des approches plus spécialisées. Les prochaines étapes à surveiller pour X Square Robot concernent la divulgation des montants levés, l'identité des investisseurs, et surtout la transition entre démonstrations en laboratoire et déploiements pilotes vérifiables chez des clients industriels, seul indicateur qui permettra de distinguer l'annonce marketing du produit réellement opérationnel.

Chine/AsieOpinion
1 source
Restauration de l'ancrage linguistique dans les modèles VLA par recalibrage de l'attention sans entraînement
1653arXiv cs.RO 

Restauration de l'ancrage linguistique dans les modèles VLA par recalibrage de l'attention sans entraînement

Une équipe de recherche a mis en évidence une faille critique dans les modèles Vision-Language-Action (VLA), ces systèmes qui permettent à des robots d'exécuter des tâches de manipulation à partir d'instructions en langage naturel. Le problème, baptisé "cécité linguistique", survient lorsque le robot continue d'exécuter une action visuellement plausible même quand l'instruction textuelle contredit explicitement la scène observée : le modèle privilégie alors ce qu'il voit au détriment de ce qu'on lui dit. Pour quantifier ce phénomène, les chercheurs ont créé ICBench, un benchmark diagnostique dérivé du jeu de données LIBERO, qui injecte des contradictions contrôlées entre instruction et environnement visuel. Testés sur trois architectures VLA de référence, Pi-0, Pi-0.5 et OpenVLA OFT, les modèles réussissent fréquemment leur tâche malgré des instructions logiquement impossibles, preuve d'un biais visuel marqué dans la génération d'action. Face à ce constat, l'équipe propose IGAR (Instruction-Guided Attention Recalibration), un mécanisme appliqué au moment de l'inférence, sans réentraînement ni modification architecturale, qui rééquilibre l'attention du modèle pour restaurer le poids de l'instruction linguistique. Cette découverte fragilise un postulat central du secteur robotique actuel : que les modèles VLA génèrent des actions réellement pilotées par le langage, condition indispensable pour des robots généralistes capables de suivre des consignes fiables en environnement industriel ou domestique. Un robot qui ignore silencieusement une instruction contradictoire, sans signaler d'erreur, représente un risque direct pour les intégrateurs et les décideurs B2B qui envisagent de déployer ces modèles sur des lignes de production ou en logistique, où une mauvaise interprétation peut coûter cher en sécurité ou en qualité. IGAR intéresse particulièrement car il s'agit d'un correctif applicable sans réentraînement aux modèles existants. Sur 30 tâches issues de LIBERO, IGAR réduit sensiblement les exécutions erronées face à des instructions contradictoires hors distribution, tout en préservant les performances de base sur les tâches normales. Les chercheurs ont aussi validé l'approche sur un bras robotique Franka réel, où IGAR a effectivement empêché des manipulations déclenchées par des instructions incohérentes, un test important puisqu'il dépasse la simple simulation. Ce travail s'inscrit dans une tendance plus large d'audit critique des modèles VLA, où la question du "sim-to-real" et de la robustesse aux cas limites reste largement sous-explorée face à l'engouement commercial entourant Pi-0, GR00T N2 ou Helix.

RecherchePaper
1 source
Embodied.cpp : un moteur d'inférence portable pour modèles d'IA incarnée sur robots hétérogènes
1654arXiv cs.RO 

Embodied.cpp : un moteur d'inférence portable pour modèles d'IA incarnée sur robots hétérogènes

Des chercheurs publient sur arXiv (référence 2607.02501v1) un runtime d'inférence baptisé Embodied.cpp, conçu pour exécuter des modèles d'IA incarnée directement sur des robots physiques. Écrit en C++, il cible spécifiquement les modèles vision-langage-action (VLA) et les modèles monde-action (WAM), deux familles d'architectures qui équipent aujourd'hui la plupart des humanoïdes et bras robotiques pilotés par apprentissage. Le système s'organise en cinq couches, des adaptateurs d'entrée jusqu'aux adaptateurs de déploiement, en passant par la construction de séquences, l'exécution du backbone et des modules de tête interchangeables. Les auteurs l'ont testé sur deux modèles VLA, HY-VLA et pi0.5, obtenant des taux de réussite de tâches en boucle fermée de 100,0% et 91,0% respectivement. Sur un benchmark préliminaire de modèle WAM utilisant un bloc Transformer LingBot-VA, la mémoire consommée par bloc chute de 312,2 MiB à 88,1 MiB. Cette publication s'attaque à un problème très concret pour les intégrateurs robotiques: le déploiement des modèles d'IA incarnée reste aujourd'hui fragmenté entre piles Python spécifiques à chaque modèle, hypothèses matérielles disparates et code de liaison écrit à la main pour chaque robot. Les runtimes d'inférence existants sont pensés pour du serving requête-réponse classique, pas pour les contraintes réelles du contrôle robotique: exécution multi-fréquence dans une boucle fermée, inférence batch-1 en priorité latence sur du matériel hétérogène, et interfaces au-delà du simple flux de tokens. Si les résultats se confirment à plus grande échelle, un runtime portable unique capable de faire tourner plusieurs familles de VLA et de WAM sur des appareils edge variés réduirait significativement le travail d'ingénierie nécessaire pour passer d'un prototype en simulation à un déploiement réel sur robot, un des goulots d'étranglement les plus cités du secteur. Le travail s'inscrit dans la course actuelle autour des modèles génériques de contrôle robotique, aux côtés d'architectures comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, qui cherchent toutes à unifier perception, langage et action dans un seul modèle déployable sur du matériel varié. En proposant une couche d'abstraction backend commune plutôt qu'un modèle de plus, Embodied.cpp se positionne comme brique d'infrastructure plutôt que comme concurrent direct, un signe que la standardisation de l'inférence embarquée devient un enjeu aussi important que la performance des modèles eux-mêmes.

InfrastructureActu
1 source
L'œil mobile : améliore la généralisation spatiale des VLA grâce à une collecte de données hybride et dynamique
1655arXiv cs.RO 

L'œil mobile : améliore la généralisation spatiale des VLA grâce à une collecte de données hybride et dynamique

Le fil d'actualité de l'IA, voici l'article traduit et synthétisé. Une équipe de recherche publie sur arXiv (référence 2607.02322v1, soumis début juillet 2026) une étude intitulée "The Moving Eye", consacrée à la généralisation spatiale des modèles Vision-Language-Action (VLA). Le protocole expérimental repose sur une configuration à deux bras robotiques : l'un exécute la tâche de manipulation, l'autre sert de caméra mobile filmant la scène sous des angles variables. Les chercheurs comparent trois stratégies de collecte de données : vue fixe (Fixed), multi-fixe avec plusieurs points de vue statiques (Multi-Fixed), et vue mobile en mouvement continu (Moving Views). Les modèles testés couvrent le spectre actuel des architectures de manipulation robotique : ACT, les modèles à diffusion (Diffusion Policy), ainsi que les VLA Pi-0 et GR00T. Résultat central : une approche hybride, combinant mouvement continu de caméra et diversité de points de vue statiques, surpasse nettement les deux autres méthodes prises isolément. Cette étude s'attaque à un problème connu mais peu quantifié dans le secteur : le "shortcut learning", où un modèle VLA apprend des corrélations superficielles (pose relative fixe entre objets, ou entre caméra et base du robot) plutôt que la géométrie spatiale réelle de la tâche. Concrètement, un modèle entraîné avec des caméras fixes peut sembler performant en test mais échouer dès qu'on change la position de la caméra ou la disposition des objets, un écart démo-réalité que les intégrateurs industriels connaissent bien. L'article démontre que multiplier les points de vue fixes ne suffit pas à corriger ce biais, contrairement à une hypothèse répandue dans le secteur : seul le mouvement de caméra combiné à la diversité des vues réduit efficacement ces corrélations parasites, et ce gain se vérifie sur toutes les architectures testées, pas seulement sur les VLA les plus récents. Cette fragilité spatiale des VLA fait l'objet d'une attention croissante depuis la montée en puissance de modèles comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), présentés comme généralistes mais dont la robustesse hors distribution reste discutée. En proposant une méthode de collecte de données peu coûteuse en matériel (un simple bras robotique reconverti en caméra mobile) plutôt qu'une refonte architecturale, les auteurs ouvrent une piste concrète pour les équipes qui entraînent leurs propres politiques de manipulation, avant d'éventuels essais à plus grande échelle sur des tâches et robots variés.

RechercheActu
1 source
Apprendre à bouger avant d'agir : pré-entraînement générique pour les VLA
1656arXiv cs.RO 

Apprendre à bouger avant d'agir : pré-entraînement générique pour les VLA

Une équipe de recherche publie sur arXiv (2607.02466v1) un nouveau framework baptisé TAP (Task-Agnostic Pretraining), conçu pour entraîner des modèles Vision-Language-Action (VLA) avec beaucoup moins de démonstrations expertes que les approches classiques. Le constat de départ : la rareté des données étiquetées (observations, instructions et actions) freine le développement des VLA, car les méthodes actuelles mélangent deux apprentissages distincts, la compétence physique (comment bouger) et l'alignement sémantique (quoi faire), alors que seul le second nécessite une supervision par le langage. TAP sépare les deux en deux étapes : une première phase apprend des a priori moteurs transférables à partir de données d'interaction non étiquetées et bon marché, y compris des trajectoires hors tâche généralement écartées et du jeu autonome de robots, via un objectif auto-supervisé de dynamique inverse. Une seconde phase, légère, ancre ensuite ces a priori dans le langage à l'aide d'un minimum de données expertes. Sur le benchmark SIMPLER, TAP égale des modèles entraînés sur plus d'un million de trajectoires expertes tout en utilisant des ordres de grandeur de données étiquetées en moins, avec un gain absolu de 10% sur le behavior cloning standard. Sur une plateforme réelle WidowX, TAP conserve un taux de réussite de 25% face à des perturbations de caméra, là où les baselines entraînées à l'échelle internet chutent à 0%. Ce résultat s'attaque directement à l'un des goulots d'étranglement les plus cités du secteur robotique : le coût de collecte de démonstrations expertes à grande échelle, souvent invoqué pour justifier des besoins massifs en téléopération ou en données simulées coûteuses. En montrant qu'un pré-entraînement task-agnostic sur des données bon marché (trajectoires ratées, jeu robotique non supervisé) peut produire des représentations physiques robustes et transférables, TAP suggère une voie de scalabilité alternative à l'empilement pur de données expertes, un enjeu direct pour les intégrateurs et laboratoires qui cherchent à réduire le coût par déploiement de politiques VLA. Le travail s'inscrit dans la lignée des architectures VLA récentes comme Pi-0 ou GR00T N2, qui cherchent toutes à généraliser au-delà des tâches vues à l'entraînement. La robustesse démontrée face aux perturbations caméra, un scénario classique de dégradation en conditions réelles, en fait un signal notable pour la suite : reste à voir si l'approche se généralise à des plateformes bras-mobiles ou humanoïdes plus complexes que le bras WidowX utilisé ici pour la validation.

RechercheActu
1 source
Guided Action Flow : inférence guidée par Q pour les politiques VLA à appariement de flux
1657arXiv cs.RO 

Guided Action Flow : inférence guidée par Q pour les politiques VLA à appariement de flux

Des chercheurs publient le 2 juillet 2026 (arXiv:2607.02092) Guided Action Flow, une méthode d'inférence qui améliore les politiques robotiques vision-langage-action (VLA) à flow matching sans réentraîner le modèle de base. La politique préentraînée SmolVLA reste gelée : un critique appris sur des trajectoires réelles de succès et d'échec guide l'échantillonnage en temps inverse via des gradients d'action, avec un conditionnement possible sur la description de tâche issue du canal langage de SmolVLA. Sur le benchmark de manipulation LIBERO, un critique spécifique à une tâche fait passer le taux de succès de 68,0% à 82,0% sur une fenêtre de seed, puis de 82,0% à 86,0% sur une autre. Un critique multi-famille, entraîné sur plusieurs types de tâches, améliore le succès en validation de 46,0% à 56,0%, mais le gain sur le jeu de test verrouillé reste plus modeste, de 65,0% à 67,5%. Pour les intégrateurs qui déploient des politiques VLA figées en production, l'approche offre un gain de performance à l'inférence sans le coût d'un réentraînement complet, en transposant aux politiques d'action robotiques un guidage par critique déjà courant en génération d'image et en apprentissage par renforcement. L'écart entre le gain en validation (+10 points) et celui observé sur données verrouillées (+2,5 points) est le résultat le plus significatif de l'étude : il révèle une généralisation limitée du critique au-delà de sa distribution d'entraînement. La méthode est donc prometteuse pour affiner des politiques déjà déployées, mais son bénéfice réel sur des tâches totalement inédites reste contraint tant que la généralisation du critique et un guidage sensible à l'incertitude ne sont pas résolus, ce que les auteurs identifient eux-mêmes comme le verrou central de l'approche. SmolVLA, la politique de base utilisée, est un modèle VLA compact pensé pour du matériel limité, positionné face à des politiques plus lourdes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. LIBERO, le benchmark d'évaluation, est une suite standard de tâches de manipulation conçue pour tester l'apprentissage continu en robotique, et le choix du flow matching comme mécanisme de génération d'action reflète une bascule plus large du secteur vers des schémas de transport plus rapides à échantillonner que la diffusion classique. Guided Action Flow se positionne comme une brique complémentaire aux efforts de réentraînement à grande échelle, offrant un moyen peu coûteux d'améliorer des politiques déjà déployées plutôt que de concurrencer les gros modèles généralistes. Les auteurs annoncent vouloir approfondir la généralisation du critique et intégrer une notion d'incertitude dans le guidage, sans donner de calendrier précis pour ces prochaines étapes.

RechercheActu
1 source
Learning à localiser des trajectoires de référence dans l'espace image pour la navigation visuelle
1658arXiv cs.RO 

Learning à localiser des trajectoires de référence dans l'espace image pour la navigation visuelle

Des chercheurs ont présenté LoTIS, un nouveau modèle de navigation visuelle pour robots capable de localiser une trajectoire de référence directement dans l'image captée par la caméra du robot, sans calibration caméra, sans données de pose et sans entraînement spécifique à chaque plateforme robotique. Plutôt que de prédire des actions liées à un robot particulier, le système prédit où les points de la trajectoire de référence apparaîtraient dans le champ de vision actuel du robot, ce qui rend le guidage transférable d'une plateforme à l'autre sans réentraînement (zero-shot). Sur des tâches de navigation classique en avant, LoTIS dépasse les méthodes de référence de 20 à 50 points de pourcentage en taux de réussite, atteignant 94 à 98% de succès sur des environnements variés, simulés comme réels. Sur des tâches plus difficiles où les approches existantes échouent, comme la marche arrière, le gain dépasse un facteur cinq. Les auteurs montrent aussi qu'une simple vidéo filmée avec un téléphone suffit à guider différents robots vers n'importe quel point de la trajectoire enregistrée. Code, démonstration et vidéos sont disponibles sur le site des auteurs. Cette avancée s'attaque directement à l'un des points de friction majeurs de la robotique mobile actuelle: la dépendance des systèmes de navigation visuelle à des données spécifiques au robot (calibration caméra, poses précises, entraînement par plateforme), qui limite fortement leur portabilité industrielle. En découplant la perception (localiser où aller dans l'image) de l'action (comment s'y déplacer physiquement), LoTIS ouvre la voie à des workflows où une trajectoire filmée une seule fois, même avec un smartphone, pourrait piloter une flotte hétérogène de robots ou d'AMR sans travail d'intégration lourd par modèle. Ce travail s'inscrit dans une lignée de recherche en navigation par imitation visuelle qui cherchait jusqu'ici à imiter des comportements complets plutôt qu'à simplement localiser une cible dans l'image, une approche jugée plus fragile aux changements de point de vue ou de caméra. La stratégie d'entraînement croisé entre trajectoires proposée par les auteurs vise justement à corriger cette fragilité. Le papier, publié sur arXiv, reste à ce stade une contribution académique; son adoption par des intégrateurs ou fabricants de robots commerciaux reste à démontrer.

RecherchePaper
1 source
VLSA : modèle vision-langage-action avec couche de contrainte de sécurité modulaire
1659arXiv cs.RO 

VLSA : modèle vision-langage-action avec couche de contrainte de sécurité modulaire

Des chercheurs universitaires publient une architecture baptisée AEGIS, décrite dans un article arXiv (identifiant 2512.11891, version 2) consacré aux modèles vision-langage-action (VLA), ces systèmes qui permettent à un robot de traduire une instruction en langage naturel et une image en mouvement physique. AEGIS ajoute une couche de contrainte de sécurité "plug-and-play", construite à partir de fonctions de barrière de contrôle (control barrier functions), que l'on peut greffer sur un modèle VLA existant sans le réentraîner ni dégrader ses performances d'origine. Pour évaluer l'approche, les auteurs ont conçu un benchmark dédié, SafeLIBERO, qui multiplie les scénarios de manipulation avec des obstacles et des niveaux de complexité spatiale variables. Résultat annoncé: plus de 50% d'amélioration du taux d'évitement d'obstacles et près de 10% de hausse du taux de réussite des tâches, comparé aux meilleures méthodes existantes. Code et données sont publiés en accès libre. L'enjeu dépasse la prouesse technique isolée. Les modèles VLA généralistes, popularisés par des architectures comme Pi-0, GR00T N2 ou Helix, excellent à généraliser des instructions à de nouvelles tâches de manipulation, mais leur talon d'Achille reste la sécurité physique: rien ne garantit qu'un bras robotique évite une collision en environnement non structuré, un frein majeur au déploiement en usine ou en logistique. En proposant une couche de sécurité modulaire avec garanties théoriques plutôt qu'un simple filtrage heuristique, AEGIS répond directement à ce point de blocage identifié par les intégrateurs, sans nécessiter de repenser chaque modèle VLA au cas par cas. Ce travail s'inscrit dans la vague de recherche qui a suivi l'essor des VLA depuis RT-2 et OpenVLA, où l'accent s'est progressivement déplacé de la généralisation pure vers la fiabilité et la certifiabilité. Il faut toutefois noter que ces résultats proviennent d'un benchmark de simulation dérivé de LIBERO, pas d'un déploiement industriel réel: le passage à l'échelle sur du matériel physique et dans des environnements réellement non structurés reste l'étape suivante à observer, comme pour la plupart des publications de ce type avant adoption commerciale.

RechercheActu
1 source
Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles
1660arXiv cs.RO 

Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles

Des chercheurs présentent AutoSERL, un framework d'apprentissage par renforcement (RL) pour robots qui n'a besoin que d'une seule démonstration humaine pour apprendre des tâches de manipulation complexes en conditions réelles, sans intervention humaine continue pendant l'entraînement. Le système repose sur trois mécanismes complémentaires : une fenêtre glissante d'intervention qui guide l'exploration pour éviter les minima locaux et les mouvements dangereux, un mécanisme de récupération de sécurité qui détecte les échecs et corrige la trajectoire via des points de reprise prédéfinis, et un critère d'arrêt automatique qui coupe le guidage dès que la politique apprise devient autonome. Les auteurs ont testé AutoSERL sur six tâches de manipulation à contact intensif (insertion, accrochage, tâches à charnière) réparties sur deux plateformes robotiques différentes. Le framework atteint 100% de réussite sur les tâches d'insertion et dépasse systématiquement SERL entraîné avec 20 démonstrations, l'apprentissage par imitation classique (behavior cloning) et MILES, une méthode dédiée à l'apprentissage en un coup, tout en égalant les performances de HIL-SERL qui nécessite lui une supervision humaine continue. L'intérêt pour l'industrie tient à la réduction drastique du coût de collecte de données, généralement le principal frein au déploiement de RL sur du matériel physique. La plupart des approches existantes exigent soit des dizaines de démonstrations, soit un opérateur qui intervient en permanence pendant l'entraînement, ce qui limite le passage à l'échelle en usine ou en intégration industrielle. En automatisant l'intervention à partir d'un seul exemple tout en conservant une robustesse aux variations de position des pièces, AutoSERL rapproche le RL réel de tâches d'assemblage fin, un terrain où les approches purement basées sur l'imitation ou les politiques VLA préentraînées peinent encore à garantir une fiabilité industrielle. Ce travail s'inscrit dans la lignée de SERL et HIL-SERL, frameworks de référence pour le RL avec intervention humaine sur robots physiques, en cherchant à supprimer leur principale contrainte opérationnelle. Le code et les vidéos de démonstration sont publiés par les auteurs sur un site dédié, mais le papier, déposé sur arXiv le 1er juillet 2026, reste à ce stade une contribution de recherche académique évaluée en laboratoire sur deux plateformes robotiques, sans indication de déploiement industriel ni de partenariat commercial annoncé.

RecherchePaper
1 source
Robots de livrable : navigation en foule via apprentissage des préférences sociales (SPLC)
1661arXiv cs.RO 

Robots de livrable : navigation en foule via apprentissage des préférences sociales (SPLC)

Une équipe de recherche présente SPLC (Social Preference Learning for Crowd Robot Navigation), un nouvel algorithme d'apprentissage par renforcement hors ligne conçu pour faire naviguer des robots au milieu de foules de piétons sans avoir à concevoir manuellement une fonction de récompense. Publié sur arXiv le 2 juillet 2026 (arXiv:2607.01925v1), le système introduit un mécanisme de retour de préférences sociales qui génère automatiquement des données de préférence à partir de critères d'évaluation prédéfinis, en tenant compte explicitement de la dynamique complexe des piétons. Les auteurs ont testé SPLC en combinaison avec plusieurs méthodes de RL hors ligne et rapportent des gains constants par rapport aux meilleures références actuelles sur des métriques de performance standard, avant de valider l'approche en conditions réelles sur un robot TurtleBot4. Le code et des démonstrations vidéo sont disponibles sur le dépôt GitHub du projet (sklus949/SPLC). L'enjeu pratique est la conception des récompenses en RL, un goulot d'étranglement bien connu pour déployer des robots mobiles autonomes dans des environnements humains partagés, entrepôts, hôpitaux, espaces commerciaux. Écrire à la main une fonction qui capture des normes sociales floues (garder ses distances, céder le passage, anticiper une trajectoire) introduit des biais et ne généralise pas d'une foule à l'autre. En automatisant la génération de préférences plutôt que la récompense elle-même, SPLC s'attaque directement au problème du "reward hacking" et du décalage entre simulation et réel, un point sensible pour tout intégrateur qui envisage des robots de navigation autonome en zones piétonnes denses. Le passage à un test réel sur TurtleBot4, plutôt qu'une simple démonstration en simulateur, distingue ce travail de nombreuses publications qui restent cantonnées au benchmark. Ce travail s'inscrit dans une lignée de recherches sur le RL hors ligne appliqué à la navigation sociale, un axe où les laboratoires cherchent à réduire la dépendance aux interactions coûteuses en environnement réel pendant l'entraînement. Les approches concurrentes reposent généralement sur du reward shaping manuel ou sur de l'apprentissage par imitation à partir de trajectoires humaines annotées, des méthodes que les auteurs positionnent comme moins robustes face à la variabilité des comportements piétons. Les prochaines étapes annoncées ne sont pas détaillées dans le résumé, mais la mise à disposition du code laisse présager des évaluations comparatives par d'autres équipes, et potentiellement une extension à des plateformes robotiques plus complexes que le TurtleBot4.

RecherchePaper
1 source
Transport discrepancy : un signal fiable pour évaluer les modèles vision-langage-action
1662arXiv cs.RO 

Transport discrepancy : un signal fiable pour évaluer les modèles vision-langage-action

Article n'a pas d'entreprise/robot associé (papier arXiv académique), je m'en tiens aux faits rapportés, sans inventer d'affiliation ou de déploiement. Des chercheurs ont publié une version révisée sur arXiv (identifiant 2512.01715v2) d'un papier proposant DiG (Discrepancy Gate), un module additionnel destiné aux modèles vision-langage-action (VLA) qui génèrent leurs séquences de mouvement via flow matching. Le problème visé est concret : ces modèles n'ont aujourd'hui aucun moyen interne de savoir si une prédiction d'action est fiable, alors qu'un changement de distribution des données ou une tâche longue peuvent faire dériver les représentations internes du réseau loin de la zone où la tête d'action décode correctement. Les auteurs montrent que le coût de transport (mesuré via une distance de Wasserstein tranchée, ou sliced Wasserstein) entre les features de l'encodeur et la projection d'entrée de l'expert d'action augmente précisément au moment de cette dérive. DiG exploite ce signal : il le fait passer par une porte exponentielle qui module à la fois un raffinement résiduel des features et la fonction de perte à l'entraînement. À l'inférence, cette porte active un mécanisme baptisé DiG-Refine, qui corrige itérativement les séquences d'action avant leur exécution. Testé en simulation et en conditions réelles, DiG améliore de façon constante le taux de réussite des tâches, avec les gains les plus marqués sur les scénarios de changement de distribution et les tâches à long horizon. L'enjeu dépasse le seul confort académique : les architectures VLA à flow matching, sur lesquelles s'appuient plusieurs modèles de fondation robotique actuels générant des chunks d'action continus, fonctionnent aujourd'hui en boîte noire, sans jauge de confiance embarquée. Pour un intégrateur ou un opérateur industriel, l'absence d'un tel signal signifie qu'un robot peut exécuter une action erronée sans que le système sache qu'il est en train de dériver, un problème critique dès qu'on sort du cadre démo pour aller vers un déploiement en usine ou en entrepôt. DiG répond directement au fossé entre démonstration et fiabilité réelle en offrant un mécanisme d'auto-correction sans supervision supplémentaire ni réentraînement lourd, ce qui en fait un candidat pour être greffé sur des politiques existantes plutôt qu'une refonte d'architecture. Le papier s'inscrit dans la lignée des travaux récents sur le flow matching comme méthode de génération d'actions continues, une approche de plus en plus répandue dans les politiques robotiques génératives modernes en remplacement des méthodes de diffusion classiques ou du apprentissage par imitation discret. Il ne s'agit pas ici d'un produit commercial ni d'un déploiement annoncé, mais d'une contribution méthodologique destinée à la communauté recherche, publiée en tant que "replace" d'une version antérieure du même travail. Les suites logiques attendues sont une adoption potentielle par des équipes développant des politiques VLA en production, ainsi que des comparaisons futures avec d'autres approches de détection d'incertitude pour les modèles d'action continue.

RecherchePaper
1 source
CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique
1663arXiv cs.RO 

CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique

Des chercheurs publient CaP-X, un framework open-access destiné à évaluer et améliorer les agents de type "Code-as-Policy" pour la manipulation robotique, selon un article déposé sur arXiv (2603.22435v2). Le système s'appuie sur CaP-Gym, un environnement interactif où des agents pilotent des robots en générant et exécutant du code combinant des primitives de perception et de contrôle. Sur cette base, les auteurs construisent CaP-Bench, un banc d'essai qui compare 12 modèles de langage et modèles vision-langage frontier selon différents niveaux d'abstraction, d'interaction et d'ancrage perceptif. Le travail aboutit à deux propositions concrètes : CaP-Agent0, un framework ne nécessitant aucun entraînement supplémentaire, et CaP-RL, une méthode d'apprentissage par renforcement avec récompenses vérifiables, testée en simulation puis transférée sur robots réels. L'enjeu dépasse le simple exercice académique : l'approche "code comme politique de contrôle" est présentée comme un complément aux méthodes Vision-Language-Action (VLA), très gourmandes en données, qui dominent aujourd'hui la robotique humanoïde et industrielle. CaP-Bench met en évidence une faiblesse structurelle des agents actuels, leur performance chute nettement dès que les abstractions conçues par des humains sont retirées, ce qui révèle une dépendance excessive au travail d'ingénierie préalable plutôt qu'à une véritable autonomie de raisonnement. Pour les intégrateurs et décideurs industriels, ce résultat tempère l'idée que les grands modèles suffiraient seuls à piloter des bras ou des humanoïdes sans échafaudage logiciel dédié. À l'inverse, les auteurs montrent que multiplier les tours d'interaction, le retour d'exécution structuré, la différenciation visuelle et la synthèse automatique de compétences comble une grande partie de cet écart, même sur des primitives de bas niveau. Ce travail s'inscrit dans le prolongement des recherches sur le "Code-as-Policy", initiées pour donner aux modèles de langage une interface exécutable vers le contrôle robotique, en alternative aux pipelines VLA de bout en bout. En documentant précisément où les agents actuels échouent et en ouvrant l'accès à son environnement de test, CaP-X vise à devenir une plateforme de référence pour comparer objectivement les approches futures, avant un possible passage à l'échelle sur des tâches de manipulation réelles plus complexes.

RecherchePaper
1 source
Bridge-WA : prédire où et comment le monde change pour l'action robotique
1664arXiv cs.RO 

Bridge-WA : prédire où et comment le monde change pour l'action robotique

Une équipe de chercheurs présente Bridge-WA, un nouveau framework "world-action" léger destiné aux modèles de manipulation robotique vision-langage-action (VLA), décrit dans un article publié sur arXiv (2607.02195v1) début juillet. Plutôt que de s'appuyer sur de lourds modèles génératifs du monde ou des séquences denses d'images futures pour anticiper les changements de scène, coûteux en calcul et souvent focalisés sur des détails visuels peu utiles au contrôle, Bridge-WA distille un "teacher" figé de prédiction des changements futurs en trois représentations compactes : des tokens de résultat visé, des cartes de changement pour identifier les zones d'intervention, et des cartes de flux de mouvement pour la direction locale des transitions. Un module appelé WorldBridge conditionne ensuite le transformer d'action sur ces trois priors via des mémoires d'attention multi-sources et des biais spatio-temporels, tandis que le modèle enseignant est retiré au moment de l'inférence. Les auteurs évaluent leur approche sur les benchmarks VLABench, RoboTwin2.0 et LIBERO-Plus, ainsi que sur des tests en robot réel, avec des gains en taux de réussite, en progression de tâche et en robustesse, particulièrement marqués face à des variations visuelles hors distribution. L'intérêt pour l'industrie robotique tient à la promesse d'un compromis efficacité-robustesse : obtenir les bénéfices d'un raisonnement sur l'évolution future de la scène sans payer le coût de génération d'images denses au déploiement, un frein connu pour l'intégration temps réel des modèles VLA. En filtrant les facteurs de nuisance comme le fond, l'éclairage ou les distracteurs pour se concentrer sur où et comment la scène va changer, l'approche s'attaque directement à l'écart généralisation/robustesse qui limite souvent le passage de la démonstration en labo au déploiement industriel. Le travail s'inscrit dans la lignée des modèles VLA à grande échelle qui cherchent à coupler perception, langage et action, un axe de recherche actif depuis l'essor de modèles génériques de manipulation. Comme il s'agit ici de résultats de recherche publiés par les auteurs eux-mêmes sur leurs propres benchmarks, sans déploiement industriel ni validation tierce à ce stade, la prudence reste de mise sur la portée réelle des gains annoncés. Le code et des visualisations sont mis à disposition sur le site du projet, ouvrant la voie à une reproduction indépendante des résultats.

IA physiqueActu
1 source
VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur
1665arXiv cs.RO 

VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur

Des chercheurs présentent VLAFlow (Vision-Language-Action Flow), un framework unifié de flow-matching destiné à comparer objectivement les différents paradigmes d'entraînement des modèles vision-langage-action (VLA) en manipulation robotique. L'étude s'appuie sur OXEMix, un corpus hétérogène d'environ 5 000 heures de données combinant DROID, OpenX-Embodiment, OpenX-Augmented et RoboCOIN. Sous une architecture commune de type pi-0, avec le même backbone VLM, le même action expert et un espace d'action à 14 dimensions, les auteurs évaluent quatre approches strictement comparables : l'entraînement sur les seules actions (MindPI), le co-entraînement supervisé par le langage (MindLPI), l'alignement des représentations latentes futures (MindWPI), et leur combinaison (MindLWPI). Les tests sont menés sur trois bancs d'essai de référence : LIBERO, LIBERO-Plus et SimplerEnv. Pour les équipes qui entraînent des modèles VLA sur des données robotiques hétérogènes, l'apport principal n'est pas un nouveau produit mais une comparaison contrôlée rare dans un champ où architecture, données et protocole d'évaluation varient habituellement d'un papier à l'autre, rendant les résultats difficiles à départager. Les résultats montrent que l'entraînement action seule se dégrade quand les données proviennent de sources trop diverses, un signal utile pour qui envisage de simplement agréger des jeux de données multi-robots sans garde-fou. La supervision par le langage préserve la généralisation vision-langage, et l'alignement latent futur améliore la modélisation des transitions d'état et des relations action-résultat. La combinaison des deux signaux (MindLWPI) offre le transfert le plus stable sur l'ensemble des bancs d'essai, suggérant qu'un espace de méta-action combinant contraintes linguistiques et prédictives rend l'apprentissage par imitation plus robuste au passage à l'échelle. Ce travail s'inscrit dans la lignée des architectures pi-0 popularisées par Physical Intelligence, dans un paysage où Nvidia (GR00T N2), Figure (Helix) ou d'autres laboratoires développent également des modèles généralistes pour la manipulation robotique. Contrairement à des annonces produit, il s'agit ici d'une publication de recherche (preprint arXiv) centrée sur la méthodologie d'entraînement plutôt que sur un déploiement matériel. Les auteurs positionnent VLAFlow comme un socle reproductible pour de futures comparaisons de paradigmes, sans annoncer pour l'instant de calendrier de mise à disposition du code ou des poids du modèle.

RechercheActu
1 source
ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement
1666arXiv cs.RO 

ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement

Le laboratoire à l'origine de ce papier arXiv (identifiant 2603.28545, version 2, soumission de type remplacement) présente ManipArena, un cadre d'évaluation standardisé pour la manipulation robotique en conditions réelles. Le benchmark couvre 20 tâches distinctes, s'appuie sur 10 812 trajectoires expertes et 13,5 millions d'images, pour un total d'environ 188 heures de fonctionnement robotique cumulées sur des scénarios de manipulation de table et de manipulation mobile. Le protocole combine variation de tâches définie par schéma, essais stratifiés en distribution, en décalage visuel et hors distribution sémantique, notation par crédit partiel au niveau des sous-tâches, annotations linguistiques à trois niveaux de granularité, signaux moteurs bas niveau, et environnements simulés jumeaux reconstruits à partir de scènes physiques réelles. Les chercheurs ont utilisé ce dispositif pour évaluer sept configurations de manipulation de table, couvrant à la fois des modèles vision-langage-action (VLA) et des modèles dits world-action. L'enjeu dépasse la simple création d'un nouveau jeu de tests. Les benchmarks en simulateur, bien que reproductibles et faciles à mettre à l'échelle, ne capturent pas fidèlement l'écart entre simulation et réel, ce dernier étant causé par le bruit de perception, la dynamique de contact, la latence et les erreurs de calibration. À l'inverse, les évaluations sur robots physiques existantes sont dispersées entre plateformes, scènes et règles de notation différentes, ce qui rend toute comparaison rigoureuse quasi impossible. Résultat clé de l'étude: les performances mesurées sur robot réel ne dépendent pas seulement de l'architecture du modèle, mais aussi de sa provenance, du régime de fine-tuning, de l'échantillonnage des données d'entraînement et de la granularité des annotations. Pour les intégrateurs et décideurs industriels, ce constat invite à relativiser fortement les annonces de performance basées uniquement sur des démonstrations vidéo ou des scores en simulation. Ce travail s'inscrit dans la course actuelle autour des modèles généralistes de contrôle robotique (VLA et world-action), un domaine où les affirmations de généralisation restent difficiles à vérifier faute de méthodologie commune. En proposant un référentiel reproductible avec attribution fine des échecs, ManipArena vise à devenir un outil diagnostique de référence pour mesurer les véritables limites de capacité de ces modèles, plutôt qu'un simple classement de plus.

RecherchePaper
1 source
Adaptabilité pour robots suiveurs de groupe : gérer des formations qui changent dynamiquement
1667arXiv cs.RO 

Adaptabilité pour robots suiveurs de groupe : gérer des formations qui changent dynamiquement

Une équipe de chercheurs a publié le 1er juillet 2026 sur arXiv (référence 2607.01287v1) une nouvelle méthode permettant à des robots sociaux d'accompagner un groupe de personnes dont la formation change en permanence, plutôt que de suivre une disposition fixe. Le système repose sur des modèles vision-langage (VLM) chargés d'inférer en temps réel la position optimale du robot par rapport au groupe, de maintenir des distances sociales appropriées et de comprendre la dynamique collective des déplacements. Concrètement, un module de perception détecte d'abord les membres du groupe puis génère une représentation visuelle de l'espace d'interaction, transmise au VLM ; les décisions de haut niveau sont ensuite converties en trajectoires sûres via un contrôleur MPPI (Model Predictive Path Integral), qui gère la stabilité et évite les collisions. Testée sur cinq scénarios différents, l'approche affiche une amélioration de 15% du taux de réussite et une réduction de 25% du taux de collision par rapport aux méthodes de référence, avec en complément une étude utilisateur jugeant les comportements du robot naturels et socialement appropriés. Pour l'industrie de la robotique sociale, ce travail s'attaque à un angle mort classique des robots compagnons et guides : la plupart des systèmes existants supposent une formation de groupe stable (file, cercle), une hypothèse qui s'effondre dès que des personnes changent de vitesse, se dispersent ou se regroupent, comme c'est le cas dans un musée, un hall d'exposition ou un espace commercial. Coupler le raisonnement sémantique d'un VLM à un contrôleur de trajectoire classique illustre une tendance plus large du secteur : utiliser les grands modèles pour la compréhension de la scène et la prise de décision, tout en laissant le contrôle bas niveau à des méthodes d'optimisation éprouvées, jugées plus fiables pour la sécurité. Il s'agit toutefois d'un article de recherche fraîchement mis en ligne, sans mention de partenaire industriel ni de déploiement réel au-delà des scénarios expérimentaux décrits. Le papier s'inscrit dans la lignée des travaux sur la navigation robotique consciente des humains (human-aware navigation), un domaine où academiques et fabricants de robots de service cherchent depuis plusieurs années à dépasser les formations rigides. Les prochaines étapes attendues seraient des tests en conditions réelles avec des groupes plus nombreux et des environnements encombrés.

RecherchePaper
1 source
Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée
1668arXiv cs.RO 

Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée

Un article mis à jour sur arXiv (version 2, référence 2606.22982) présente CLS-DP, un cadre décentralisé pour la manipulation multi-bras par des agents robotiques. Le système répond à un problème concret : les approches centralisées de coordination multi-agents passent mal à l'échelle quand le nombre de bras augmente, car elles exigent une vue globale partagée et des échanges d'état constants. CLS-DP suit le paradigme CTDE (entraînement centralisé, exécution décentralisée) : pendant l'entraînement, il distille dans un espace latent les dynamiques privilégiées de coordination multi-agents ; au déploiement, chaque bras infère ce "latent collaboratif" à partir de sa seule observation RGB locale et d'une instruction de tâche partagée, puis conditionne dessus son processus de débruitage par diffusion, sans communication inter-agents ni état global explicite. Sur six tâches du benchmark RoboFactory impliquant de deux à quatre agents, CLS-DP atteint un taux de réussite moyen de 38%, contre 20% pour la meilleure référence centralisée testée et seulement 9% pour une version décentralisée privée du latent collaboratif. Ce résultat contredit une hypothèse répandue en robotique multi-bras : qu'une coordination fine nécessite forcément une communication explicite ou une vue centralisée de la scène. En montrant qu'un latent appris peut encoder implicitement les dynamiques collaboratives à partir d'une simple image locale, CLS-DP ouvre la voie à des cellules multi-robots qui passent à l'échelle sans coût de communication croissant, un enjeu direct pour les intégrateurs qui déploient des postes de manipulation coopérative en usine. Les cartes d'attribution des auteurs montrent que chaque agent, conditionné sur ce latent, porte une attention élevée non seulement sur ses propres articulations et sa pince, mais aussi sur celles de ses coéquipiers pendant toute l'exécution, preuve que l'information de coordination circule réellement dans la représentation apprise. Pour qui évalue des architectures VLA (vision-language-action) en environnement multi-agent, le travail suggère qu'on peut réduire le coût de calcul par agent tout en égalant, voire en dépassant, des références centralisées plus lourdes. Ce travail s'inscrit dans la lignée des politiques de manipulation par diffusion, devenues une alternative courante au clonage comportemental classique, et s'appuie sur RoboFactory comme benchmark commun pour l'évaluation multi-agents. Le choix du paradigme CTDE rapproche aussi cette recherche des méthodes d'apprentissage par renforcement multi-agents, où entraînement centralisé et exécution décentralisée sont devenus un standard pour équilibrer performance et scalabilité. L'article ne mentionne aucun déploiement industriel ni partenariat avec un fabricant de bras robotiques : il s'agit pour l'instant d'un résultat validé en simulation, sans calendrier annoncé de transfert vers du matériel réel. L'étape logique suivante serait une validation sim-to-réel sur des cellules physiques à deux ou trois bras, véritable épreuve pour une méthode qui promet de faire tenir la coordination fine dans une seule caméra RGB par agent.

RecherchePaper
1 source
« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »
1669arXiv cs.RO 

« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »

Des chercheurs proposent une nouvelle méthode de sécurité pour les modèles Vision-Language-Action (VLA), les systèmes d'IA qui pilotent de plus en plus de robots humanoïdes et bras manipulateurs. Publiée sur arXiv (référence 2607.01378), l'étude cible spécifiquement les VLA basés sur le flow matching, une technique qui prédit non pas une seule action mais une trajectoire complète via un processus itératif de débruitage neuronal, à l'image de Pi-0, GR00T N2 ou Helix. Le problème identifié: les garde-fous de sécurité actuels ne bloquent que l'action immédiate du robot, sans anticiper les collisions à venir. La méthode proposée, baptisée guidage neuro-symbolique, reformule la sécurité comme un problème d'optimisation sous contrainte à norme minimale, appliqué directement pendant le débruitage des trajectoires intermédiaires bruitées. Testée sur le benchmark SafeLIBERO, elle atteint 82,8% d'évitement de collision et 81,6% de réussite des tâches, soit des gains de 6,3 et 19,8 points par rapport aux méthodes à une seule étape, les progrès les plus marqués apparaissant sur les tâches longues où les erreurs de trajectoire s'accumulent. Pour l'industrie robotique, cette avancée s'attaque à un angle mort réel du déploiement des VLA en usine ou en entrepôt: la plupart des systèmes actuels réagissent après coup plutôt que d'anticiper. Une correction en amont, intégrée au cœur du processus génératif plutôt qu'ajoutée en filtre externe, pourrait réduire les arrêts d'urgence et les interventions humaines sur les lignes où ces modèles pilotent des bras ou des robots mobiles autonomes (AMR). Le gain le plus significatif sur les tâches longues est particulièrement pertinent pour les intégrateurs, puisque c'est précisément sur ces séquences que les architectures VLA actuelles échouent le plus souvent en conditions réelles. Ce travail s'inscrit dans une littérature grandissante sur la sécurité des VLA, alors que ces modèles passent rapidement du stade de démonstration à des déploiements pilotes chez plusieurs acteurs de la robotique humanoïde. Les auteurs comparent leur approche aux méthodes de sécurité "single-step" existantes et proposent des démonstrations vidéo sur leur page de projet dédiée. Reste à voir si cette approche neuro-symbolique, validée pour l'instant en simulation sur SafeLIBERO, tiendra la route sur du matériel physique et à des cadences de production industrielles.

RecherchePaper
1 source
Robots à bras multiples : apprentissage neuronal de l'accessibilité Hamilton-Jacobi pour la planification décentralisée de trajectoires sûres
1670arXiv cs.RO 

Robots à bras multiples : apprentissage neuronal de l'accessibilité Hamilton-Jacobi pour la planification décentralisée de trajectoires sûres

Une équipe de chercheurs propose NeHMO, une méthode d'apprentissage par réseau de neurones basée sur la réductibilité de Hamilton-Jacobi (HJR) pour la planification de mouvement multi-bras en sécurité et de façon décentralisée. Le papier, publié sur arXiv (arXiv:2507.13940, version 2), s'attaque au problème de la coordination de plusieurs bras robotiques évoluant dans un espace de configuration couplé et de haute dimension. Plutôt que de s'appuyer sur un planificateur centralisé qui coordonne tous les bras mais peine à passer à l'échelle en temps réel, ou sur des méthodes décentralisées existantes qui supposent un comportement prévisible des autres bras, les auteurs entraînent une fonction de valeur de sécurité qui capture les contraintes de collision inter-bras dans le pire des cas. Cette représentation apprise alimente ensuite un module d'optimisation de trajectoire décentralisé, exécutable en temps réel sur chaque bras indépendamment. L'enjeu dépasse l'exercice académique: la planification multi-bras sûre est un goulot d'étranglement concret pour les cellules de fabrication et les postes d'assemblage où plusieurs manipulateurs partagent un espace de travail restreint. Les approches centralisées classiques deviennent impraticables dès que le nombre de bras augmente, tandis que les méthodes décentralisées à base d'apprentissage profond échouent dès qu'un bras voisin dévie d'un comportement anticipé, c'est à dire exactement le scénario que redoutent les intégrateurs industriels en environnement non coopératif. En garantissant une sécurité dans le pire des cas plutôt qu'une prédiction probable de comportement, NeHMO répond à une limite reconnue des architectures actuelles: la fragilité face à l'imprévisibilité, sans sacrifier le passage à l'échelle. La réductibilité de Hamilton-Jacobi est un outil classique de la théorie du contrôle pour la vérification formelle de sécurité, historiquement trop coûteux en calcul pour des systèmes multi-bras à haute dimension. L'apport ici est de le rendre tractable via une approximation neuronale, généralisable à différentes configurations de manipulateurs sans réentraînement complet. Selon les auteurs, la méthode surpasse les références de l'état de l'art sur des tâches de planification multi-bras jugées difficiles. Il s'agit toutefois d'un résultat de recherche publié en preprint, sans partenaire industriel ni déploiement annoncé à ce stade.

RecherchePaper
1 source
Contrôle Prédictif Non Linéaire Multi-Fréquences pour la Locomotion Bipède Appuyée au Mur de Robots Quadrupèdes
1671arXiv cs.RO 

Contrôle Prédictif Non Linéaire Multi-Fréquences pour la Locomotion Bipède Appuyée au Mur de Robots Quadrupèdes

Cette étude, publiée sur arXiv le 1er juillet 2607 (arXiv:2607.01574), présente un nouveau cadre de contrôle baptisé MR-NMPC (commande prédictive non linéaire multi-cadence) permettant à un robot quadrupède d'adopter une locomotion bipède partiellement assistée par un mur, dans des environnements confinés. Le système repose sur deux niveaux : en haut, le MR-NMPC planifie simultanément les points de contact discrets et les trajectoires continues du centre de masse et de l'orientation du robot, à partir d'un modèle dynamique de corps rigide unique (SRB) ; en bas, un contrôleur de corps complet (WBC) non linéaire, basé sur des contraintes virtuelles et un programme quadratique, traduit ces références en commandes moteur tout en respectant la dynamique complète du système. Les auteurs ont validé leur approche exclusivement par simulation numérique, sur un robot quadrupède Unitree A1, en terrain accidenté et soumis à des perturbations externes. Résultat chiffré : le MR-NMPC atteint un taux de réussite 2,9 fois supérieur à celui d'un MPC classique combiné à un placement de pied heuristique, notamment à haute vitesse sur terrain irrégulier. L'intérêt pratique dépasse la prouesse académique : faire tenir un quadrupède en appui partiel sur un mur pour libérer ou stabiliser ses pattes ouvre la voie à des manœuvres dans des couloirs étroits, des échafaudages ou des zones sinistrées, là où la locomotion quadrupède classique manque de portée verticale. Cela confirme aussi qu'une planification conjointe des contacts et de la trajectoire, plutôt qu'une heuristique de pose de pied, réduit nettement les échecs dynamiques en conditions difficiles, un argument technique plus qu'une démonstration marketing. Le travail s'inscrit dans la lignée des recherches sur le contrôle prédictif des robots à pattes, où Unitree A1 sert de plateforme de référence académique peu coûteuse. Contrairement aux annonces produits d'acteurs comme Boston Dynamics ou ANYbotics, il s'agit ici d'une contribution de recherche en simulation, sans validation matérielle réelle annoncée : la prochaine étape logique serait un déploiement physique sur robot pour confirmer la robustesse observée in silico.

RecherchePaper
1 source
SE(2) : un maillage de navigation pour la planification de trajectoires
1672arXiv cs.RO 

SE(2) : un maillage de navigation pour la planification de trajectoires

Des chercheurs proposent le SE(2) Navigation Mesh (SE(2) NavMesh), une nouvelle représentation cartographique pour la navigation globale des robots terrestres dans des environnements complexes à plusieurs niveaux, comme les bâtiments multi-étages ou les entrepôts encombrés. Publiée sur arXiv sous la référence 2607.01454v1, l'étude part d'un constat: les nuages de points et les cartes d'occupation volumétrique manquent de structure de surface explicite pour estimer la franchissabilité du terrain, tandis que la recherche de chemin directe sur des maillages triangulaires denses reste trop coûteuse en calcul. Les navmesh classiques, qui découpent l'espace en polygones traversables, supposent que la franchissabilité ne dépend pas de l'orientation du robot, ce qui les rend inadaptés aux robots non circulaires évoluant dans des espaces contraints. Le SE(2) NavMesh corrige ce défaut en évaluant la franchissabilité via des masques d'empreinte au sol et en construisant un graphe organisé en couches spécifiques à chaque orientation, avec une connectivité translationnelle et rotationnelle explicite. Les auteurs introduisent aussi une stratégie de recherche de chemin en deux temps, baptisée A-String Pulling-A (ASA), qui optimise hiérarchiquement la position puis le cap du robot, ainsi qu'une méthode en ligne mettant à jour incrémentalement le NavMesh à partir de flux de nuages de points pendant la reconstruction géométrique de l'environnement. En simulation, le SE(2) NavMesh capture plus de 50% de surface traversable en plus qu'un navmesh classique, et le pipeline SE(2) NavMesh + ASA surpasse systématiquement les méthodes d'échantillonnage de référence dans les espaces confinés. Des expériences réelles sur robot physique confirment la génération en temps réel et une navigation réussie dans plusieurs environnements. Cette avancée cible un angle mort persistant de la navigation robotique: la plupart des pipelines actuels traitent le robot comme un disque, une approximation valable pour des AMR circulaires mais qui échoue dès qu'un châssis allongé, asymétrique ou muni d'un bras déployé doit se faufiler entre des obstacles serrés. Pour les intégrateurs qui déploient des robots logistiques ou des plateformes mobiles à bras manipulateur dans des entrepôts, usines ou bâtiments à plusieurs niveaux, cette limite se traduit par des chemins sous-optimaux, des blocages évitables ou des marges de sécurité excessives qui réduisent l'espace exploitable. En démontrant qu'une représentation sensible à l'orientation peut être calculée et mise à jour en temps réel, y compris pendant la reconstruction de la carte, les auteurs répondent à une objection fréquente: que ce type d'approche serait trop coûteux pour tourner en embarqué. Le gain de plus de 50% en surface traversable exploitable n'est pas un détail marginal, il implique potentiellement moins de détours et une meilleure utilisation de l'espace dans des contextes où chaque mètre carré compte, comme les micro-fulfillment centers ou les couloirs étroits d'établissements de santé. Le travail s'inscrit dans la lignée des recherches sur la planification de trajectoire pour robots terrestres, longtemps tiraillées entre deux extrêmes: les cartes d'occupation, simples à construire mais pauvres en information de franchissabilité, et les maillages triangulaires denses, riches en détail mais trop lourds pour une recherche de chemin en temps réel. Les navmesh polygonaux classiques, utilisés de longue date dans le jeu vidéo puis adoptés par la robotique mobile, avaient déjà réglé le problème du coût de calcul, mais au prix de l'hypothèse simplificatrice d'une franchissabilité indépendante de l'orientation. Le SE(2) NavMesh se positionne comme une extension directe de cette famille de méthodes, en ajoutant la dimension manquante sans revenir à la complexité des maillages denses. Les auteurs valident leur approche à la fois en simulation et sur un robot physique réel, ce qui traduit une volonté de rapprocher rapidement cette technique du terrain plutôt que de la cantonner au stade théorique. Les suites attendues pour ce type de travaux incluent généralement l'intégration dans des piles logicielles de navigation existantes et des tests à plus grande échelle sur des flottes hétérogènes.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
1673arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
IA incarnée : LIME apprend à percevoir les mouvements de caméra intentionnels à partir de vidéos égocentriques
1674arXiv cs.RO 

IA incarnée : LIME apprend à percevoir les mouvements de caméra intentionnels à partir de vidéos égocentriques

Un article de recherche publié sur arXiv (2607.02417) présente LIME, un système qui apprend à un robot autonome où déplacer sa caméra à partir de simples instructions en langage naturel. Le problème posé est précis : à partir d'une image RGB de la scène et d'une intention exprimée en texte libre ("regarde derrière la boîte", "inspecte l'objet"), le modèle doit prédire la pose cible relative de la caméra en SE(3) pour la prochaine observation. Les chercheurs ont construit leur jeu d'entraînement en minant des vidéos égocentriques humaines, associant intentions plausibles et descriptions du gain d'observation à des poses de caméra relatives. L'architecture combine deux briques : une sortie auto-régressive qui décrit ce que la prochaine vue doit révéler, et une tête de pose entraînée par flow-matching continu, capable de représenter plusieurs hypothèses de cible. Ce travail s'attaque à un angle mort du secteur : la navigation vision-langage traduit des instructions en déplacements de base, et les politiques vision-langage-action (VLA) les traduisent en gestes de manipulation, mais le contrôle du regard lui-même, c'est-à-dire où pointer la caméra avant d'agir, reste peu formalisé comme action à part entière. Pour un intégrateur ou un roboticien, cela touche un besoin concret : un robot qui doit inspecter une pièce industrielle, vérifier une zone occluse, ou s'orienter selon une consigne orale a besoin d'une perception active pilotée par le langage, et non d'une caméra fixe ou d'un balayage aveugle. Si les résultats se confirment à plus grande échelle, cela ouvrirait une voie pour entraîner ce type de comportement sans capture de données robotiques coûteuse, en réutilisant de la vidéo humaine ordinaire. Il s'agit à ce stade d'un article de recherche avec expériences et tâches robotiques en aval, pas d'un produit déployé ni d'un système embarqué chez un intégrateur. Le papier se positionne dans la lignée des travaux récents sur les politiques VLA à grande échelle (Pi-0, GR00T N2, Helix) mais en creusant une brique en amont, la perception active intentionnelle, plutôt que la génération d'actions de manipulation elle-même. Les auteurs annoncent des résultats sur des tâches robotiques en aval, mais sans préciser à ce stade de partenaire industriel ni de calendrier de transfert vers un système commercial.

RecherchePaper
1 source
BIEVR-LIO : odométrie LiDAR-inertielle robuste via des cartes de voxels enrichies par images de relief
1675arXiv cs.RO 

BIEVR-LIO : odométrie LiDAR-inertielle robuste via des cartes de voxels enrichies par images de relief

Les chercheurs à l'origine de BIEVR-LIO présentent une nouvelle méthode d'odométrie LiDAR-inertielle (LIO) conçue pour rester fiable dans les environnements pauvres en géométrie, un scénario où les techniques classiques dérivent ou divergent faute de repères suffisants pour recaler les nuages de points. Le cœur de l'approche repose sur une carte voxelisée haute résolution où chaque voxel stocke une image de hauteur orientée représentant la surface locale, ce qui permet un recalage direct sans passer par le calcul intermédiaire de primitives géométriques (plans, arêtes), tout en conservant des mises à jour de carte efficaces en temps réel. Les auteurs ajoutent une stratégie d'échantillonnage de points guidée par la carte, qui concentre le calcul de recalage sur les zones géométriquement informatives plutôt que d'échantillonner uniformément toute la scène, réduisant le coût de calcul tout en améliorant la robustesse dans les zones dégénérées. Testée sur plusieurs capteurs, plateformes robotiques et environnements, la méthode atteint des performances état de l'art dans les scènes bien contraintes et des gains substantiels là où les méthodes de référence échouent ou divergent. Pour l'industrie robotique, ce travail s'attaque à un point de friction bien connu des intégrateurs de robots mobiles autonomes: la navigation en environnements géométriquement pauvres, couloirs longs, tunnels, entrepôts vides ou zones industrielles répétitives, où les systèmes LIO classiques perdent en précision faute de contraintes suffisantes pour l'alignement des points. Une odométrie plus robuste dans ces conditions réduit directement le risque de dérive de localisation, un enjeu critique pour les AMR en logistique, l'inspection en tunnels ou souterrains, et les interventions en environnements dégradés. Les auteurs signalent également une application dérivée en cartographie d'élévation pour la locomotion, un signal potentiellement pertinent pour les robots à pattes ou humanoïdes devant planifier leurs appuis sur des terrains irréguliers. Ce travail s'inscrit dans la lignée des méthodes LIO basées sur cartes voxelisées, qui cherchent depuis plusieurs années à améliorer la robustesse du SLAM LiDAR-inertiel face aux scènes dégénérées, une limite connue des approches par extraction de primitives géométriques classiques. La publication, une version révisée déposée sur arXiv, ne précise ni date de déploiement ni partenaire industriel; il s'agit à ce stade d'une contribution de recherche académique, dont l'adoption dépendra de tests sur plateformes robotiques réelles au-delà des benchmarks présentés.

RecherchePaper
1 source
Politique de latence latente : apprendre des politiques visuomotrices robustes en restant dans la distribution
1676arXiv cs.RO 

Politique de latence latente : apprendre des politiques visuomotrices robustes en restant dans la distribution

Une équipe de recherche publie sur arXiv (2508.05941v2, version révisée) un nouveau cadre baptisé Latent Policy Barrier, ou LPB, destiné à rendre plus robustes les politiques visuomotrices entraînées par apprentissage par imitation (behavior cloning). Le problème ciblé est bien connu des roboticiens : le covariate shift, c'est à dire le fait qu'un robot qui s'écarte même légèrement des trajectoires démontrées par un expert humain voit cette petite déviation s'amplifier jusqu'à provoquer un échec complet de la tâche. Pour y remédier, LPB s'inspire des fonctions barrières de contrôle (Control Barrier Functions) issues de la théorie du contrôle, et traite les représentations latentes des démonstrations expertes comme une frontière implicite séparant les états "dans la distribution", donc sûrs, des états hors distribution, potentiellement dangereux. Concrètement, l'architecture sépare deux rôles dans deux modules distincts : une politique de diffusion entraînée uniquement sur les données expertes pour l'imitation précise, et un modèle de dynamique entraîné à la fois sur les données expertes et sur des trajectoires sous optimales générées par la politique elle même. Au moment de l'inférence, ce modèle de dynamique prédit les futurs états latents et les optimise pour qu'ils restent dans la distribution experte. Les auteurs valident l'approche par des expériences en simulation et sur robot réel. Cette séparation entre qualité de l'imitation et récupération face aux écarts est significative pour l'industrie de la manipulation robotique, où la collecte de démonstrations reste le goulot d'étranglement principal. Les méthodes existantes pour limiter le covariate shift, correction humaine en boucle (type DAgger) ou augmentation synthétique des données, sont coûteuses en main d'œuvre, reposent sur des hypothèses fortes propres à chaque tâche, ou dégradent la qualité de l'imitation elle même. Si LPB tient ses promesses de robustesse et d'efficacité des données sans annotation supplémentaire, cela réduirait un coût réel pour les intégrateurs qui doivent aujourd'hui multiplier les démonstrations ou les interventions correctives pour fiabiliser un déploiement. Le travail s'inscrit dans la lignée des politiques de diffusion appliquées à la manipulation robotique, popularisées ces dernières années comme alternative aux politiques déterministes classiques, et emprunte au corpus des fonctions barrières utilisé en contrôle de sécurité pour véhicules et robots mobiles. Il se positionne face aux approches par correction humaine en boucle ou par augmentation de données synthétiques, qu'il cherche explicitement à remplacer. S'agissant d'une publication arXiv, il s'agit d'un résultat de recherche à ce stade, sans annonce de déploiement industriel ni de partenaire commercial identifié.

RecherchePaper
1 source
MetaTune : optimisation adjointe des méta-paramètres via dynamique différentiable en robotique
1677arXiv cs.RO 

MetaTune : optimisation adjointe des méta-paramètres via dynamique différentiable en robotique

Des chercheurs publient MetaTune, un framework d'auto-tuning conjoint pour contrôleurs à retour d'état et observateurs de perturbation, en version 2 sur arXiv (2603.27313). La méthode combine une politique neuronale portable et une dynamique différentiable pour ajuster les gains selon les tâches et conditions opérationnelles. Son point central est une méthode adjointe qui calcule les méta-gradients en remontant le temps, ramenant la complexité de calcul à une croissance linéaire avec l'horizon de données, contre un coût plus élevé pour les méthodes forward existantes. Sur des tâches de contrôle de quadrirotor, MetaTune égale ou dépasse les performances de suivi de trajectoire existantes tout en réduisant de plus de 50% le temps de calcul des gradients. En simulation hardware-in-the-loop sous PX4-Gazebo, la politique apprise se transfère sans réentraînement et réduit l'erreur de suivi (RMSE) de 15 à 20% en vol agressif, jusqu'à 40% sous fortes perturbations. Le problème visé est concret pour les ingénieurs en commande robotique: le couplage fort entre gains de contrôleur et paramètres d'observateur de perturbation rend le réglage manuel long et instable, notamment pour des plateformes comme les drones devant encaisser rafales de vent ou charges variables. En unifiant les deux réglages dans un cadre différentiable et en rendant le calcul des méta-gradients nettement moins coûteux, ce travail attaque un goulot d'étranglement classique de l'auto-tuning appris: l'explosion du coût de calcul des méthodes forward sur de longs horizons. Le transfert zero-shot vers une simulation matérielle réaliste est le signal le plus parlant, car il suggère que les gains d'apprentissage ne restent pas cantonnés à la simulation pure, point souvent fragile en contrôle adaptatif appris. Ce travail prolonge la lignée du contrôle par observateur de perturbation, déjà utilisé pour robustifier les systèmes robotiques face aux incertitudes, et celle des méthodes adjointes issues du contrôle optimal, ici redéployées pour le méta-apprentissage de gains. La comparaison explicite aux méthodes forward positionne MetaTune comme alternative plus efficiente aux approches de méta-gradient déjà proposées pour le tuning automatique. Publié en version révisée (v2), l'article reste validé uniquement sur quadrirotors et en simulation HIL : la validation sur matériel réel et l'extension à d'autres classes de robots restent les prochaines étapes avant une adoption industrielle.

RecherchePaper
1 source
HEFT : téléopération d'humanoïde grandeur nature à charge lourde, guidage privilégié et curriculum par fenêtres
1678arXiv cs.RO 

HEFT : téléopération d'humanoïde grandeur nature à charge lourde, guidage privilégié et curriculum par fenêtres

Des chercheurs présentent HEFT (Heavy-payload full-size humanoid teleoperation), un framework de téléopération détaillé dans une publication arXiv datée du 2 juillet 2026 (référence 2607.02332v1). Contrairement à la plupart des systèmes de suivi de mouvement validés sur des plateformes compactes ou sans charge réelle, HEFT est testé sur un humanoïde grande taille : L7, un robot de 175 cm pour 65 kg. Le robot reproduit des mouvements de téléopération incluant virages, marche avant et arrière, et squats, avec des charges utiles allant jusqu'à 24 kg. Deux briques techniques rendent cela possible : le Privileged Motion Guidance (PMG), qui entraîne le système à partir de références VR bruitées combinées à des références reconstruites physiquement plausibles, et le Windowed Payload Curriculum (WPC), qui augmente progressivement la charge tolérée grâce à des plafonds guidés par un expert. Cette démonstration s'attaque à un angle mort connu du secteur humanoïde : l'écart entre les vidéos de démonstration et la réalité opérationnelle. Les casques et contrôleurs VR grand public utilisés en téléopération génèrent du bruit, de la dérive et des erreurs de retargeting qui deviennent critiques sur un robot grande taille, dont l'inertie plus élevée et les marges d'équilibre plus étroites amplifient le moindre écart de trajectoire. En maintenant la stabilité tout en portant des charges proches d'un tiers de son propre poids, HEFT apporte un élément de preuve concret que le transfert VR vers robot peut tenir à l'échelle humaine réelle, un point disputé alors que la plupart des démonstrations humanoïdes commerciales (Figure 03, Optimus, GR00T N2, Helix) mettent l'accent sur la manipulation fine plutôt que sur le port de charges lourdes. Pour les intégrateurs industriels, cela ouvre la perspective de tâches logistiques, chargement, port de bacs, palettisation, aujourd'hui hors de portée des humanoïdes commerciaux. La téléopération reste la voie privilégiée par de nombreux laboratoires pour collecter des données d'entraînement avant d'automatiser les tâches via des politiques apprises, plutôt que de dépendre uniquement de la simulation. HEFT s'inscrit dans cette lignée de travaux académiques sur le suivi de mouvement humanoïde, aux côtés des approches VLA déployées par les acteurs commerciaux du secteur. Le papier ne mentionne aucun plan de commercialisation ni partenaire industriel pour L7 : il s'agit à ce stade d'une publication de recherche démontrant une faisabilité technique, pas d'un déploiement en environnement réel. Aucun calendrier de suite n'est communiqué, mais la validation sur une charge de 24 kg positionne ce travail comme une référence potentielle pour les futurs benchmarks de téléopération humanoïde à charge lourde, un axe encore peu couvert face aux démonstrations de dextérité manuelle qui dominent la littérature.

RecherchePaper
1 source
Façonnage de la réalité des actionneurs pour l'apprentissage robotique sim-vers-réel en zero-shot
1679arXiv cs.RO 

Façonnage de la réalité des actionneurs pour l'apprentissage robotique sim-vers-réel en zero-shot

Des chercheurs proposent une nouvelle méthode pour résoudre le problème classique du transfert simulation-vers-réel en robotique, détaillée dans un article publié sur arXiv (référence 2607.02205v1). Baptisée "actuator reality shaping" (mise en forme de la réalité des actionneurs), l'approche inverse la logique habituelle : plutôt que de rendre le simulateur plus fidèle au monde réel via identification de système, randomisation de domaine ou modèles d'actionneurs appris, elle façonne le comportement en boucle fermée des actionneurs physiques pour qu'ils collent à la dynamique idéalisée du second ordre utilisée en simulation. Concrètement, chaque articulation est équipée d'un contrôleur à deux degrés de liberté combinant retour d'état (feedback) et anticipation (feedforward), ce qui sépare la mise en forme de la réponse de référence de la stabilisation robuste et crée une interface actionneur standardisée pour les politiques d'apprentissage par renforcement. Les chercheurs ont validé leur méthode sur un servomoteur mono-articulation à fort rapport de réduction soumis à des charges externes, ainsi que sur un bras robotique à 7 degrés de liberté (DOF) effectuant une tâche d'atteinte de cible, avec des politiques déployées en zero-shot, sans réglage fin ni modèle d'actionneur appris. Cette approche s'attaque directement à l'un des points de friction les plus persistants du secteur : l'écart entre démonstrations en simulation et performances réelles, souvent masqué par des vidéos soigneusement sélectionnées chez les acteurs commerciaux. Si la méthode tient ses promesses à plus grande échelle, elle offrirait une alternative moins coûteuse aux pipelines classiques de randomisation de domaine ou de modélisation fine des moteurs, avec un intérêt direct pour les intégrateurs qui peinent à faire tenir en conditions réelles des politiques entraînées uniquement en simulation. Les auteurs ont également testé le transfert zero-shot sur un robot à roues et jambes franchissant une pente, ainsi que sur un robot humanoïde en marche, suggérant une portée transversale à plusieurs morphologies. La méthode est comparée à des approches classiques de contrôle servo et à des références de type real-to-sim-to-real, avec une réduction substantielle de l'erreur de suivi rapportée dans les deux cas.

RecherchePaper
1 source
WorldSample : apprentissage par renforcement en boucle fermée sur robot réel avec modélisation du monde
1680arXiv cs.RO 

WorldSample : apprentissage par renforcement en boucle fermée sur robot réel avec modélisation du monde

Des chercheurs présentent WorldSample, un framework d'apprentissage par renforcement (RL) pour robots réels qui combine rollouts physiques et modèle du monde génératif afin de réduire le coût des interactions réelles. Le système ferme une boucle "réel-synthétique" : à partir de trajectoires observées sur un robot physique, un modèle du monde post-entraîné génère des transitions synthétiques haute fidélité, limitant fortement les hallucinations visuelles typiques de ces modèles génératifs. Plutôt que de traiter ces données synthétiques comme de simples remplacements de l'expérience réelle, les auteurs introduisent le Policy-Paced Learning (PPL), un mécanisme de sélection et d'ordonnancement des échantillons qui équilibre l'apport de l'augmentation de données contre le risque de surestimation de la valeur et le bruit induit par les hallucinations résiduelles. Sur des tâches de manipulation robotique riches en contacts et exigeant une précision fine, WorldSample améliore le taux de réussite des politiques de 28% tout en réduisant de 59% le nombre d'étapes d'entraînement nécessaires, par rapport aux méthodes de référence. La fidélité visuelle du modèle du monde progresse également nettement : +19,4dB en PSNR et +0,47 en SSIM par rapport à un post-entraînement uniquement basé sur les démonstrations. L'enjeu dépasse la simple performance : le RL sur robot réel reste handicapé par le coût de chaque rollout physique, qui ne révèle qu'un seul chemin action-résultat parmi d'innombrables possibles. En générant des variations synthétiques crédibles autour de trajectoires réelles, WorldSample attaque directement ce goulot d'étranglement, un problème central pour tout acteur cherchant à déployer du RL au-delà du simple apprentissage par imitation, limité par la couverture des démonstrations disponibles. C'est aussi une réponse concrète au problème classique de la surestimation de valeur en RL offline et à l'écart de fidélité (sim-to-real) qui plombe habituellement les modèles du monde utilisés comme simulateurs d'entraînement. Le travail s'inscrit dans la lignée des recherches récentes sur les modèles du monde appliqués à la robotique, où la génération vidéo/action sert de simulateur bon marché pour compléter des données réelles rares. Contrairement aux approches purement génératives qui risquent d'halluciner des dynamiques physiques irréalistes, WorldSample ancre systématiquement sa génération sur des rollouts réels et régule l'usage des données synthétiques via PPL. L'article, publié sur arXiv (2607.02431, catégorie "new"), ouvre la voie à des extensions vers d'autres familles de tâches manipulatoires et à une meilleure compréhension du compromis entre volume d'augmentation synthétique et risque d'erreur cumulée en boucle fermée.

RecherchePaper
1 source
VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches
1681arXiv cs.RO 

VT-WAM : modèle du monde et action visuo-tactile pour la manipulation à contacts riches

Des chercheurs présentent VT-WAM, un modèle de manipulation robotique combinant vision et toucher, décrit dans un article déposé sur arXiv (2607.02503v1) et accompagné d'un site dédié (vt-wam.github.io). Le système, un "Visual-Tactile World Action Model", apprend simultanément trois choses dans un même cadre de flow matching : prédire les images visuelles futures, prédire la déformation tactile future, et prédire l'action à exécuter. Deux mécanismes techniques soutiennent cette approche : une attention "Asymmetric Mixture-of-Transformers" (MoT) qui relie une première image de référence à la dynamique tactile dans le temps, et un module nommé AVTAG (Action-Visual-Tactile Attention Guidance) qui force le modèle à s'appuyer davantage sur le signal tactile pendant les phases de contact. Sur six tâches de manipulation en conditions réelles impliquant un contact physique important, VT-WAM atteint un taux de réussite moyen de 71,67%, contre des scores inférieurs de 26,67 points pour Fast-WAM et de 35,84 points pour OmniVTLA, deux modèles de référence utilisés en comparaison. L'enjeu dépasse la simple performance chiffrée : les politiques visuo-tactiles existantes se contentent généralement d'injecter le signal tactile brut dans la prédiction d'action, sans modéliser comment cette déformation évolue dans le temps. Or c'est précisément sur les tâches à fort contact (insertion, préhension d'objets déformables, gestion du glissement) que les modèles purement visuels ou de type VLA (vision-language-action) échouent le plus souvent, malgré des démonstrations impressionnantes en environnement contrôlé. Pour les intégrateurs industriels qui cherchent à automatiser des opérations d'assemblage fin, ce travail illustre une piste concrète pour combler l'écart entre démonstration et fiabilité réelle. Le papier s'inscrit dans la lignée des "world models" appliqués à la robotique, dont Fast-WAM constitue un prédécesseur direct servant de base de comparaison, aux côtés de familles de modèles VLA comme OmniVTLA. Il s'agit toutefois d'une publication académique, sans acteur industriel identifié ni date de déploiement annoncée : les résultats restent circonscrits à six tâches de laboratoire, et les auteurs eux-mêmes soulignent via leurs ablations que la modélisation de la dynamique tactile reste un problème ouvert plutôt qu'une solution définitivement close.

RecherchePaper
1 source
CoFL-S : champs de flux sectoriels interrogeables spatialement pour la navigation locale conditionnée par le langage
1682arXiv cs.RO 

CoFL-S : champs de flux sectoriels interrogeables spatialement pour la navigation locale conditionnée par le langage

La navigation par instructions en langage naturel (Vision-Language Navigation, VLN) a surtout progressé ces dernières années sur le raisonnement de haut niveau : compréhension des consignes, mémoire, cartographie globale, découpage des instructions en sous-tâches. La représentation d'action de bas niveau, elle, restait largement négligée. Une équipe de recherche propose CoFL-S (papier arXiv 2607.02222, publié début juillet 2026), un framework vision-langage-action qui prédit un champ de flux ("flow field") conditionné par le langage sur le secteur local visible du robot, puis génère des trajectoires continues en suivant ce champ. Pour l'entraîner, les chercheurs ont converti les épisodes du jeu de données VLN-CE, initialement des instructions complètes associées à des séquences d'actions, en supervision locale image par image, avec sous-instructions alignées, actions, trajectoires et champs de flux appariés. Ils introduisent aussi un nouveau benchmark Habitat en temps continu, qui isole l'interface d'action de bas niveau du découpage des instructions et fait passer toutes les méthodes par un contrôleur de commande de vitesse partagé, permettant une comparaison en boucle fermée indépendante de la fréquence du planificateur, plutôt que les transitions discrètes fixes (avancer/tourner) de VLN-CE classique. Cette distinction entre haut niveau et bas niveau touche un vrai angle mort du secteur : une bonne compréhension d'instruction ne garantit pas une exécution fluide si la couche de contrôle reste rigide ou dépendante d'une fréquence de planification fixe. En isolant cette couche et en la testant à différentes fréquences, l'équipe évalue si une politique d'action tient réellement la route en conditions variables, un enjeu direct pour tout déploiement réel de robots mobiles guidés par le langage, où la latence de calcul et la fréquence de décision varient selon le matériel. Sous encodeurs et réglages d'entraînement identiques, CoFL-S dépasse de façon constante les méthodes de référence à base de tokens d'action et de blocs d'action ("action-chunk"), quelle que soit la fréquence du planificateur testée. Les auteurs rapportent également un déploiement réel en zero-shot, en boucle fermée, où l'avantage de leur approche se confirme au-delà de la simulation, un point notable puisque le transfert sim-to-real reste l'un des obstacles les plus fréquemment cités dans la littérature VLN.

RecherchePaper
1 source
Robot rocker-bogie reconfigurable pour franchir des marches hautes et virer
1683arXiv cs.RO 

Robot rocker-bogie reconfigurable pour franchir des marches hautes et virer

Une équipe de chercheurs présente un mécanisme rocker-bogie reconfigurable capable de franchir des obstacles élevés tout en tournant efficacement, avec un nombre réduit d'actionneurs. Le système ajoute des moteurs au niveau des articulations bogie, qui font pivoter activement les bras vers le haut ou le bas pour basculer entre une configuration à quatre roues et une configuration à six roues. Des roues omnidirectionnelles sont montées à l'arrière des rockers, ce qui permet, en mode quatre roues, une rotation fluide basée sur un modèle à commande différentielle. Sur un prototype testé en conditions expérimentales, le mécanisme réalise un virage à rayon nul à une vitesse plus de cinq fois supérieure à celle d'un rocker-bogie classique équipé de six roues à crampons non directionnelles, tout en ne consommant qu'environ 17% du couple moyen total nécessaire aux roues. Le robot a également gravi une marche de 40 cm en 6,4 secondes en moyenne, confirmant ses capacités combinées de franchissement et de virage. L'intérêt de ce travail réside dans la résolution d'un compromis classique en robotique de terrain : les architectures rocker-bogie excellent pour franchir des obstacles mais tournent mal et exigent un couple important pour pivoter sur place, faute de roues directionnelles. En ajoutant seulement quelques actionneurs supplémentaires plutôt qu'un système de direction complet, cette approche réduit drastiquement la consommation d'énergie liée aux manœuvres tout en conservant l'aptitude à franchir de hauts obstacles. Cela intéresse directement les concepteurs de robots d'exploration, d'inspection ou d'intervention en environnements accidentés, où l'autonomie énergétique et la maniabilité sont critiques. Le rocker-bogie est historiquement associé aux rovers martiens de la NASA (Spirit, Opportunity, Curiosity, Perseverance), conçus pour leur robustesse sur terrain rocailleux mais réputés peu agiles en rotation. Ce travail, publié en préimpression sur arXiv début juillet 2026, reste à un stade de prototype de laboratoire, sans indication de partenariat industriel ni de calendrier de déploiement. Les prochaines étapes probables incluraient des essais sur terrains plus variés et une validation à plus grande échelle avant tout transfert vers des applications d'exploration planétaire ou de robotique de terrain.

RecherchePaper
1 source
L'imagination du toucher : manipulation guidée par le toucher via des représentations tactiles imaginées
1684arXiv cs.RO 

L'imagination du toucher : manipulation guidée par le toucher via des représentations tactiles imaginées

Des chercheurs présentent TacImag, un framework qui apprend à un robot à « imaginer » le toucher plutôt que de le mesurer physiquement. Le système prédit des signaux tactiles à partir de la vision et de la proprioception seules, en s'entraînant sur des démonstrations où vision et tactile réel sont enregistrés en parallèle. Une fois entraîné, TacImag guide les politiques de manipulation sans capteur tactile au moment du déploiement. L'équipe l'a évalué sur six tâches en simulation et quatre tâches réelles. Les résultats montrent que les champs de force imaginés améliorent les tâches sensibles au contact de 44,4% en moyenne, tandis que les images tactiles imaginées améliorent les tâches sensibles à la texture de 23,3%, un écart qui révèle que l'efficacité de la méthode dépend fortement du type de représentation choisi selon la tâche visée. Article publié sur arXiv (2607.01684v1). L'enjeu pratique est significatif pour l'industrie de la manipulation robotique : les capteurs tactiles restent fragiles, nécessitent un étalonnage régulier et alourdissent la maintenance, ce qui freine leur adoption à grande échelle chez les intégrateurs. En montrant qu'un robot peut bénéficier des avantages du toucher sans embarquer de matériel tactile en production, TacImag ouvre une voie pour réduire coûts et complexité tout en gardant les gains de performance sur les tâches de contact fin, comme l'insertion ou la manipulation d'objets fragiles. Point notable soulevé par les auteurs eux-mêmes : le système ne se contente pas de reconstituer une mesure tactile manquante. Il agit plutôt comme une forme de supervision consciente du contact, qui transforme des indices visuels d'interaction subtils en représentations plus facilement exploitables par les politiques d'apprentissage. Le travail s'inscrit dans la recherche sur la manipulation robotique riche en contacts, un domaine où le tactile est étudié depuis plusieurs années comme complément à la vision pour les gestes fins. Il s'agit ici d'une contribution académique, sans déploiement industriel ni produit commercial associé. Les auteurs suggèrent que la prochaine étape consistera à généraliser l'approche à des scénarios de contact plus divers et à l'intégrer dans des pipelines d'apprentissage de politiques plus larges, notamment les modèles vision-langage-action.

RecherchePaper
1 source
VLA-Corrector : inférence légère de détection-correction pour un horizon d'action adaptatif
1685arXiv cs.RO 

VLA-Corrector : inférence légère de détection-correction pour un horizon d'action adaptatif

Des chercheurs présentent VLA-Corrector, un module de correction en ligne pour les modèles vision-langage-action (VLA) utilisés en robotique manipulatrice, décrit dans un article publié sur arXiv (2607.01804) début juillet 2026. Le problème visé est celui du "chunking" d'actions : pour limiter la fréquence d'appel au modèle, la plupart des politiques VLA génératives prédisent un bloc de plusieurs actions futures et les exécutent en boucle ouverte, sans réévaluation intermédiaire. Or dans les tâches à contact riche (préhension, insertion, manipulation fine), une simple perturbation locale peut s'amplifier pendant cette fenêtre "aveugle" et faire échouer la tâche par accumulation d'erreurs. VLA-Corrector ajoute deux briques légères sans toucher aux poids du modèle de base : un moniteur visuel en espace latent (LVM) qui compare en continu l'évolution visuelle prédite et réelle pour détecter les écarts de dynamique, et un mécanisme de replanification par gradient en ligne (OGG) qui, en cas de dérive persistante, tronque le bloc d'actions restant et recalcule une trajectoire corrective. L'intérêt pour les intégrateurs et décideurs robotique tient à l'horizon d'action adaptatif que ce système induit automatiquement : long horizon tant que l'exécution reste fiable, replanification courte dès que la dérive apparaît. Cela répond directement à un compromis connu du secteur entre robustesse d'exécution et fréquence d'appel au modèle, sans nécessiter de réentraînement du backbone. Si les résultats se confirment à plus grande échelle, ce type de correcteur "greffable" pourrait devenir un composant standard pour fiabiliser des VLA déployés en usine ou en logistique, là où les erreurs de contact restent le principal frein à la mise en production au-delà des démonstrations en laboratoire. Ce travail s'inscrit dans la lignée des efforts pour combler l'écart entre modèles VLA génériques (de type Pi-0 ou GR00T) et exigences de fiabilité industrielle, en ciblant spécifiquement les tâches manipulatrices longues et sensibles au contact. Les auteurs présentent VLA-Corrector comme compatible avec différents modèles VLA existants, sans détailler pour l'instant de déploiement matériel réel ni de partenariat industriel : il s'agit à ce stade d'une contribution de recherche méthodologique, dont la prochaine étape logique serait une validation sur des plateformes robotiques physiques variées plutôt que uniquement en simulation.

IA physiqueActu
1 source
ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde
1686arXiv cs.RO 

ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde

ACID (Action Consistency via Inverse Dynamics), présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.02403v1), s'attaque à un défaut connu de la planification par modèles du monde conditionnés par l'action, une méthode largement utilisée en contrôle robotique. Le problème identifié par les auteurs : le coût de planification standard ne juge une trajectoire candidate qu'à l'aune de la proximité entre l'état terminal prédit et l'objectif, sans vérifier si les transitions intermédiaires sont réalisables. Résultat, une trajectoire peut sembler cohérente sur le papier tout en divergeant fortement une fois exécutée dans l'environnement réel. ACID introduit un principe de "cohérence d'action cyclique" : à chaque étape, un modèle de dynamique inverse tente de retrouver, à partir de la transition prédite, l'action qui l'a produite ; l'écart entre cette action reconstruite et l'action réelle est intégré au coût de planification via une pondération adaptative invariante à l'échelle. Les auteurs valident la méthode sur quatre modèles du monde différents et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle de systèmes articulés et la navigation visuelle, avec un gain systématique en qualité de planification. L'apport principal n'est pas seulement la précision, mais l'efficacité : ACID atteint une exactitude comparable aux méthodes de référence tout en réduisant substantiellement le budget de calcul nécessaire à la planification. C'est un point sensible pour l'embarqué robotique, où le temps de cycle et la puissance de calcul disponible contraignent directement le déploiement temps réel. Le papier touche aussi à un débat plus large dans le secteur : la fiabilité des modèles du monde utilisés pour anticiper les conséquences d'une action avant de l'exécuter, un maillon critique face aux erreurs qui s'accumulent le long d'une trajectoire prédite. Cette approche s'inscrit dans la lignée des travaux sur la planification par modèle prédictif (MPC) couplée à des dynamiques apprises, une alternative aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui n'exposent pas de mécanisme de vérification explicite des trajectoires intermédiaires. Publié en preprint, ACID n'a pas encore fait l'objet d'une revue par les pairs ni d'une validation sur robot physique au-delà des bancs de test utilisés dans l'étude ; la suite logique serait une évaluation en conditions réelles et une comparaison directe avec les méthodes de planification par diffusion, autre piste active du domaine.

RecherchePaper
1 source
BIFROST : transfert de représentation de caractéristiques invariantes pour le passage simulation-réel dans l'espace d'observation
1687arXiv cs.RO 

BIFROST : transfert de représentation de caractéristiques invariantes pour le passage simulation-réel dans l'espace d'observation

Des chercheurs ont publié sur arXiv (référence 2607.01410v1) un nouveau système appelé BIFROST (Bridging Invariant Feature Representation for Observation-space Sim2Real Transfer), destiné à résoudre l'un des obstacles centraux de l'apprentissage robotique par renforcement : le fossé entre simulation et réalité. Le principe consiste à entraîner un encodeur partagé sur des données appariées provenant des deux domaines, via un objectif de bisimulation cross-domaine qui rapproche, dans un espace latent commun, les séquences observation-action menant aux mêmes résultats à long terme, indépendamment des différences de rendu visuel ou de physique. L'équipe a testé l'approche sur trois tâches : navigation visuelle en sim2sim, manipulation à contact riche en sim2real, et asservissement visuel. Selon le papier, les politiques entraînées dans cet espace latent partagé transfèrent en zero-shot vers la réalité, sans réentraînement sur données réelles, là où les méthodes de référence en adaptation de domaine et en co-entraînement échouent face à des écarts à la fois visuels et dynamiques. Pour l'industrie robotique, le sim2real reste le goulot d'étranglement entre démonstration en laboratoire et déploiement en usine : entraîner en simulation coûte peu, mais transférer une politique vers un robot physique sans perte de performance exige d'habitude des mois de randomisation de domaine ou de fine-tuning gourmand en données réelles. Si les résultats se confirment à plus grande échelle, la promesse est de réduire nettement le coût de mise en production de politiques de manipulation et de navigation, un enjeu clé pour les intégrateurs déployant bras robotiques ou AMR sur des sites variés. C'est aussi un signal dans le débat sur les architectures VLA : l'idée d'une structure invariante exploitable directement depuis l'observation brute pourrait simplifier la conception des politiques génériques que recherchent des labos comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T). À noter que, publication arXiv non encore relue par les pairs, la portée reste limitée aux trois tâches testées en environnement contrôlé. Le problème est documenté depuis les débuts du RL appliqué à la robotique : les approches historiques traitent séparément l'écart visuel (randomisation de domaine, transfert de style) et l'écart dynamique (identification de système, randomisation physique), les deux modules étant ensuite empilés quand les problèmes coexistent, une approche jugée limitée par les auteurs car elle traite les symptômes plutôt que la structure commune sous-jacente. BIFROST s'inscrit dans la lignée des travaux sur la bisimulation en apprentissage par renforcement, appliquée ici explicitement au transfert cross-domaine. Aucune entreprise ni calendrier de commercialisation n'est mentionné : le travail reste une contribution académique, dont les suites attendues sont une validation sur des tâches plus complexes et une comparaison directe avec les politiques VLA déployées par les acteurs commerciaux du secteur humanoïde et manipulation.

RecherchePaper
1 source
IA physique : modèle du monde 3D fondé sur les principes physiques pour la manipulation d'objets dynamiques (PhysMani)
1688arXiv cs.RO 

IA physique : modèle du monde 3D fondé sur les principes physiques pour la manipulation d'objets dynamiques (PhysMani)

Des chercheurs présentent PhysMani, un framework qui couple un modèle du monde en Gaussiennes 3D fondé sur la physique avec un modèle de politique d'action anticipatif, pour la manipulation d'objets rapides et dynamiques en environnement 3D non structuré. Le modèle du monde apprend un champ de vitesse gaussien à divergence nulle par optimisation en ligne, ce qui permet une prédiction rapide et physiquement cohérente de la dynamique future de la scène. Le modèle de politique intègre ensuite ces prédictions via un module d'attention croisée à base de tokens appris. Les auteurs introduisent également PhysMani-Bench, un nouveau benchmark de manipulation dynamique composé de 16 tâches, et rapportent un taux de réussite supérieur à des baselines solides, aussi bien en simulation que lors d'expériences avec un robot réel. Le papier, publié sur arXiv (2607.01938), ne précise ni la plateforme robotique utilisée ni de métriques chiffrées exactes (taux de réussite, temps de cycle, charge utile), ce qui en fait à ce stade une contribution de recherche plutôt qu'un produit ou un déploiement commercial. Pour l'industrie robotique, ce travail s'attaque à un point faible connu des modèles vision-langage-action (VLA) et des world models existants: leur difficulté à représenter une géométrie 3D précise et à anticiper une dynamique physiquement plausible pour des objets en mouvement rapide. La manipulation de cibles dynamiques, objets qui tombent, glissent ou sont lancés, reste l'un des angles morts des démonstrations actuelles de bras robotiques et d'humanoïdes, la plupart des systèmes généralistes étant surtout validés sur de la manipulation quasi statique. Si les résultats de PhysMani se confirment au-delà du cadre académique, cela ouvrirait une piste pour réduire l'écart entre démonstration en laboratoire et usage réel en logistique ou en industrie, où la prise d'objets en mouvement est fréquente sur convoyeur ou en tri à cadence élevée. Mais tant que l'étude reste limitée à un benchmark maison et sans comparaison indépendante, il s'agit d'une preuve de concept à confirmer, pas d'une solution prête à intégrer. Ce travail s'inscrit dans la lignée des world models 3D construits sur des représentations en Gaussiennes, une technique héritée du rendu de scènes et de plus en plus utilisée en robotique pour modéliser des environnements denses. Ces approches se positionnent face aux modèles VLA de bout en bout entraînés sur de larges corpus de démonstrations, popularisés par des acteurs comme Physical Intelligence avec Pi-0 ou NVIDIA avec GR00T N2, ainsi qu'aux world models déjà exploités par d'autres équipes de recherche en manipulation. Aucun partenaire industriel ni acteur français ou européen n'est mentionné dans l'abstract. La suite logique pour les auteurs serait d'étendre le benchmark, de tester la méthode sur des plateformes robotiques variées, et de la comparer directement aux VLA généralistes pour situer PhysMani face aux solutions déjà commercialisées.

RechercheOpinion
1 source
Influence des fonctions d'activation à base radiale sur un contrôleur intelligent pour manipulateurs robotiques
1689arXiv cs.RO 

Influence des fonctions d'activation à base radiale sur un contrôleur intelligent pour manipulateurs robotiques

Une équipe de chercheurs a publié le 2 juillet 2026 sur arXiv (2607.02167) une étude sur le contrôle intelligent de bras robotiques manipulateurs, combinant commande non linéaire basée modèle et réseaux de neurones à fonction de base radiale (RBF) pour l'estimation en ligne des perturbations. Le système compense les incertitudes paramétriques, les frottements et les dynamiques non modélisées grâce à une loi d'adaptation fondée sur la théorie de Lyapunov avec projection, garantissant la bornitude des signaux en boucle fermée et la convergence de l'erreur de poursuite de trajectoire vers une région compacte. L'objectif central des auteurs était de mesurer l'impact du choix de la fonction d'activation au sein du réseau RBF sur le comportement transitoire, la précision en régime permanent et la douceur de la commande. Le contrôleur a été testé expérimentalement sur un manipulateur robotique réel, comparant plusieurs noyaux d'activation. Les résultats montrent que la stabilité est préservée quel que soit le noyau utilisé, mais que le choix de la fonction d'activation modifie significativement la dynamique d'adaptation et les performances pratiques de poursuite. Pour les concepteurs de systèmes de commande robotique, cette conclusion transforme un paramètre souvent traité comme un détail d'implémentation en véritable levier de conception structurel : sélectionner la bonne fonction d'activation peut améliorer la précision et la fluidité du mouvement sans changer l'architecture globale du contrôleur, un enjeu concret pour les intégrateurs travaillant sur des bras industriels ou collaboratifs soumis à des charges variables et des frottements imprévisibles. Cette recherche s'inscrit dans la lignée des travaux sur la commande adaptative neuronale des manipulateurs, un domaine où les réseaux RBF sont utilisés depuis plusieurs années pour approximer des dynamiques complexes difficiles à modéliser analytiquement. Contrairement aux approches d'apprentissage profond plus lourdes en calcul, la structure RBF combinée à une preuve de stabilité de Lyapunov offre des garanties mathématiques recherchées dans les applications industrielles critiques. L'étude ne précise pas de suites concrètes ni de partenariat industriel, s'inscrivant dans une démarche de recherche fondamentale plutôt que de déploiement commercial immédiat.

RecherchePaper
1 source
Tech Giants se ruent vers l'intelligence incarnée alors que la bataille s'intensifie
1690Pandaily 

Tech Giants se ruent vers l'intelligence incarnée alors que la bataille s'intensifie

Li Auto, Alibaba et ByteDance viennent d'annoncer leur entrée dans l'intelligence incarnée (embodied intelligence), signe que la bataille chinoise des robots humanoïdes s'intensifie. Li Auto a dévoilé son projet de véhicules à intelligence incarnée, Alibaba a lancé sa série de modèles fondation Qwen-Robot dédiée à la robotique, et ByteDance a restructuré sa division IA Seed pour en faire une activité stratégique centrale. Morgan Stanley prévoit 28 000 ventes de robots humanoïdes en Chine en 2026, soit une hausse de 133% sur un an, avec une projection à 2,6 millions d'unités d'ici 2035. Roland Berger estime que le marché de la robotique chez les constructeurs automobiles pourrait atteindre 750 milliards de dollars en 2035, puis 4 000 milliards en 2050, une échelle comparable à celle de l'industrie automobile elle-même. Le financement suit la même dynamique: selon IT Orange, entre juillet 2025 et juin 2026, le marché primaire chinois a enregistré 503 levées de fonds dans l'intelligence incarnée, pour un total dépassant 96 milliards de yuans (environ 12,4 milliards d'euros). Une vingtaine d'entreprises du secteur, dont Unitree, AgiBot et Galaxy General, ont annoncé des projets d'introduction en bourse. Cette ruée signale un changement de nature dans la course aux humanoïdes: elle passe du stade de la démonstration technologique à celui de l'infrastructure industrielle, avec les géants du numérique chinois (Alibaba, Tencent, ByteDance) qui se positionnent comme fournisseurs de modèles fondation plutôt que comme simples investisseurs. Le rapprochement avec l'automobile est particulièrement révélateur: les chaînes d'approvisionnement des véhicules électriques (capteurs, systèmes de décision, actionneurs, pipelines de données) sont directement réutilisables pour développer des robots humanoïdes, ce qui explique l'entrée de constructeurs comme Li Auto. Son PDG Li Xiang décrit d'ailleurs le véhicule à intelligence incarnée comme un produit "quatre-en-un": voiture électrique, chauffeur professionnel, ordinateur IA et assistant de vie. Mais l'engouement financier masque un secteur encore très jeune: Unitree, pourtant leader reconnu, ne détient que 262 brevets, dont 20 seulement sont des brevets d'invention fondamentaux, ce qui indique qu'aucune barrière technologique durable n'est encore établie. La compétition reste ouverte à de nouveaux entrants, comme l'a montré le récent semi-marathon de robots humanoïdes, remporté de manière inattendue par Honor Robot face à des acteurs plus établis. Cette effervescence chinoise s'inscrit dans un mouvement mondial où startups spécialisées (Figure, Agility) et laboratoires de modèles VLA (comme ceux derrière GR00T ou Helix) rivalisent également pour dominer la prochaine génération de robots généralistes. Pour l'instant, la Chine mise sur une convergence entre capitaux, industrie automobile et plateformes technologiques pour accélérer le déploiement, avec des étapes clés à surveiller: les premières introductions en bourse du secteur, les objectifs de vente 2026, et la concrétisation ou non des promesses de véhicules à intelligence incarnée de Li Auto.

Chine/AsieOpinion
1 source
Kelidian Technology développe des robots de transfert pour personnes âgées avec Tsinghua, CAS et l'hôpital West China
1691Pandaily 

Kelidian Technology développe des robots de transfert pour personnes âgées avec Tsinghua, CAS et l'hôpital West China

La société shenzhenoise Kelidian Technology a bouclé un tour de financement stratégique mené par Leaguer Tech Innovation, avec la participation d'une plateforme rattachée à l'Institut de recherche en sciences et technologies appliquées intelligentes du Jiangsu Zhongke. Les fonds serviront au développement produit, au renforcement de l'équipe et au déploiement commercial. Kelidian se positionne sur la robotique assistée par IA pour le soin aux personnes âgées, un marché porté par l'essor de l'économie silver en Chine. L'entreprise développe deux lignes de produits parvenues au stade de prototype d'ingénierie et en voie de passer en production pilote à petite échelle : un robot compagnon domestique pour le maintien à domicile, et le GR-150, un robot de transfert pour la rééducation conçu avec l'hôpital West China de l'université du Sichuan. Le GR-150 s'appuie sur une navigation SLAM haute précision et une fusion multi-capteurs pour se déplacer de façon autonome en intérieur et assister le transfert de patients à mobilité réduite. Kelidian a déposé plusieurs dizaines de brevets et de dépôts de droits d'auteur logiciels, et sollicite en Chine l'enregistrement du GR-150 comme dispositif médical de classe II. Le robot compagnon domestique fait office de hub de soin connecté : surveillance de santé, compagnie émotionnelle, assistance cognitive, contrôle de sécurité, reconnaissance de l'utilisateur à son retour avec salutation vocale, suivi nocturne avec détection de chutes et alertes, plus un écran interactif pour la vidéo, la musique et les rappels de médicaments. Ce double positionnement, robot de transfert médicalisé d'un côté et compagnon domestique de l'autre, illustre une stratégie assez courante chez les acteurs chinois de la robotique de service : capter la demande hospitalière réglementée pour asseoir une crédibilité technique et clinique, tout en construisant en parallèle un marché grand public sur le maintien à domicile, nettement plus vaste mais aussi plus concurrentiel. Pour les intégrateurs et décideurs du secteur médico-social, le GR-150 reste à ce stade un prototype en transition vers la petite série, sans déploiement clinique confirmé ni volumes chiffrés : la démarche d'homologation en classe II en Chine, si elle aboutit, sera le vrai jalon à surveiller plutôt que les annonces de financement elles-mêmes. Sur le plan technique, l'accent mis sur l'adaptation du moteur NLP/NLU aux particularités de la parole des personnes âgées (débit plus lent, prononciation atypique, dialectes) et sur la fusion de radar biologique ou d'imagerie thermique infrarouge pour le dépistage d'apnées du sommeil et l'analyse de variabilité cardiaque témoigne d'une approche produit assez mature pour ce segment, encore largement expérimental ailleurs dans le monde. L'équipe fondatrice s'appuie sur un ancrage académique fort : le CEO et CTO Zhang Tengteng, chercheur postdoctoral à Tsinghua, titulaire d'un doctorat de l'université d'ingénierie de Harbin et d'un master de l'Académie chinoise des sciences (CAS), est spécialisé en reconnaissance de formes et perception robotique. Le cofondateur et chief scientist Gong Xinyi, professeur à l'université Hangzhou Dianzi, est également diplômé de Tsinghua et de la CAS. Cette filiation Tsinghua-CAS, combinée au partenariat clinique avec West China Hospital, positionne Kelidian dans la lignée d'autres spin-offs universitaires chinoises qui cherchent à transformer une expertise en perception et navigation robotique en produits médicaux commercialisables, dans un marché de la silver economy que Pékin pousse activement depuis plusieurs années via des politiques de soutien à l'innovation gériatrique.

Chine/AsieOpinion
1 source
$8,000 : ce robot est prêt à s'occuper de toute la lessive et de faire les lits
1692New Atlas Robotics 

$8,000 : ce robot est prêt à s'occuper de toute la lessive et de faire les lits

Weave Robotics dévoile Isaac 1, un robot domestique facturé 8 000 dollars et présenté comme capable de plier le linge, ranger le salon et faire le lit à la demande. La startup avait annoncé son tout premier robot plieur de linge il y a seulement cinq mois ; ce nouveau modèle élargit donc les tâches ménagères couvertes tout en conservant, selon l'entreprise, un design plus soigné et plus avenant que celui de son prédécesseur. Les tags associés à l'annonce (télé-opération, robot assistant) suggèrent que certaines de ces tâches restent supervisées ou pilotées à distance plutôt que totalement autonomes, un point que le communiqué ne détaille pas explicitement. Ce lancement illustre la cadence accélérée des startups de robotique domestique, capables de faire évoluer leur gamme en quelques mois à peine, et la course à un prix d'entrée grand public pour des robots polyvalents à la maison. Historiquement, le pliage de linge autonome reste l'une des tâches les plus difficiles à automatiser de façon fiable en raison de la manipulation de tissus déformables ; l'ajout du rangement du salon et du bordage de lit signale une ambition de couvrir plusieurs corvées ménagères avec une seule plateforme plutôt qu'un robot mono-tâche. Reste à vérifier, comme souvent dans ce secteur, l'écart entre les démonstrations marketing et la fiabilité réelle en conditions d'usage quotidien, notamment le niveau d'autonomie effectif par rapport à la télé-opération mentionnée. Le contexte précis de Weave Robotics (origine, financement, équipe) n'est pas précisé dans l'annonce, qui se concentre sur le produit. La startup s'inscrit dans une vague plus large d'acteurs de la robotique d'assistance domestique cherchant à sortir des simples démonstrateurs pour proposer des produits commercialisables à un prix inférieur à celui des humanoïdes généralistes. Aucune date de disponibilité, zone de commercialisation ni volume de production n'est communiqué à ce stade, ce qui limite la portée de l'annonce à un teaser produit plutôt qu'à un déploiement confirmé.

IA physiqueActu
1 source
Automate 2026 : bilan du salon
1693Robotics Business Review 

Automate 2026 : bilan du salon

Dans l'épisode 251 du Robot Report Podcast, les animateurs Steve Crowe et Mike Oitzman reçoivent Sarah Wynn, rédactrice en chef du site sœur Packaging OEM, pour un retour sur le salon Automate qui s'est tenu le mois dernier aux États-Unis. Sur les stands, les humanoïdes industriels Atlas (Boston Dynamics) et Digit (Agility Robotics) n'étaient présentés qu'en exposition statique, sans démonstration dynamique. Chez ABB Robotics, Craig McDonald, directeur général de la division robotique industrielle, a détaillé les avancées en IA physique, la palettisation pilotée par IA et des collaborations avec NVIDIA. FANUC a mis en avant le suivi de mouvement en temps réel pour l'assemblage, l'automatisation du traitement des protéines et la programmation de robots en langage naturel. Chez Sereact, Mason Coleman, directeur des ventes Amérique du Nord, a évoqué le "zero-shot picking", les tendances de l'e-grocery et la réaffectation de la main-d'œuvre. Mech-Mind a fait une démonstration de bin-picking sans CAO sur des bouteilles transparentes de formes variées, et Christian Kassow, fondateur de Kassow Robots, a défendu les cobots 7 axes face aux configurations 6 axes classiques pour la manipulation mobile en espace confiné. Rockwell Automation, via Ara Surenian, responsable production logistics, a présenté FactoryTalk Orchestration, dans la foulée du rachat d'OTTO Motors. Le signal principal du salon est un basculement net : après plusieurs éditions dominées par le hype humanoïde, Automate 2026 a montré une industrie qui se recentre sur le déploiement concret d'IA physique et de calcul en périphérie (edge computing), plutôt que sur des démonstrations spectaculaires mais non industrialisées. Pour les intégrateurs et décideurs B2B, le message est clair : l'orchestration logicielle, les jumeaux numériques et la cinématique avancée deviennent les vrais leviers de productivité, notamment pour compenser les pénuries de main-d'œuvre et capturer le savoir-faire des opérateurs expérimentés avant leur départ à la retraite. Le débat Schneider Electric contre Siemens sur l'architecture edge/cloud, l'un plaidant pour des systèmes ouverts agnostiques au matériel, l'autre pour une approche hybride appuyée sur NVIDIA Omniverse, illustre une bataille de standardisation encore ouverte dans l'automatisation industrielle. Ce virage s'inscrit dans une dynamique amorcée depuis plusieurs trimestres, où les grands noms de la robotique industrielle (ABB, FANUC, Rockwell) absorbent des briques d'IA générative et de vision pour rester compétitifs face à des acteurs plus agiles comme Sereact ou Mech-Mind sur le picking flexible. Des fournisseurs plus modestes, SEW-EURODRIVE, Festo, CODI Manufacturing ou Vention, misent sur des cellules compactes et accessibles pour équiper les PME industrielles. L'épisode ne donne pas de calendrier précis de déploiement pour ces technologies, mais confirme que la prochaine bataille se jouera sur l'orchestration logicielle plus que sur la forme du robot.

IndustrielActu
1 source
Reflets de l'ICRA 2026
1694Robohub 

Reflets de l'ICRA 2026

Vienne a accueilli du 1er au 5 juin 2026 la conférence IEEE ICRA (International Conference on Robotics & Automation), rassemblant chercheurs et industriels au Messe Wien, également connu sous le nom de VIECON. L'événement s'est ouvert par la deuxième édition du workshop WOROBET (Workshop on Robot Ethics: Ethical, Legal and User Perspectives in Robotics & Automation), consacré aux implications éthiques de l'interaction homme-robot. Yasuhisa Hirata, professeur à l'université de Tohoku, y a présenté sa vision des robots d'assistance physique comme les exosquelettes détachables ou les fauteuils roulants à pédalage, soulignant leur effet sur le sentiment d'efficacité personnelle des utilisateurs. Minoru Asada, de l'université d'Osaka, a proposé une piste plus radicale : doter les robots de signaux de douleur pour qu'ils perçoivent le monde comme les humains. Alan Winfield, professeur d'éthique robotique à UWE Bristol, a défendu une approche opposée, centrée sur le robot comme simple outil, et a détaillé un cadre d'investigation des accidents impliquant des robots sociaux, inspiré des méthodes de l'aviation. Praminda Caleb-Solly, de l'université de Nottingham, a clos la journée par un exercice de red-teaming autour d'un robot d'assistance destiné à un enseignant en convalescence d'AVC à domicile. Sur le salon d'exposition, les robots humanoïdes de taille enfant de Booster Robotics animaient l'entrée du hall en jouant au football, en dansant ou en démontrant des mouvements de kung-fu. Ces débats dépassent le cadre académique : ils posent la question de savoir si l'intelligence robotique nécessite une forme de moralité incarnée, ou si elle doit rester cantonnée à des outils encadrés par la gouvernance humaine. Winfield a notamment averti qu'intégrer une éthique programmée dans les robots risque de déresponsabiliser moralement les ingénieurs, tout en restant vulnérable au piratage malveillant. Pour les décideurs et intégrateurs, le message est clair : la robotique sociale, en particulier dans le soin à domicile, va se heurter à des choix de conception qui touchent directement à l'autonomie des utilisateurs, un enjeu appelé à devenir central à mesure que ces robots se déploient dans le quotidien. Ce workshop, à sa deuxième édition, illustre une prise de conscience croissante au sein de la communauté ICRA que les questions de gouvernance et de responsabilité doivent avancer au même rythme que les capacités techniques. La confrontation entre la vision japonaise, portée par Hirata et Asada, et l'approche britannique de Winfield, reflète des différences culturelles plus larges entre Est et Ouest sur le statut des machines. À mesure que les besoins en robotique de soin s'intensifient avec le vieillissement démographique, ces cadres éthiques et légaux, encore balbutiants, devront rapidement se structurer pour accompagner les déploiements à venir.

Societe/EthiqueActu
1 source
RoboCup2026, ligue humanoïde : jour 1
1695Robohub 

RoboCup2026, ligue humanoïde : jour 1

RoboCup 2026 a débuté à Incheon, en Corée du Sud, avec des compétitions par ligue qui se poursuivront jusqu'au 5 juillet. Nouveauté cette année : les ligues de football robotique se concentrent désormais principalement sur les robots humanoïdes, répartis en trois catégories selon leur taille. La division small league compte 18 équipes, la division middle 16 équipes, et la division large league en réunit 22. Les deux premiers jours sont consacrés à une phase de qualification en système suisse, qui déterminera les équipes qualifiées pour les phases finales à élimination directe. À l'issue de la première journée, les divisions small et middle ont chacune disputé deux matchs, tandis que la large league était encore à mi-parcours de son deuxième tour. En tête de la division small avec six points sur six : GeoHBots, CAU Mountain&Sea et Hamburg Bit-Bots. Côté middle division, trois équipes affichent également un sans-faute : B-Human, RoboRoos et HTWK Robots. La journée a également été marquée par la cérémonie d'ouverture. Ce recentrage de RoboCup sur les humanoïdes illustre un mouvement de fond dans la recherche robotique : le bipède devient la plateforme de référence pour tester locomotion dynamique, perception et coordination multi-agents en environnement non structuré, plutôt qu'un simple axe parmi d'autres. Contrairement aux démonstrations commerciales de robots humanoïdes industriels, cette compétition met à l'épreuve des systèmes académiques en conditions réelles et non scriptées, sans montage vidéo sélectif : chaque match est un test public reproductible des capacités d'équilibre, de vision et de prise de décision en temps réel, avec un historique de résultats vérifiable au fil du tournoi. RoboCup a été fondée en 1997 avec l'objectif affiché de voir une équipe de robots humanoïdes battre les champions du monde humains de football d'ici 2050. Le tournoi rassemble traditionnellement des équipes universitaires de nombreux pays, à l'image de B-Human (Brême, Allemagne) ou HTWK Robots (Leipzig), habituées du haut du classement. La compétition se poursuit avec la fin de la phase de qualification les prochains jours, avant l'enchaînement des phases à élimination directe jusqu'à la clôture le 5 juillet, avec des retransmissions en direct disponibles pour chaque terrain.

RecherchePaper
1 source
Robots dextres et positionnement mécanique : pourquoi les combiner pour l'assemblage complexe
1696Robotics Business Review 

Robots dextres et positionnement mécanique : pourquoi les combiner pour l'assemblage complexe

Les fabricants de robots industriels misent de plus en plus sur les systèmes de positionnement mécanique pour étendre les capacités de leurs bras robotisés dans l'assemblage complexe. Quatre familles de solutions se dégagent: les systèmes de transfert linéaire, qui ajoutent un septième axe de déplacement sur rail pour permettre à un robot de couvrir de grands ensembles comme des structures aéronautiques ou de défense; les tables d'indexation rotative, qui accélèrent les cadences en autorisant l'exécution simultanée de tâches d'assemblage, de conditionnement et de contrôle qualité; les positionneurs de pièces multi-axes, qui font pivoter la pièce elle-même plutôt que de limiter le robot à une approche fixe, utiles pour les géométries irrégulières de l'automobile et de l'aérospatial; et le positionnement par vision, qui combine caméras et capteurs pour corriger la trajectoire du bras en temps réel face à un obstacle. Deux cas concrets illustrent la tendance. FANUC, pionnier japonais de l'automatisation industrielle, a équipé l'entreprise d'emboutissage métallique Pentaflex avec son bras compact LR Mate 200iD: la modernisation de la ligne a permis de réduire le nombre d'unités de main-d'œuvre par équipe tout en rendant l'atelier plus flexible. En Allemagne, KUKA a déployé sa série KR QUANTEC, conçue pour les applications lourdes et les transferts linéaires, chez Meiller Aufzugtüren, fabricant de portes palières, pour ses lignes d'assemblage automobile et de construction. ABB, troisième grand constructeur mondial avec son IRB 6700, est également cité parmi les acteurs de référence sur ce segment. Pour les intégrateurs et décideurs industriels, ce constat déplace le centre de gravité du débat sur la robotisation: la performance d'un bras robotisé ne se résume pas à sa dextérité ou à sa charge utile, mais dépend largement des mécanismes de positionnement qui l'entourent. Un robot doté d'une excellente préhension reste limité par une portée fixe s'il n'est pas couplé à un rail, une table rotative ou un positionneur de pièce. Cette approche modulaire, où le gain de performance vient autant de la mécanique périphérique que du contrôleur du bras, explique pourquoi des secteurs à forte contrainte géométrique comme l'aérospatial et l'automobile continuent de confier des tâches jusqu'ici manuelles à des cellules robotisées hybrides, plutôt que d'attendre des bras universels plus habiles. Cette évolution s'inscrit dans la concurrence historique entre les trois grands de la robotique industrielle, FANUC, KUKA et ABB, qui se disputent depuis des décennies le marché de l'automatisation d'usine, bien avant l'essor récent des robots humanoïdes. Les gains rapportés par Pentaflex et Meiller Aufzugtüren restent des études de cas fournies par les constructeurs eux-mêmes, sans données chiffrées indépendantes sur les cadences ou les coûts. Le secteur doit par ailleurs se retrouver lors du salon RoboBusiness 2026, qui a ouvert son appel à propositions de sessions, signe que le sujet du positionnement mécanique devrait rester au centre des discussions sur l'automatisation d'assemblage dans les mois à venir.

IndustrielOpinion
1 source
Luxonis boucle une levée de série A pour développer sa couche de perception dédiée à l'IA physique
1697Robotics Business Review 

Luxonis boucle une levée de série A pour développer sa couche de perception dédiée à l'IA physique

Luxonis, société basée à Denver et fondée en 2019, a bouclé une levée de série A de 14 millions de dollars menée par Denali Growth Partners, avec la participation de Taiwania Capital. L'entreprise, qui a démarré via une campagne Kickstarter réussie, revendique aujourd'hui plusieurs milliers de clients, dont plus de 60 entreprises du Fortune 500 et 17 des 30 valeurs du Dow Jones, parmi lesquelles la société agricole FARM-ING. Luxonis produit les caméras OAK, qui combinent plusieurs capteurs de vision et du calcul embarqué dans un seul boîtier, ainsi que le kit logiciel open source DepthAI, dont le SDK a franchi les 6 millions de téléchargements après une mise à jour en avril. Son écosystème de perception cloud OAK4, lancé en décembre 2025, vient d'être complété par la caméra modulaire OAK4-CS, destinée à l'inspection de codes-barres sur lignes de convoyage, à la microscopie et à d'autres usages industriels. Le mois dernier, la société a annoncé la prise en charge officielle de ses caméras dans NVIDIA Isaac Sim, ainsi qu'un déploiement OAK4 possible en USB-C seul ou en PoE+. Le PDG Bradley Dillon a indiqué que ce tour de table, le premier institutionnel de la société après plus de sept ans de développement porté par des proches et des investisseurs individuels, doit accélérer la croissance commerciale et la production. Cette levée illustre la montée en puissance des fournisseurs de composants pour l'IA physique, un segment charnière entre la robotique et l'automatisation industrielle. Plutôt que de vendre des robots complets, Luxonis se positionne comme fournisseur de la couche de perception, capteurs, calcul embarqué et logiciel, que les intégrateurs assemblent ensuite selon leurs besoins. Pour les décideurs B2B, cette approche modulaire réduit la barrière à l'entrée dans la vision robotique, un domaine encore dominé par des solutions propriétaires coûteuses. La traction commerciale revendiquée, avec une base client s'étendant des particuliers aux grands groupes industriels, suggère que la demande pour une perception visuelle embarquée standardisée dépasse désormais les cas d'usage de niche pour toucher l'automatisation de production à grande échelle. Les fonds serviront à étendre les capacités de la chaîne d'approvisionnement, développer de nouvelles architectures d'IA en périphérie (edge AI) et renforcer les équipes de R&D, de vente et de support technique. Luxonis prévoit de lancer de nouveaux appareils à prix plus accessibles et dans des formats variés, ciblant l'agriculture, la robotique avancée, la défense, l'automatisation industrielle, les machines lourdes, le medtech et la logistique d'entrepôt. La stratégie affichée par la société mise sur une combinaison entre ingénierie IA d'Europe centrale et orientale, capacités de fabrication à Taïwan et commercialisation aux États-Unis, une répartition géographique que Taiwania Capital a explicitement saluée comme un atout pour répondre aux besoins d'automatisation complexe des entreprises.

BusinessActu
1 source
Blattner attribue un contrat de 75 millions de dollars à Built Robotics pour l'IA physique afin de répondre à la demande énergétique
1698Robotics Business Review 

Blattner attribue un contrat de 75 millions de dollars à Built Robotics pour l'IA physique afin de répondre à la demande énergétique

Blattner Co. et Built Robotics ont annoncé un contrat de 75 millions de dollars pour déployer à grande échelle les systèmes de construction autonome de Built Robotics sur l'ensemble des chantiers de Blattner aux États-Unis. Cet accord prolonge un partenariat noué l'an dernier et s'appuie sur sept déploiements déjà réalisés sur des projets solaires à l'échelle utility, totalisant plus d'un gigawatt de capacité installée. Fondée en 2016 à San Francisco et soutenue par Founders Fund, NEA et Tiger Global, Built Robotics propose une technologie qui convertit des engins de chantier existants (excavatrices, bulldozers, chargeuses) en machines à autonomie de niveau 4, c'est-à-dire sans opérateur dans la cabine, et compatible avec le matériel des principaux fabricants OEM. Blattner, basée à Avon (Minnesota), revendique plus de 115 ans d'expérience dans la construction d'infrastructures et affirme avoir installé plus de 20% de la capacité éolienne, solaire et de stockage d'énergie à l'échelle utility aux États-Unis. L'entreprise est une filiale du groupe Quanta Services, aux côtés de Blattner Energy et D.H. Blattner & Sons. Ce contrat illustre un mouvement de fond dans la construction d'infrastructures énergétiques: la demande en électricité liée aux data centers et à l'IA pousse à accélérer la construction solaire et de stockage par batteries, un secteur où Built Robotics situe déjà plus de 80% des nouvelles capacités de production. Face à une pénurie persistante de main-d'œuvre qualifiée dans le BTP, l'automatisation de niveau 4 permet, selon les deux entreprises, de maintenir les chantiers actifs de nuit et par mauvais temps, réduisant les délais de mise en service et limitant l'exposition des ouvriers aux engins lourds. Pour l'industrie de la robotique de construction, l'opération confirme que l'IA physique dépasse le stade de la démonstration isolée: il s'agit ici d'un déploiement répété et facturé à l'échelle, sur un client industriel réel, ce qui distingue ce cas des simples annonces de prototypes encore en phase pilote. Reste que les chiffres avancés (plus d'un gigawatt cumulé, 75 millions de dollars) proviennent des communiqués des deux parties et ne sont pas vérifiés de façon indépendante. Le partenariat s'inscrit dans la stratégie de Built Robotics visant le marché de la construction solaire à l'échelle utility, évalué à 300 milliards de dollars, et complète une collaboration récente avec le Safe Autonomous Systems Lab (xLAB) de l'université de Pennsylvanie, destinée à transformer les chantiers en terrain d'expérimentation pour l'IA physique. Brandon Bruski, vice-président senior solaire chez Blattner, présente cet approfondissement technologique comme un moyen de consolider la position de l'entreprise sur un marché en forte croissance, tandis que Noah Ready-Campbell, cofondateur et PDG de Built Robotics, situe l'enjeu dans une bascule plus large du secteur électrique américain vers le solaire et les batteries. Aucun calendrier précis de déploiement des nouveaux chantiers n'a été communiqué, mais l'accord signale une intensification attendue des investissements dans l'automatisation des grands chantiers d'infrastructure énergétique aux États-Unis dans les prochains mois.

IndustrielActu
1 source
MACHINA 2026 : Paris veut devenir la capitale européenne de la Physical AI
1699Robot Magazine FR 

MACHINA 2026 : Paris veut devenir la capitale européenne de la Physical AI

Paris accueille le 7 juillet 2026 la première édition de MACHINA, sommet dédié à la Physical AI organisé à Station F, la veille du RAISE Summit. Les organisateurs annoncent une liste d'intervenants dense pour un événement européen sur la robotique : Jim Fan (directeur recherche Physical AI chez NVIDIA), Marc Raibert (fondateur de Boston Dynamics, aujourd'hui directeur exécutif du RAI Institute), Carolina Parada (robotique chez Google DeepMind), Jeff Cardenas (CEO d'Apptronik), Bernt Børnich (fondateur de 1X), Jonathan Hurst (cofondateur d'Agility Robotics), David Reger (fondateur de NEURA Robotics), Abhinav Gupta (président de Skild AI), Thomas Wolf (Chief Science Officer de Hugging Face), Laura Modiano (OpenAI) et Péter Fankhauser (CEO d'ANYbotics). Le sommet ne se limite pas à des vitrines de machines : il couvre modèles de fondation, simulation, infrastructure de calcul et déploiement industriel, soit l'ensemble de la chaîne qui va du modèle VLA au robot physique. Cette concentration de dirigeants issus de NVIDIA, Google DeepMind, OpenAI, Boston Dynamics et des principaux acteurs humanoïdes américains (Apptronik, Agility Robotics, 1X) sur un événement parisien signale un repositionnement : la Physical AI cherche désormais des relais de visibilité en dehors des États-Unis et de l'Asie. Pour les intégrateurs et décideurs industriels européens, MACHINA offre un accès rare à des interlocuteurs habituellement présents sur les scènes de la Silicon Valley. L'angle retenu, la convergence entre IA générative, simulation et robotique plutôt que la seule performance mécanique, reflète un basculement du secteur où le logiciel et les modèles de fondation pèsent désormais autant que le hardware dans la course humanoïde. Cet événement s'inscrit dans la suite logique de trois années centrées sur les assistants conversationnels et les modèles génératifs, dont les avancées en vision par ordinateur et en simulation commencent à irriguer la robotique. Sur le plan concurrentiel, les États-Unis alignent Apptronik, Agility Robotics et Boston Dynamics, tandis que l'Asie conserve son avance industrielle historique ; l'Europe mise sur des acteurs comme l'allemand NEURA Robotics ou le suisse ANYbotics pour exister dans cette nouvelle vague. La proximité immédiate avec le RAISE Summit, organisé le lendemain, dessine une séquence parisienne pensée pour capter à la fois investisseurs et chercheurs sur une même semaine, un pari sur la capacité de la France à s'imposer comme point de passage européen de la Physical AI plutôt que comme simple spectatrice d'une course menée depuis San Francisco et Shenzhen.

FR/EU ecosystemeOpinion
1 source
UBTech déploie ses robots humanoïdes pour contrôler les foules à une frontière internationale chinoise très fréquentée
1700Interesting Engineering 

UBTech déploie ses robots humanoïdes pour contrôler les foules à une frontière internationale chinoise très fréquentée

La Chine a commencé à déployer des robots humanoïdes au poste-frontière de Fangchenggang, dans la région du Guangxi, l'un des points de passage les plus fréquentés avec le Vietnam. Le site, qui englobe le port de Dongzhong et celui de Dongxing voisin, gère un trafic quotidien important de camions de fret, de bus et de voyageurs, générant des embouteillages lors des contrôles douaniers. Les autorités frontalières ont acheté des robots Walker S2 du fabricant chinois UBTech Robotics dans le cadre d'un contrat évalué à environ 40 millions de dollars, sans préciser le nombre d'unités commandées ; les premières livraisons ont débuté pour un déploiement dans les hubs de transit clés. Le Walker S2 mesure 1,76 mètre, dispose de 52 degrés de liberté et peut soulever jusqu'à 15 kg par bras grâce à des mains articulées dextres. Il embarque un système de double batterie interchangeable pour un fonctionnement quasi continu, ainsi qu'une pile logicielle baptisée BrainNet 2.0 couplée à une vision stéréo binoculaire pour la navigation autonome et l'équilibre dynamique. Dans le terminal passagers, les robots détectent les engorgements de foule, orientent les voyageurs vers des files organisées et répondent en plusieurs langues aux questions sur les procédures douanières. Côté fret, d'autres unités scannent codes-barres, numéros de série et manifestes numériques sur les conteneurs, puis transmettent les données croisées avec les bases douanières à des agents humains pour validation. UBTech a par ailleurs présenté récemment sa gamme UWORLD U1, décrite par l'entreprise comme la première ligne de robots humanoïdes « ultra-bioniques » grandeur nature conçue pour la production de masse, une affirmation qui reste à vérifier à l'échelle industrielle. Ce déploiement constitue un test grandeur nature bien plus exigeant que les usines contrôlées où évoluent habituellement les humanoïdes commerciaux : humidité côtière, poussière, intempéries et flux constant de voyageurs et de véhicules. C'est précisément ce type d'épreuve qui permettra de juger si la robotique humanoïde a dépassé le stade de la démonstration scénarisée pour tenir dans la durée en conditions réelles, l'écart entre promesse et réalité restant l'un des points de friction majeurs du secteur. Pour les intégrateurs et décideurs industriels, l'enjeu dépasse le seul cas d'usage douanier : Pékin présente explicitement ce projet comme un pilote susceptible de s'étendre aux aéroports, gares ferroviaires internationales et ports maritimes si les résultats sont concluants, ce qui en ferait un cas d'école pour l'automatisation des services publics à grande échelle. Le déploiement soulève aussi des questions pratiques et juridiques non résolues : le temps d'adaptation des voyageurs face à des machines assurant des tâches de service et de sécurité, et la répartition des responsabilités en cas d'erreur opérationnelle d'un robot lors d'une inspection ou d'un contrôle. Les tâches critiques de sécurité et les décisions relevant des forces de l'ordre restent, en l'état, hors du périmètre confié aux machines. Le contrat de Fangchenggang s'inscrit dans la stratégie plus large de la Chine visant à accélérer l'adoption de l'IA et de la robotique dans les infrastructures publiques, un axe porté à la fois par les autorités locales et par la politique industrielle nationale de soutien aux acteurs de la robotique humanoïde comme UBTech, Unitree ou AgiBot. UBTech a construit sa position sur des contrats industriels et logistiques avant d'étendre le Walker S2 à des environnements publics, une trajectoire distincte de celle d'acteurs américains comme Figure (Figure 03, associé au modèle Helix) ou Tesla (Optimus Gen 3), encore essentiellement cantonnés à des pilotes en usine, tandis que des plateformes comme GR00T N2 de Nvidia ou Pi-0 continuent de viser l'apprentissage générique de tâches de manipulation plutôt que le déploiement en environnement public. La suite dépendra des résultats du pilote de Fangchenggang : en cas de fiabilité démontrée sur la durée, les autorités chinoises ont indiqué vouloir étendre le concept à d'autres points d'entrée internationaux, faisant de ce poste-frontière un banc d'essai déterminant pour la robotique humanoïde appliquée aux services publics de transport.

Chine/AsieActu
1 source