Aller au contenu principal
Scalabot HERON-CRA ajoute une mémoire contextuelle et un moteur d'apprentissage par renforcement pour le contrôle incarné
IA physiquePandaily 

Scalabot HERON-CRA ajoute une mémoire contextuelle et un moteur d'apprentissage par renforcement pour le contrôle incarné

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Songyan Dynamics, via sa marque d'intelligence incarnée Scalabot, a publié HERON-CRA (Context Reinforcement Action Model), second modèle de sa pile HERON après le HERON-World Model dévoilé une semaine plus tôt. Trois briques composent le système : un Context Expert qui encode l'historique multimodal en tokens spatio-temporels 4D pour conditionner la politique sur plus d'une minute de contexte passé, au-delà de la seule image courante ; un RL Engine, acteur-critique résiduel léger qui réutilise les clés et valeurs figées du Context Expert pour corriger les dérives de l'imitation pure ; et un pré-entraînement cross-embodiment mélangeant téléopération, simulation, données de type UMI et vidéos humaines à la première personne, sur des bras, des plateformes à roues, des pinces et des mains dextres. Sur une tâche de pliage de chaussette, Scalabot rapporte un taux de réussite passant de 38,5% avec une base purement imitative à 97,8% une fois le RL Engine activé. D'autres vidéos montrent une séquence longue de préparation de café (mouture, versement de lait) bouclée en moins de 30 secondes, un transfert de compétences entre un bras ARX et l'humanoïde à roues Noetix M1, ainsi qu'une reprise après déplacement d'une tasse en cours de préhension et la poursuite de certains mouvements lors d'occlusions visuelles brèves.

Pour les intégrateurs et décideurs B2B de la robotique, l'annonce cible le point faible récurrent des modèles vision-langage-action : la manipulation à horizon long, où le clonage de comportement dérive dès que la tâche s'étire dans le temps ou que l'environnement varie légèrement. En combinant mémoire contextuelle et RL résiduel plutôt qu'imitation pure, Scalabot cherche à combler l'écart entre démonstration et déploiement réel, un écart que le secteur a souvent minimisé dans ses communications. Le saut de 38,5% à 97,8% de réussite, s'il se vérifie hors laboratoire, validerait cette hypothèse ; le transfert de compétences entre un bras fixe et un humanoïde à roues constitue par ailleurs un signal concret sur la portabilité inter-corps, enjeu clé pour amortir les coûts d'entraînement sur plusieurs plateformes matérielles. Ces chiffres restent néanmoins issus de communications de l'entreprise, appuyés sur des vidéos vraisemblablement sélectionnées et sans protocole indépendant publié ; des équipes tierces devront reproduire les résultats du pliage de chaussette et de la séquence café sur leur propre matériel avant de les tenir pour acquis.

HERON-CRA s'inscrit dans une pile modulaire amorcée avec HERON-World Model, utilisé ici pour simuler des trajectoires imaginées sans risque matériel supplémentaire ; Context Expert et Action Expert sont entraînés comme un mélange de transformers, complété d'un modèle de valeur à contraintes de différence temporelle. Ce chantier place Scalabot, marque de Songyan Dynamics, dans la compétition mondiale des modèles fondation pour la robotique incarnée, aux côtés de Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Figure AI (Helix) et des programmes humanoïdes type Optimus. Aucun acteur français ou européen n'apparaît dans cette annonce. La suite dépendra de la capacité de Scalabot à faire valider ces résultats par des tiers et à préciser un calendrier de déploiement pilote : l'entreprise n'a pour l'instant communiqué que des démonstrations vidéo et des chiffres internes, sans date de disponibilité commerciale ni partenaire industriel nommé.

À lire aussi

Refonte de la trajectoire par apprentissage par renforcement : REFINE-DP affine le contrôle locomoteur-manipulateur des humanoïdes
1arXiv cs.RO 

Refonte de la trajectoire par apprentissage par renforcement : REFINE-DP affine le contrôle locomoteur-manipulateur des humanoïdes

Traduction et synthèse de l'article demandée : Des chercheurs présentent REFINE-DP, un framework qui combine une diffusion policy (DP) pour la planification de mouvement avec un contrôleur d'apprentissage par renforcement pour la loco-manipulation humanoïde. L'approche s'attaque à un problème connu : quand une DP est entraînée hors ligne par démonstrations puis déployée sur un robot, elle reste découplée du contrôleur de loco-manipulation, ce qui dégrade le suivi de commande et provoque un décalage de distribution qui s'accumule au fil des tâches. Plutôt que de multiplier les démonstrations, une stratégie prohibitivement coûteuse pour un système humanoïde à haute dimension, REFINE-DP affine simultanément le planificateur DP via un gradient de politique de diffusion basé sur PPO et le contrôleur RL, afin que ce dernier suive la distribution de commandes évolutive du planificateur. Testé sur des tâches de franchissement de porte et de transport d'objets sur de longs horizons, le système atteint plus de 90% de taux de réussite en simulation, y compris sur des cas hors distribution absents des données d'entraînement, et s'exécute en conditions réelles sans recourir à des informations d'état privilégiées. Le résultat cible un point de friction bien identifié dans la robotique humanoïde actuelle : les diffusion policies apprises par imitation fonctionnent bien en démonstration mais se dégradent vite en déploiement réel, les erreurs de suivi de commande s'accumulant tâche après tâche. En couplant explicitement planification et contrôle plutôt qu'en les entraînant séparément, REFINE-DP s'attaque directement à l'écart démo/réalité que beaucoup de laboratoires contournent en multipliant les données de démonstration, une stratégie vite hors de prix à l'échelle d'un corps humanoïde complet. Pour les intégrateurs et équipes R&D qui évaluent des piles VLA ou DP pour la loco-manipulation, ce travail suggère qu'un affinage par renforcement ciblé peut améliorer la fiabilité sans multiplier le volume de téléopération nécessaire, un argument économique important tant que la collecte de démonstrations humanoïdes reste rare et coûteuse. REFINE-DP s'inscrit dans une lignée de travaux cherchant à combiner apprentissage par imitation et apprentissage par renforcement pour la robotique humanoïde, un terrain déjà exploré par des approches vision-language-action comme Pi-0 ou GR00T N2, mais avec un accent particulier sur le couplage planificateur-contrôleur plutôt que sur l'échelle des données. Le papier, publié sur arXiv (identifiant 2603.13707, version de remplacement), reste à ce stade une validation en simulation et sur un seul robot humanoïde de laboratoire, sans nom de plateforme commerciale ni annonce de déploiement industriel. La suite logique pour ce type de travaux consiste généralement à étendre les tâches testées, valider sur plusieurs plateformes matérielles, et voir si des acteurs commerciaux du secteur, américains ou européens comme Wandercraft ou Enchanted Tools, intègrent ces techniques de fine-tuning par RL dans leurs propres piles de contrôle.

IA physiqueActu
1 source
Piloter l'apprentissage par renforcement génératif vers un contrôleur robotique stable
2arXiv cs.RO 

Piloter l'apprentissage par renforcement génératif vers un contrôleur robotique stable

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.16572) SteerGenPO, un cadre d'apprentissage par renforcement en espace latent destiné à transformer une politique générative entraînée, basée sur la diffusion ou les flux normalisants, en un contrôleur robotique déterministe et stable. Le système a été évalué sur six benchmarks Isaac Lab d'NVIDIA et sur une tâche de locomotion avec le robot humanoïde Unitree G1, avec des résultats supérieurs aux baselines RL classiques et génératives selon les auteurs. Il s'agit d'une publication académique en pré-impression, sans déploiement industriel annoncé ni validation terrain au-delà du G1. Le verrou technique adressé est connu : les politiques de diffusion accumulent des variations d'action à chaque pas de temps, ce qui dégrade la stabilité sur des systèmes robotiques à haute dimensionnalité. SteerGenPO sépare architecturalement exploration et contrôle : l'échantillonnage stochastique reste actif à l'entraînement pour diversifier les proposals d'actions, mais au déploiement, un acteur latent appris prédit une entrée déterministe et dépendante de l'état qui pilote la politique générative sans bruit résiduel. Pour les intégrateurs, la proposition n'exige pas de réentraîner la politique depuis zéro : elle greffe un mécanisme de pilotage sur un checkpoint pré-entraîné existant, ce qui ouvre la voie à l'exploitation de modèles fondation tout en garantissant la reproductibilité des trajectoires en production. Ce travail s'inscrit dans la compétition intense autour des politiques génératives en robotique. Physical Intelligence avec Pi-0 (2024) et NVIDIA avec GR00T N2 (2025) ont validé l'approche VLA-diffusion en environnements contrôlés, mais les questions sur la robustesse à l'inférence longue restent ouvertes. Boston Dynamics, Agility Robotics et Figure AI privilégient des pipelines de contrôle plus classiques pour la fiabilité en production. SteerGenPO propose une voie médiane : capitaliser sur la richesse exploratoire des modèles génératifs sans en subir l'instabilité au déploiement. Aucune timeline, partenariat industriel ni essai terrain n'est mentionné dans le préprint ; les prochaines validations naturelles porteraient sur la manipulation dextère et des tests sim-to-real approfondis.

IA physiqueOpinion
1 source
UniIntervene : intervention à base d'agents pour un apprentissage par renforcement efficace en conditions réelles
3arXiv cs.RO 

UniIntervene : intervention à base d'agents pour un apprentissage par renforcement efficace en conditions réelles

UniIntervene est un modèle d'intervention autonome présenté dans un preprint arXiv (2606.12372, juin 2026) qui cible un goulot d'étranglement concret de l'apprentissage par renforcement en boucle humaine (HiL-RL) pour la manipulation robotique réelle. Le système combine trois composants : un estimateur de valeur d'action conditionné sur le futur, qui prédit les conséquences latentes d'une action et évalue leur valeur avant exécution ; un critique temporel de risque de valeur (temporal value-risk critic), qui agrège la dynamique récente des signaux de valeur et déclenche une intervention dès qu'une stagnation ou dégradation soutenue est détectée ; et une politique de récupération conditionnée sur un objectif, qui extrait une cible de haute valeur depuis une mémoire d'épisodes d'intervention passés et génère des actions correctives exécutables. Sur des tâches de manipulation en conditions réelles, UniIntervene améliore le taux de succès moyen de 8,6 points de pourcentage tout en réduisant les interventions humaines de 57 % par rapport aux baselines HiL-RL de l'état de l'art. L'enjeu industriel est direct : le HiL-RL est l'une des approches les plus prometteuses pour déployer des bras manipulateurs apprenants hors du laboratoire, mais son coût opérateur reste prohibitif à l'échelle. Chaque correction humaine représente du temps d'ingénieur ou de technicien immobilisé devant le robot. En délégant la majorité des interventions à un agent autonome -- tout en conservant la supervision humaine pour les cas limites -- UniIntervene ouvre un chemin vers un fine-tuning continu en production sans équipe dédiée. La réduction de 57 % est notable, mais les auteurs ne précisent pas la nature exacte des tâches testées ni si les vidéos publiées sont représentatives de l'ensemble du benchmark ; prudence donc sur la généralisabilité immédiate. Le HiL-RL pour la robotique réelle a connu une accélération depuis les travaux de DAgger (Ross et al., 2011) et leurs dérivés, avec des systèmes récents comme RLIF et IWR qui ont montré que l'intervention humaine ponctuelle surpasse le RL pur en environnements non structurés. UniIntervene s'inscrit dans cette lignée mais déplace le curseur : là où IWR demande à l'humain de décider quand intervenir, ici c'est le modèle lui-même qui prend cette décision via son critic temporel. Les concurrents directs incluent les approches de HITL proposées par des équipes de Chelsea Finn (Stanford) et Pieter Abbeel (UC Berkeley / Covariant). Aucun partenaire industriel ni timeline de déploiement n'est mentionné dans le preprint ; il s'agit pour l'instant d'une contribution de recherche sans pilote annoncé.

IA physiquePaper
1 source
D-VLA : un cadre d'apprentissage par renforcement distribué et asynchrone à haute concurrence pour les modèles vision-langage-action
4arXiv cs.RO 

D-VLA : un cadre d'apprentissage par renforcement distribué et asynchrone à haute concurrence pour les modèles vision-langage-action

Des chercheurs ont publié sur arXiv (référence 2605.13276) un framework distribué baptisé D-VLA, conçu pour entraîner par renforcement les modèles Vision-Language-Action (VLA) à très grande échelle. Le problème central qu'ils adressent est un goulot d'étranglement systémique : lorsqu'on applique du reinforcement learning (RL) à des VLA de plusieurs milliards de paramètres dans un environnement distribué, la simulation physique haute-fidélité et les calculs d'inférence se disputent les mêmes ressources GPU (VRAM, bande passante), ce qui dégrade le débit global. D-VLA répond par trois mécanismes : un "Plane Decoupling" qui isole physiquement les données d'entraînement haute fréquence du contrôle des poids basse fréquence, un pipeline asynchrone à quatre fils d'exécution ("Swimlane") permettant le chevauchement complet des phases de sampling, d'inférence, de calcul de gradient et de distribution des paramètres, et un système dual-pool de gestion VRAM couplé à une réplication "topology-aware". Sur le benchmark LIBERO, le framework surpasse significativement les solutions RL dominantes en débit et en efficacité d'échantillonnage pour des modèles à l'échelle du milliard de paramètres. Des tests de passage à l'échelle trillion de paramètres indiquent une stabilité maintenue et un speedup linéaire. L'enjeu industriel est concret : les modèles VLA sont désormais au coeur des architectures robotiques génériques (manipulation, navigation, planification multimodale), mais leur entraînement par RL reste prohibitif en ressources. Un framework qui résout le conflit simulation/optimisation et atteint un speedup linéaire à l'échelle du trillion de paramètres lève l'un des principaux verrous pour entraîner des agents polyvalents sans multiplier les clusters GPU de façon exponentielle. C'est une brique infrastructure, pas un robot, mais elle conditionne directement la vitesse à laquelle des systèmes comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les VLA internes de Figure AI peuvent être affinés par RL dans des environnements simulés réalistes. Ce travail s'inscrit dans une course à la scalabilité du RL pour l'embodied AI, où les frameworks existants (IsaacLab, RLlib, sample-factory) n'ont pas été conçus pour les contraintes spécifiques des VLA massifs. Les auteurs ne mentionnent pas d'affiliation institutionnelle clairement identifiable dans l'abstract, et le papier est un preprint non encore évalué par les pairs. Aucun déploiement réel ni partenariat industriel n'est annoncé à ce stade. Les prochaines étapes naturelles seraient une validation sur des tâches robotiques plus complexes que LIBERO et une intégration avec des simulateurs comme Isaac Sim ou MuJoCo à grande échelle.

UELes chercheurs européens en embodied AI pourraient exploiter ce framework pour réduire le coût GPU de l'entraînement RL sur VLA, mais aucun acteur français ou européen n'est impliqué dans ces travaux.

IA physiqueOpinion
1 source