
Scalabot HERON-CRA ajoute une mémoire contextuelle et un moteur d'apprentissage par renforcement pour le contrôle incarné
Songyan Dynamics, via sa marque d'intelligence incarnée Scalabot, a publié HERON-CRA (Context Reinforcement Action Model), second modèle de sa pile HERON après le HERON-World Model dévoilé une semaine plus tôt. Trois briques composent le système : un Context Expert qui encode l'historique multimodal en tokens spatio-temporels 4D pour conditionner la politique sur plus d'une minute de contexte passé, au-delà de la seule image courante ; un RL Engine, acteur-critique résiduel léger qui réutilise les clés et valeurs figées du Context Expert pour corriger les dérives de l'imitation pure ; et un pré-entraînement cross-embodiment mélangeant téléopération, simulation, données de type UMI et vidéos humaines à la première personne, sur des bras, des plateformes à roues, des pinces et des mains dextres. Sur une tâche de pliage de chaussette, Scalabot rapporte un taux de réussite passant de 38,5% avec une base purement imitative à 97,8% une fois le RL Engine activé. D'autres vidéos montrent une séquence longue de préparation de café (mouture, versement de lait) bouclée en moins de 30 secondes, un transfert de compétences entre un bras ARX et l'humanoïde à roues Noetix M1, ainsi qu'une reprise après déplacement d'une tasse en cours de préhension et la poursuite de certains mouvements lors d'occlusions visuelles brèves.
Pour les intégrateurs et décideurs B2B de la robotique, l'annonce cible le point faible récurrent des modèles vision-langage-action : la manipulation à horizon long, où le clonage de comportement dérive dès que la tâche s'étire dans le temps ou que l'environnement varie légèrement. En combinant mémoire contextuelle et RL résiduel plutôt qu'imitation pure, Scalabot cherche à combler l'écart entre démonstration et déploiement réel, un écart que le secteur a souvent minimisé dans ses communications. Le saut de 38,5% à 97,8% de réussite, s'il se vérifie hors laboratoire, validerait cette hypothèse ; le transfert de compétences entre un bras fixe et un humanoïde à roues constitue par ailleurs un signal concret sur la portabilité inter-corps, enjeu clé pour amortir les coûts d'entraînement sur plusieurs plateformes matérielles. Ces chiffres restent néanmoins issus de communications de l'entreprise, appuyés sur des vidéos vraisemblablement sélectionnées et sans protocole indépendant publié ; des équipes tierces devront reproduire les résultats du pliage de chaussette et de la séquence café sur leur propre matériel avant de les tenir pour acquis.
HERON-CRA s'inscrit dans une pile modulaire amorcée avec HERON-World Model, utilisé ici pour simuler des trajectoires imaginées sans risque matériel supplémentaire ; Context Expert et Action Expert sont entraînés comme un mélange de transformers, complété d'un modèle de valeur à contraintes de différence temporelle. Ce chantier place Scalabot, marque de Songyan Dynamics, dans la compétition mondiale des modèles fondation pour la robotique incarnée, aux côtés de Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Figure AI (Helix) et des programmes humanoïdes type Optimus. Aucun acteur français ou européen n'apparaît dans cette annonce. La suite dépendra de la capacité de Scalabot à faire valider ces résultats par des tiers et à préciser un calendrier de déploiement pilote : l'entreprise n'a pour l'instant communiqué que des démonstrations vidéo et des chiffres internes, sans date de disponibilité commerciale ni partenaire industriel nommé.
Dans nos dossiers




