Aller au contenu principal
SUN : programmes persistants pour politiques ancrées dans le langage, du contrôle à l'apprentissage jusqu'au réel
RecherchearXiv cs.RO 

SUN : programmes persistants pour politiques ancrées dans le langage, du contrôle à l'apprentissage jusqu'au réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent SUN (Semantically UNified Programs), une méthode publiée en prépublication sur arXiv fin août 2026, associée au système Kuafu qui synthétise automatiquement des programmes typés à partir de descriptions en langage naturel et de la scène observée, pilotés par des modèles de vision-langage de grande taille. Ces programmes définissent une seule fois les relations géométriques et de contact, puis les compilent en coûts pour un contrôleur prédictif (MPC), en prédicats de réussite, en récompenses pour l'apprentissage par renforcement et en gardes de transition. Sur neuf tâches de manipulation, Kuafu atteint un taux de succès moyen de 82,03%, contre 35,67% pour une base de référence à récompense éparse et 24,75% pour une base Stage-BC. À l'échelle de 8192 environnements simulés en parallèle, le système génère 10,57 fois plus de temps de trajectoire réussie par heure de téléopération humaine équivalente. Avec seulement 500 trajectoires par tâche, les données de Kuafu permettent d'entraîner des politiques DP3 atteignant 46,0% de réussite en simulation, contre 22,4% pour les alternatives, et 34,7% sur des bras robotiques physiques Franka Emika et Kinova.

Le résultat est méthodologique plus qu'industriel: il tente de réconcilier deux approches qui s'ignoraient jusque là, le contrôle basé modèle qui exécute des objectifs explicitement spécifiés, et l'apprentissage qui amortit ce comportement en politique réactive mais avec des récompenses bricolées à la main et un comportement qui dérive de ce que le contrôle avait validé. En conservant la sémantique de la tâche tout au long de la chaîne, plutôt qu'un pipeline bout-en-bout de type VLA, SUN et Kuafu évitent la collecte de démonstrations humaines et l'ingénierie manuelle de récompenses, un goulot d'étranglement connu pour les intégrateurs qui cherchent à industrialiser la manipulation robotique. Mais l'écart entre 46% de succès en simulation et 34,7% sur robot physique confirme que le passage sim-to-real reste un problème ouvert, même quand la sémantique de tâche est vérifiée par MPC en amont, un signal utile pour les décideurs B2B qui évaluent la maturité réelle des pipelines d'apprentissage par simulation avant tout achat ou pilote.

Le travail s'inscrit dans la lignée des efforts pour automatiser la génération de récompenses et de curricula d'entraînement via des modèles de vision-langage, une direction parallèle aux approches VLA bout-en-bout poussées par des laboratoires comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, ou Figure AI avec Helix. Contrairement à ces systèmes orientés produit et déploiement humanoïde, SUN et Kuafu restent à un stade de recherche académique, validés sur des bras manipulateurs fixes Franka et Kinova plutôt que sur des plateformes mobiles ou humanoïdes, sans partenariat industriel ni calendrier de commercialisation annoncés. Aucun acteur français ou européen n'apparaît dans cette publication. La suite logique, non précisée par les auteurs, serait l'extension à des tâches plus longues et à des plateformes mobiles, ainsi qu'une réduction de l'écart simulation-réel qui conditionne l'adoption par les intégrateurs industriels.

À lire aussi

Un modèle de langage à schéma contraint pour affiner les politiques robotiques sans déstabiliser l'apprentissage local
1arXiv cs.RO 

Un modèle de langage à schéma contraint pour affiner les politiques robotiques sans déstabiliser l'apprentissage local

Une équipe de recherche décrit dans un preprint arXiv (2609.05133v1) une architecture de navigation décentralisée pour trois robots hétérogènes, testée dans un simulateur combinant NetLogo et Python. Chaque robot utilise un backend LLM différent et combine trois modules: un agent de politique piloté par ce LLM, un bandit UCB pour choisir le mode de raffinement, et un contrôleur Double Deep Q-Network (Double DQN) pour les actions à chaque tick. Le LLM n'intervient qu'au niveau du round, pour générer et affiner les politiques, jamais pour l'action immédiate; les robots partagent un résumé de round commun (politiques, résultats, retours d'apprentissage) pour communiquer entre eux. Sur quatre configurations évaluées pendant 30 rounds chacune, la version complète a atteint l'objectif dans les 90 enregistrements robot-round, avec un temps médian de 42 ticks et un P90 de 73,2 ticks, soit 25 à 39,1% de mieux que les autres configurations. Cette architecture répond à un problème concret pour les intégrateurs de systèmes multi-robots: interroger un LLM à chaque pas de contrôle est trop lent et coûteux, tandis qu'un contrôleur d'apprentissage par renforcement seul manque de raisonnement stratégique. En confinant le LLM au niveau du round et en le décentralisant, un backend par robot plutôt qu'un LLM central orchestrant toute la flotte, l'étude teste une alternative susceptible de réduire la dépendance à une latence réseau unique. Les auteurs restent prudents et qualifient leurs propres résultats de "preuves descriptives au niveau de la configuration", une formulation qui limite la portée de l'écart de performance observé à ce protocole précis. Le travail s'inscrit dans la lignée des recherches hybridant modèles de langage et apprentissage par renforcement pour le contrôle robotique, un axe qui a gagné en visibilité avec la multiplication des architectures vision-langage-action comme Pi-0 ou GR00T N2. Contrairement à ces systèmes orientés manipulation et déploiement réel, cette étude se limite à la navigation de trois robots dans un simulateur agent-based, sans transfert vers du matériel physique ni comparaison directe avec des architectures LLM centralisées. Publié sans mention de financement industriel ni de partenaire de déploiement, ce preprint reste une contribution académique exploratoire plutôt qu'une brique prête pour l'intégration industrielle.

RecherchePaper
1 source
Contrôleur de politique de diffusion unique pour le poussage de blocs multi-tâches avec transfert simulation-réel sans apprentissage préalable
2arXiv cs.RO 

Contrôleur de politique de diffusion unique pour le poussage de blocs multi-tâches avec transfert simulation-réel sans apprentissage préalable

Des chercheurs présentent un contrôleur unique basé sur une politique de diffusion (diffusion policy), entraîné entièrement par apprentissage par renforcement plutôt que par clonage comportemental classique, pour piloter des tâches de poussée de blocs multi-formes en robotique manipulatrice. Contrairement aux approches habituelles qui nécessitent des démonstrations humaines préenregistrées, cette méthode combine une fonction de perte simplifiée (une borne inférieure de vraisemblance repondérée) avec une génération de curriculum inversé et des représentations centrées sur l'objectif pour surmonter la difficulté d'exploration dans un environnement de simulation à récompense éparse. Le système a été testé en transfert zéro-shot vers un dispositif réel de poussée de blocs, en faisant varier les positions cibles, les formes des blocs, leur poids et le frottement de la surface, sans réentraînement spécifique au monde réel. Cette publication s'inscrit dans un débat central du secteur robotique actuel : la capacité réelle des politiques apprises par simulation à franchir le fameux "sim-to-real gap" sans passer par des démonstrations coûteuses à collecter. Alors que des modèles VLA (vision-langage-action) comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI misent sur d'immenses corpus de démonstrations téléopérées pour généraliser, cette approche RL-from-scratch propose une voie alternative potentiellement moins gourmande en données humaines annotées, mais elle reste circonscrite à une tâche géométriquement simple (pousser des blocs) et ne démontre pas encore de généralisation vers des manipulations plus complexes en préhension ou en dextérité fine. Pour les intégrateurs industriels, l'intérêt réside surtout dans la preuve de concept méthodologique plutôt que dans une application immédiate déployable. Le travail s'inscrit dans la lignée des politiques de diffusion popularisées en 2023-2024 pour le clonage comportemental (notamment par des équipes du MIT et de Columbia), ici détournées vers un cadre purement RL. Les auteurs ne précisent pas d'affiliation industrielle ni de partenaire de déploiement, ce qui situe ce travail du côté recherche académique plutôt que produit commercialisable. Aucun acteur français ou européen n'est mentionné dans cette publication. Les prochaines étapes attendues, non détaillées dans l'abstract, porteraient logiquement sur l'extension à des tâches de manipulation plus riches (préhension, insertion, assemblage) et sur la robustesse face à des perturbations environnementales plus sévères que celles testées ici.

RecherchePaper
1 source
Démonstrations structurées du simple au complexe pour l'apprentissage vision-langage-action
3arXiv cs.RO 

Démonstrations structurées du simple au complexe pour l'apprentissage vision-langage-action

Les chercheurs proposent une nouvelle méthode de collecte de démonstrations pour l'entraînement de modèles Vision-Language-Action (VLA), publiée sur arXiv le 4 juillet 2026 (arXiv:2607.04591v1). Plutôt que de se concentrer sur l'architecture des modèles ou la taille des jeux de données, comme le fait la majorité des travaux récents, l'équipe s'attaque à un maillon jusqu'ici négligé de l'apprentissage par imitation : la manière dont les démonstrations elles-mêmes sont organisées. Leur approche, testée sur une plateforme robotique à double bras, repose sur trois principes: décomposer les tâches de manipulation complexes en sous-compétences apprises progressivement, standardiser l'environnement d'interaction pour limiter la variabilité inutile, et ordonner les démonstrations par complexité croissante plutôt que de les collecter en bloc. Deux tâches servent de banc d'essai: le tri et la préhension de blocs, et le pliage de serviettes. Les auteurs rapportent une amélioration du taux de réussite et une meilleure stabilité d'entraînement par rapport à la méthode de référence, qui consiste à enregistrer directement des trajectoires complètes de bout en bout, sans toutefois détailler de métriques chiffrées précises dans le résumé. Pour l'industrie robotique, ce travail pointe un angle mort du secteur VLA: la course actuelle privilégie l'échelle des modèles et des jeux de données, sur le modèle de Pi-0, GR00T N2 ou Helix, mais néglige souvent la qualité et la structure des données d'apprentissage. Si l'organisation curriculaire des démonstrations s'avère aussi déterminante que le suggèrent ces résultats, cela remettrait en question l'hypothèse dominante selon laquelle il suffit d'accumuler des heures de téléopération pour obtenir des politiques robustes et généralisables sur des tâches longues et séquentielles. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage par curriculum, déjà éprouvé en apprentissage par renforcement, mais peu exploré pour l'imitation robotique à l'ère des VLA. Alors que les grands acteurs du secteur, qu'il s'agisse de Figure, Tesla avec Optimus ou Physical Intelligence, communiquent surtout sur les capacités finales de leurs robots humanoïdes, cette étude reste à un stade de recherche académique, sans annonce de déploiement industriel. Ses auteurs présentent ces résultats comme une preuve de concept ouvrant la voie à une collecte de données plus efficace et plus scalable pour la manipulation robotique à long horizon.

RecherchePaper
1 source
Quand le transfert simulation-réel nuit à l'apprentissage des politiques de contrôle, et comment y remédier
4arXiv cs.RO 

Quand le transfert simulation-réel nuit à l'apprentissage des politiques de contrôle, et comment y remédier

Une équipe de chercheurs publie sur arXiv (référence 2606.02636) un article qui remet en question une hypothèse centrale de la robotique moderne : l'idée que maximiser les efforts de transfert simulation-vers-réel (sim2real) améliore systématiquement l'apprentissage de politiques de contrôle. Leur diagnostic identifie deux effets négatifs concrets : un phénomène de "simulator lock-in", où les politiques restent prisonnières des hypothèses du simulateur, et une exploration appauvrie pendant l'entraînement, résultat des contraintes imposées prématurément par la compatibilité hardware. L'enjeu pour la communauté robotique est direct. Si la thèse tient, cela signifie que des pans entiers de la recherche sim2real ont optimisé le mauvais objectif : en voulant rapprocher la simulation du monde réel dès l'entraînement, on sacrifie la liberté d'exploration que la simulation est précisément supposée offrir. Cela concerne en priorité les équipes développant des politiques pour humanoïdes et les architectures Vision-Language-Action (VLA), où la qualité et la diversité des données de simulation sont déterminantes pour généraliser en déploiement réel. En réponse, les auteurs proposent un paradigme en deux étapes qu'ils appellent sim2sim2real : une première simulation sans contraintes réelles maximise l'exploration des comportements, puis un second transfert vers une simulation contrainte par la cinématique du robot prépare le passage au hardware. La seule limite imposée dès le départ est donc géométrique, pas physique. Cette approche s'inscrit dans la lignée du domain randomization et du curriculum learning, mais formalise explicitement la séparation des objectifs d'exploration et de transfert. À ce stade, l'article est un preprint sans validation expérimentale publiée.

RecherchePaper
1 source