Aller au contenu principal
RecherchearXiv cs.RO 

BarrierFormer : application de barrières prédictives guidée par transformeur pour un contrôle robotique sûr

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose BarrierFormer, un framework combinant transformers et fonctions de barrière de contrôle (control barrier functions, CBF) pour la sécurité en robotique, décrit dans un preprint publié sur arXiv (identifiant 2609.23896v1). Les CBF standards sont myopes : elles ne garantissent la sécurité qu'à l'instant présent, ce qui peut pousser le système vers la limite de son domaine sûr sans solution de contrôle sûre à l'étape suivante. Les approches de contrôle prédictif (MPC) corrigent ce défaut en imposant les contraintes sur un horizon glissant, mais exigent un modèle dynamique connu et la résolution d'un problème d'optimisation contraint à chaque pas, coûteux en temps réel. BarrierFormer contourne ce compromis avec un transformer causal qui encode l'historique observations-actions, génère de façon autorégressive une trajectoire prédictive via une tête de dynamique (remplaçant le modèle explicite), et produit une correction résiduelle à un contrôleur nominal via une tête d'action (remplaçant l'optimisation en ligne). Un critique de barrière évalue les violations de contraintes CBF le long de cette trajectoire prédite, tandis qu'un "professeur de sécurité" calcule des actions conformes aux contraintes servant de cibles de supervision à l'entraînement. À l'inférence, la politique n'effectue aucune optimisation en ligne. Sur des systèmes dynamiques linéaires et non linéaires, en 2D et 3D, pour des tâches de navigation sûre vers un objectif, les auteurs rapportent de meilleurs taux de sécurité et une latence d'inférence inférieure face à des méthodes par renforcement, par diffusion, par MPC et par transformers existantes.

L'enjeu dépasse l'exercice académique : c'est la question de savoir si des politiques apprises peuvent offrir des garanties de sécurité de type prédictif sans le coût de calcul du MPC classique, condition nécessaire pour déployer du contrôle sûr en temps réel sur des robots mobiles ou des bras manipulateurs à ressources de calcul limitées. Un résultat positif à l'échelle validerait une piste alternative aux pipelines MPC-CBF traditionnels, aujourd'hui jugés trop lourds pour l'embarqué.

Ce travail reste à ce stade une contribution de recherche évaluée en simulation, sans déploiement sur robot physique ni association à un produit commercial. Il s'inscrit dans la lignée des travaux sur les CBF et le MPC, et se positionne explicitement contre des architectures rivales par apprentissage par renforcement, modèles de diffusion et transformers antérieurs, sans toutefois préciser de calendrier de validation sur matériel réel.

Dans nos dossiers

À lire aussi

CoCoNav : un contrôle conforme pour une navigation robotique sûre en milieu de foule
1arXiv cs.RO 

CoCoNav : un contrôle conforme pour une navigation robotique sûre en milieu de foule

Un article déposé sur arXiv en août 2026 (arXiv:2608.07751) présente CoCoNav, un framework de navigation pour robots évoluant en foule, conçu pour anticiper les mouvements imprévisibles des piétons. Le système combine une calibration conforme en ligne et une planification certifiée en temps réel. Son composant central, un contrôleur conforme proportionnel-intégral spécifique à l'horizon temporel, ajuste dynamiquement les marges d'erreur de trajectoire pour maintenir un taux de couverture empirique stable face à des erreurs de prédiction qui évoluent au fil du temps. Un second module, baptisé "relax-then-verify" (détendre puis vérifier), génère d'abord des trajectoires nominales via un contrôle prédictif par modèle (MPC) à contraintes souples, avant de certifier séparément ces trajectoires, ainsi que des manœuvres de secours, par rapport aux bornes calibrées, juste avant leur exécution. Les auteurs ont validé l'approche à la fois en simulation et lors d'expériences avec un robot quadrupède, mesurant l'évitement de collision, le taux de réussite de tâche et l'efficacité de navigation par rapport à plusieurs méthodes de référence. Ce travail s'attaque à un point de friction connu dans le déploiement de robots mobiles en environnement humain: les méthodes réactives classiques produisent des comportements oscillants dès que la densité de piétons augmente, tandis que les planificateurs prédictifs supposent souvent des trajectoires piétonnes exactes ou s'appuient sur des modèles d'erreur trop rigides pour rester fiables en conditions réelles. Imposer des marges d'incertitude conservatrices comme contraintes strictes rend par ailleurs le MPC souvent infaisable en pratique, un problème qui limite l'usage de ces techniques dans des AMR (robots mobiles autonomes) commerciaux, des robots de livraison ou des plateformes de service. En séparant génération de trajectoire et certification, et en calibrant les marges d'erreur en continu plutôt qu'a priori, CoCoNav propose une piste concrète pour rendre les garanties de sécurité compatibles avec la réactivité nécessaire en environnement dense, un compromis que peu d'approches publiées atteignent simultanément selon les auteurs. La navigation sociale en robotique reste un domaine actif de recherche depuis plusieurs années, tiraillé entre approches purement réactives, rapides mais instables, et planificateurs prédictifs, plus robustes mais coûteux en calcul ou trop optimistes sur la qualité des prévisions de mouvement humain. La prédiction conforme, technique statistique permettant de quantifier l'incertitude d'un modèle sans hypothèse forte sur sa distribution d'erreur, gagne du terrain dans la robotique de perception et de planification comme alternative aux bornes d'erreur fixes. CoCoNav s'inscrit dans cette tendance en l'appliquant spécifiquement à l'horizon de prédiction du MPC. À ce stade, les résultats se limitent à des simulations et à des essais sur un robot quadrupède en conditions contrôlées, sans déploiement en foule réelle ni partenariat industriel annoncé; les auteurs ne précisent pas de calendrier pour un transfert vers des plateformes commerciales de type AMR ou robots de service.

RecherchePaper
1 source
Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique
2arXiv cs.RO 

Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique

Des chercheurs ont publié le 24 juin 2026 sur arXiv (référence 2606.24208) une méthode visant à corriger un angle mort des politiques robotiques génératives : les sorties produites par les modèles de diffusion peuvent être statistiquement valides mais physiquement infaisables. En pratique, un modèle génératif de haute qualité peut planifier une saisie (grasp), un waypoint ou une trajectoire qui viole des contraintes d'atteignabilité (reachability), d'évitement de collision ou d'exécutabilité en boucle fermée, rendant le déploiement direct sur robot impossible. Les auteurs proposent un cadre d'optimisation à l'inférence qui formule le guidage diffusionnel comme un problème d'optimisation sous contraintes. La clé : remplacer la perturbation d'échantillonnage dans le processus de débruitage (backward process) par une correction optimisée, ce qui permet d'imposer des contraintes dures ou souples lors du sampling sans ré-entraîner le modèle. Évalué sur la synthèse de saisies dextères avec contraintes de reachability et d'évitement de collision, et sur la manipulation dynamique avec contraintes de suivi au niveau contrôleur, la méthode améliore le taux de succès jusqu'à 20 points de pourcentage sur la saisie dextère et 23 points de pourcentage sur la manipulation visuomotrice par rapport à la meilleure baseline testée. L'enjeu est ce que les auteurs nomment l'"embodiment gap" : une politique entraînée dans un espace de tâches générique peut produire des comportements conceptuellement transférables, mais leur exécution sur un corps physique spécifique échoue faute de contraintes cinématiques ou dynamiques respectées. Pour les intégrateurs et les OEM robotiques, cela signifie que les modèles généralistes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ne peuvent pas être déployés tels quels sur n'importe quel bras ou manipulateur sans couche d'adaptation. L'approche proposée ici opère uniquement en temps d'inférence, sans modification des poids du modèle, ce qui réduit drastiquement le coût d'adaptation à un nouvel embodiment et la rend potentiellement intégrable dans des pipelines existants sans refonte de l'architecture. Le travail s'inscrit dans la dynamique des politiques de diffusion en robotique, initiée notamment par Diffusion Policy (Chi et al., 2023) et prolongée par les architectures VLA de nouvelle génération. Les méthodes concurrentes de guidage par gradient (gradient guidance) et de projection constituent les baselines, et la méthode proposée les surpasse en préservant mieux la qualité des saisies tout en augmentant l'exécutabilité au niveau contrôleur. Dans un secteur où Physical Intelligence, Covariant ou 1X Technologies misent sur des politiques génératives à grande échelle pour atteindre la généralisation inter-robots, cette approche d'optimisation à l'inférence offre un levier d'adaptation pragmatique sans nécessiter de nouvelles données d'entraînement ni de fine-tuning coûteux.

RechercheActu
1 source
IA incarnée et prédictive : le contrôle par apprentissage sûr pour les systèmes robotiques ego-monde
3arXiv cs.RO 

IA incarnée et prédictive : le contrôle par apprentissage sûr pour les systèmes robotiques ego-monde

Des chercheurs proposent SOWL-MPC, une méthode de contrôle prédictif sûr conçue pour un nouveau scénario baptisé "ego-world robotic framework": un robot ego doit naviguer aux côtés d'un autre robot ("world robot") dont la politique de contrôle est totalement inconnue. Plutôt que de supposer un comportement prévisible chez l'autre agent, comme le font la plupart des méthodes existantes, l'approche combine un mécanisme d'apprentissage en ligne basé sur des processus gaussiens variationnels épars (SVGP) avec un schéma de contrôle à horizon glissant. À partir de simples mesures d'état bruitées, le système infère une distribution postérieure sur la politique latente du robot tiers, mise à jour en continu via un conditionnement variationnel en ligne (OVC), puis propagée dans la dynamique non linéaire du système via un schéma approché de propagation des moments, avant d'alimenter un contrôleur prédictif (MPC) sensible à l'incertitude. La méthode a été testée lors de campagnes Monte Carlo en simulation sous ROS 2, puis validée sur du matériel robotique réel dans une arène intérieure. Il s'agit d'un article de recherche déposé sur arXiv (2607.22225v1), pas d'un produit commercialisé. L'enjeu dépasse l'exercice académique: dans les entrepôts, les usines ou les espaces partagés où circulent plusieurs robots mobiles (AMR) ou humanoïdes issus de flottes ou de fabricants différents, un robot ne connaît généralement pas la politique de contrôle exacte des autres agents évoluant autour de lui. Les méthodes de navigation sûre reposent le plus souvent sur des hypothèses simplificatrices, modèles cinématiques fixes, comportements connus à l'avance, qui s'effondrent dès que l'environnement devient hétérogène. Une approche capable d'apprendre en ligne le comportement d'un agent inconnu tout en garantissant des marges de sécurité formelles répond directement à ce point de friction, potentiellement utile pour l'intégration de flottes multi-fournisseurs. Le travail s'inscrit dans la lignée des recherches combinant processus gaussiens et contrôle prédictif pour la navigation sûre, un axe actif depuis plusieurs années en robotique mobile et en interaction homme-robot. La validation reste toutefois limitée à une arène intérieure contrôlée: le passage à des environnements réels plus complexes, avec davantage d'agents ou des dynamiques plus rapides, constitue la prochaine étape logique avant tout usage industriel.

RecherchePaper
1 source
TrAct : relier le contrôle robotique et la prédiction visuelle par les trajectoires visuelles
4arXiv cs.RO 

TrAct : relier le contrôle robotique et la prédiction visuelle par les trajectoires visuelles

Des chercheurs présentent TrAct, un framework de décision robotique fonde sur un modèle du monde et structure autour de trois composants, dans un article publie sur arXiv (2608.24101). VLAT (Vision-Language-Action-and-Track) prédit conjointement des actions candidates et les trajectoires visuelles associées a partir d'une observation et d'une instruction en langage naturel. TWM (track-conditioned world model) projette ensuite les conséquences visuelles futures de ces trajectoires. VLAC (vision-language reward model) note les résultats prédits pour sélectionner la meilleure paire action-trajectoire, qui est alors exécutée par le robot. Sur un nouveau benchmark de simulation baptise LIBERO-INTEGRAL et sur un bras Franka en conditions réelles, TrAct fait passer le taux de réussite de 27% a 55% en simulation et de 49% a 76% en réel, compare a la référence Pi-0.5. Le module TWM améliore par ailleurs la qualité de prédiction vidéo par rapport a un modèle du monde conditionne uniquement par l'action (AWM). L'enjeu tient au problème cible: les actions robotiques sont spécifiques a chaque plateforme mécanique et ne correspondent que faiblement aux changements visuels dans l'image, ce qui limite leur usage comme signal de conditionnement pour les modèles du monde. Les tracks visuels, indépendants de l'embodiment, offrent un guide dense et spatialement précis pour anticiper l'action correcte, en s'insérant comme représentation intermédiaire entre perception, prédiction et contrôle. TrAct s'attaque ainsi a l'écart persistant entre performances en simulation et généralisation en conditions réelles, un point faible récurrent des architectures VLA. Les gains face a Pi-0.5, référence crédible du secteur, sont notables, mais le benchmark LIBERO-INTEGRAL est propose par les auteurs eux-mêmes et l'article n'a pas encore été relu par les pairs, ce qui appelle une reproduction indépendante avant toute conclusion définitive pour l'industrie. Ces travaux s'inscrivent dans la vague de recherche sur les modèles Vision-Language-Action, aux cotes de Pi-0 et Pi-0.5 chez Physical Intelligence, GR00T N2 chez Nvidia ou Helix chez Figure AI. L'usage d'un bras Franka Emika comme plateforme d'évaluation reste un standard académique, loin des déploiements en usine revendiques par des acteurs comme Figure (Figure 03) ou Tesla (Optimus). Aucun acteur français ou européen, tel Wandercraft, Pollen Robotics ou Enchanted Tools, n'apparait dans cette étude, qui demeure a ce stade une contribution de recherche en preprint, sans partenariat industriel ni calendrier de déploiement annonce.

RechercheOpinion
1 source