Aller au contenu principal
RecherchearXiv cs.RO 

FoldBack : politique générative masquée auto-correctrice pour le pliage de vêtements à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

FoldBack, une politique générative masquée à auto-correction dédiée au pliage de vêtements sur de longs horizons, est décrite dans un preprint arXiv (2610.10462). Les auteurs partent d'un défaut courant des politiques à longue trajectoire : après une saisie manquée ou un glissement, elles poursuivent la séquence même si le vêtement n'a pas atteint la configuration voulue. FoldBack structure sa récupération autour de trois décisions prises à l'inférence : quand raffiner et vérifier, comment revenir en arrière, et où et comment réessayer. Le raffinement et la vérification de saisie sont alignés sur les événements de pick-and-place. Le robot revient à une configuration de pré-saisie permettant un nouvel essai, en conservant les saisies réussies. Le segment défaillant et une sélection d'actions futures sont ensuite régénérés, en évitant les emplacements de saisie déjà en échec. Selon les auteurs, c'est la première politique de trajectoire complète éditable à unifier ces décisions. Elle n'exige ni démonstrations de récupération ni réentraînement de la politique de base. Sur 33 vêtements réels répartis en six catégories, FoldBack atteint 75,2 % de réussite finale de pliage et un IoU de masque final de 0,837, contre 45,7 % et 0,689 pour la meilleure référence antérieure.

L'intérêt tient à la méthode. La majorité des politiques de manipulation déformable actuelles, y compris les VLA, fonctionnent en boucle quasi ouverte sur les longues séquences : une erreur précoce, comme un pli mal saisi, se propage et ruine le résultat final. Obtenir près de 30 points de réussite supplémentaires sans nouvelle donnée de récupération ni réentraînement suggère qu'une part importante de l'écart entre démonstration et fiabilité se joue dans la logique d'inférence (détection, annulation, nouvel essai) plutôt que dans la quantité de données. Pour un intégrateur visant la logistique textile, la blanchisserie industrielle ou le tri de retours e-commerce, c'est un argument en faveur de couches de supervision ajoutées à une politique existante. Des réserves s'imposent toutefois : 75,2 % reste loin des taux exigés en production, le protocole ne précise pas dans l'extrait la durée des essais ni le nombre de répétitions par vêtement, et le résultat provient d'un laboratoire, non d'un déploiement.

Le pliage de linge est devenu un banc d'essai emblématique de la manipulation déformable, popularisé par les démonstrations de politiques par diffusion et de modèles VLA généralistes comme Pi-0, capables de plier des vêtements mais sans garantie de récupération sur échec. Les approches génératives masquées, qui permettent de réécrire une partie seulement d'une trajectoire, offrent ici le levier technique de l'édition ciblée. Le texte disponible ne nomme ni la plateforme robotique ni les baselines précises, ce qui limite la comparaison directe avec d'autres travaux. La suite probable est une validation sur davantage de catégories et de conditions, puis une intégration à des modèles fondation. Il s'agit pour l'instant d'une recherche académique, sans produit ni calendrier commercial annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

MobiAgent : auto-amélioration récursive de la politique à double boucle pour la manipulation mobile à long horizon
1arXiv cs.RO 

MobiAgent : auto-amélioration récursive de la politique à double boucle pour la manipulation mobile à long horizon

Des chercheurs publient MobiAgent, un framework agentique à double boucle pour la manipulation mobile longue durée, c'est-à-dire des tâches en plusieurs étapes où un robot doit combiner déplacement et usage du bras. La boucle interne, active au déploiement, sépare le raisonnement de haut niveau du contrôle bas niveau grâce à des compétences atomiques composables. Des modèles vision-langage assurent une planification à horizon glissant et une « réflexion visuelle » sur l'état de la scène, afin de recomposer les compétences et de rattraper les erreurs. Ces compétences sont exécutées par des experts à flow-matching qui partagent un même backbone VLM. La boucle externe segmente et vérifie automatiquement les rollouts de déploiement, les regroupe par clustering pour découvrir de nouvelles compétences atomiques, puis affine la bibliothèque sans annotation humaine. Sur BEHAVIOR-1K, MobiAgent dépasse de 22,5 points de pourcentage la baseline π0.5-TA. Par recyclage autonome des données, le taux de succès passe de 7,5 % à 27,5 % sur RoboCasa, et de 32,5 % à 57,5 % sur le robot Astribot S1 en conditions réelles. L'intérêt tient à deux verrous que les modèles VLA actuels n'ont pas levés. Ces modèles sont performants sur des tâches courtes, mais les erreurs d'exécution s'accumulent sur les séquences longues. La locomotion et le contrôle du bras entrent aussi en interférence de capacité lorsqu'une même politique doit tout apprendre. Les experts spécialisés sur backbone commun répondent à cette seconde difficulté tout en conservant la réutilisabilité. Le résultat le plus parlant pour un intégrateur est la boucle d'amélioration sans annotation : un système qui exploite ses propres échecs et succès de terrain réduit le coût de la collecte de démonstrations, premier poste de dépense des déploiements de manipulation. Les chiffres appellent toutefois à la prudence. Un passage à 27,5 % sur RoboCasa signifie que trois tâches sur quatre échouent encore. Les 57,5 % sur Astribot S1 viennent d'un seul robot et d'un jeu de tâches limité, dont la taille n'est pas précisée dans le résumé. On est donc face à un résultat de recherche, pas à un produit ni à un déploiement industriel. Ce travail s'inscrit dans la montée des architectures hiérarchiques qui tentent de pallier les limites des VLA monolithiques comme π0.5 de Physical Intelligence. Il rejoint les approches à double système popularisées par Helix de Figure ou GR00T de NVIDIA, avec une différence : l'accent mis sur l'apprentissage continu en boucle fermée plutôt que sur une architecture figée. Les benchmarks choisis, RoboCasa et BEHAVIOR-1K, restent des environnements de simulation de tâches domestiques, et la transposition à des cadences industrielles reste à démontrer. La suite logique est une validation sur plus de robots, de tâches et d'environnements, avec des mesures de robustesse sur de longues périodes. Aucun pilote commercial ni calendrier n'est annoncé. L'article, publié sur arXiv sous la référence 2610.03476, est une préimpression qui n'a pas encore été évaluée par des pairs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon
2arXiv cs.RO 

Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon

Des chercheurs du Robin Lab de l'Université du Texas à Austin ont publié fin juin 2026 un preprint (arXiv:2606.25136) présentant HALO, une politique visuomotrice dotée d'un mécanisme de récupération mémorielle par attention pour le contrôle robotique à long horizon. L'architecture cible les robots polyvalents opérant dans des environnements partiellement observables, typiquement le domicile : le robot doit retrouver où un objet a été posé, se souvenir qu'un utilisateur a déjà accompli une sous-tâche, ou mémoriser l'état d'un appareil activé plusieurs minutes auparavant. HALO répond à deux défis identifiés lors de l'apprentissage par imitation sur données hors-ligne : la corrélation spurieuse entre contexte passé et actions prédites, et l'accumulation d'erreurs en boucle fermée qui entraîne une dérive progressive du modèle. Pour y remédier, la méthode distille des priors issus d'un modèle vision-langage (VLM) via un objectif de question-réponse vidéo généré depuis les trajectoires de démonstration, et combine cela à une attention sparse limitée aux segments d'historique les plus pertinents. Au total, HALO peut récupérer des informations pertinentes sur jusqu'à huit minutes d'expérience passée. Ce résultat est notable car il attaque frontalement le goulot d'étranglement des tâches longues-durées, là où la majorité des politiques visuomotrices actuelles, y compris les approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, supposent implicitement un horizon court ou une observabilité quasi-complète. La distillation de priors VLM pour orienter la récupération vers l'information pertinente à la tâche est une voie prometteuse pour réduire le gap démo-réalité, car elle ancre l'attention dans une compréhension sémantique plutôt que dans des heuristiques codées à la main. L'attention sparse contribue à contenir la propagation d'erreurs qui, dans les architectures transformer standard sur contexte long, peut faire diverger la politique après quelques dizaines de secondes d'exécution autonome. HALO s'inscrit dans une dynamique de recherche qui voit Transformers et modèles de langage coloniser la couche mémoire des systèmes robotiques, après avoir dominé la planification symbolique et la génération d'instructions. Le Robin Lab publie régulièrement sur l'apprentissage robot en environnements non structurés ; ce travail est encore au stade preprint et aucun déploiement physique à l'échelle n'est annoncé. Les concurrents directs incluent les approches à mémoire épisodique de travaux comme RT-X, mais aussi les architectures récurrentes à état latent explorées par des labos comme CMU ou Stanford. Les prochaines étapes attendues sont une validation sur robot physique dans des scénarios domestiques réels et une comparaison quantitative avec des baselines mémorielle existantes.

RechercheOpinion
1 source
SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon
3arXiv cs.RO 

SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon

Des chercheurs présentent SeeQ (Subtask-elicited Q-functions) dans un preprint publié sur arXiv sous la référence 2609.22085v1, classé comme soumission nouvelle. La méthode s'attaque à un problème connu des politiques robotiques généralistes : leur fragilité sur des tâches longues et multi-étapes qui exigent plusieurs tentatives et une délibération répétée sur une même sous-étape avant de réussir. Plutôt que d'apprendre une fonction de valeur Q sur la récompense globale de la tâche, ce qui impose un horizon de crédit-assignation très long et des mises à jour de Bellman difficiles à stabiliser, SeeQ apprend une valeur Q pour la sous-tâche activement en cours, ce qui raccourcit l'horizon de prédiction et rend possible un apprentissage par différence temporelle efficace. Pendant l'entraînement, des annotations de sous-tâches déjà présentes dans des jeux de données robotiques hors ligne fournissent la décomposition, permettant d'exploiter des données larges et potentiellement sous-optimales. Au moment de l'inférence, aucune annotation humaine ni module séparé de prédiction de sous-tâche n'est nécessaire : l'architecture, construite sur un socle vision-langage, prédit d'abord de manière autorégressive la sous-tâche active en langage naturel avant d'en estimer la valeur, puis est pré-entraînée sur des données ouvertes de manipulation robotique et affinée sur les tâches cibles. Les auteurs rapportent des essais sur quatre tâches de manipulation réelles, menées sur deux plateformes robotiques bimanuelles, avec une amélioration jugée substantielle du pilotage de politique en best-of-N, sans toutefois donner de chiffres précis de taux de réussite ni d'écart avec les méthodes de référence, une imprécision qu'il convient de relever. Cette approche cible un point de friction central pour les politiques génératives de type vision-langage-action (VLA) : leur capacité à enchaîner plusieurs étapes sans dérive ni blocage répété sur la même sous-tâche. Les fonctions de valeur Q sont déjà utilisées pour classer des actions candidates ou guider l'amélioration d'une politique, mais leur entraînement sur des récompenses éparses au niveau de la tâche entière se heurte à des coûts de calcul et de couverture de données prohibitifs. En ramenant le problème à une valeur par sous-tâche et en supprimant le besoin d'un module de prédiction de sous-tâche séparé au moment du déploiement, SeeQ propose une piste concrète pour rendre le pilotage de politiques exploitable par des intégrateurs qui s'appuient sur des politiques VLA pré-entraînées, sans pipeline d'annotation supplémentaire côté production. SeeQ s'inscrit dans un courant de recherche qui cherche à doter les politiques VLA généralistes, dans la lignée de travaux comme Pi-0 ou GR00T N2, de mécanismes de vérification et de guidage complémentaires plutôt que de s'appuyer uniquement sur l'imitation. Il s'agit d'un preprint de recherche académique, non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun nom de robot commercial ni calendrier de mise sur le marché n'apparaît dans l'article, et les expériences restent limitées à deux plateformes bimanuelles en conditions de laboratoire. La suite logique, non précisée par les auteurs, serait une extension à davantage de plateformes et de tâches ainsi qu'un chiffrage plus détaillé des gains, avant toute intégration envisageable dans des piles logicielles de production.

RecherchePaper
1 source
Esquisses proprioceptives comme intention à long terme pour des politiques d'action génératives
4arXiv cs.RO 

Esquisses proprioceptives comme intention à long terme pour des politiques d'action génératives

Des chercheurs proposent les Proprioceptive Action Models (PAM), une architecture de politique générative qui produit, dans un même transformer de débruitage (diffusion), deux sorties jointes : un « croquis » compact du chemin articulaire restant à parcourir, et un chunk d'actions dense directement exécutable. Le croquis est paramétré par l'abscisse curviligne (arc length) plutôt que par le temps, ce qui encode une intention géométrique indépendante du rythme d'exécution. Une attention block-causal et un calendrier de débruitage décalé (staggered) imposent une dépendance orientée du croquis vers les actions : les tokens d'action sont conditionnés sur un croquis de plus en plus propre au fil de l'échantillonnage. En simulation, PAM améliore ses équivalents « actions seules » sur Push-T et LIBERO-Long. Sur quatre tâches bimanuelles réelles, le taux de réussite passe de 47,5 % à 75,0 %. L'étude, publiée sur arXiv (2610.02759), est accompagnée d'une page projet. Aucun matériel commercial ni déploiement n'est annoncé : il s'agit d'un résultat de recherche. Le problème visé est bien connu des équipes qui déploient des politiques de type VLA ou diffusion : ces modèles prédisent des chunks d'actions courts et n'ont pas de représentation explicite de l'intention à long horizon, d'où des dérives ou des hésitations sur les tâches longues. Les solutions existantes (plans en langage, images de sous-buts, prévisions vidéo) sont coûteuses à générer et doivent encore être converties en mouvement robot. Prédire directement des trajectoires futures évite cette traduction, mais une trajectoire dense indexée sur le temps exige beaucoup de paramètres pour couvrir toute la tâche restante, et sur un horizon court elle répète le chunk d'actions. Le croquis en espace articulaire, léger et sans temps, offre un compromis : un signal de guidage long horizon qui reste dans l'espace propre du robot. Un bémol : un gain de 47,5 % à 75,0 % sur quatre tâches réelles est encourageant, mais le résumé ne donne ni le nombre d'essais, ni les plateformes, ni la variance, et la comparaison se fait uniquement avec la version sans croquis du même modèle, pas avec des baselines externes comme Pi-0 ou des modèles à plans en langage. Ce travail s'inscrit dans la course pour doter les politiques génératives (Diffusion Policy, ACT, puis les VLA de type Pi-0, GR00T ou Helix) d'une planification plus longue sans alourdir l'inférence. Il se positionne contre les approches qui passent par la vidéo ou le langage, plus lourdes à calculer. Les prochaines étapes à surveiller sont une validation sur des modèles de fondation à grande échelle, des tâches de manipulation plus variées et des comparaisons directes avec les VLA actuels, avant que l'idée ne passe en intégration industrielle.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source