Aller au contenu principal
RecherchearXiv cs.RO 

PACE : manipulation robotique cohérente par étapes sur de longs horizons grâce à un contexte aligné sur la progression

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent PACE (Progress-Aligned Context for Execution), une méthode destinée aux politiques robotiques conditionnées par démonstration, dans le cadre de la manipulation longue durée. Le problème visé porte le nom de « stage confusion » : lorsque des états visuellement proches reviennent à différentes étapes d'une tâche, ou lorsque la démonstration et l'exécution n'avancent pas à la même vitesse, la politique perd le fil et se trompe d'étape. PACE compresse la démonstration complète en jetons de prompt multimodaux ordonnés, et s'appuie, pendant l'entraînement uniquement, sur une supervision d'attention « à double arête » (dual-edge) pour faire apparaître la structure latente des étapes. À l'exécution, une mémoire à poids rapides (fast-weight), propre à l'épisode, encode de façon causale les transitions action-observation réellement effectuées et module la cross-attention sur le prompt. Un expert d'action unifié, basé sur la diffusion, reçoit ainsi un contexte aligné sur la progression, sans étiquettes d'étape au test ni politiques spécifiques à chaque étape. Sur LIBERO-Gen, le taux de réussite passe de 88,9 % à 94,0 % sur Goal Chain, et de 79,1 % à 83,3 % sur Spatial Combination. Sur les tâches Block Routing en deux étapes, il bondit de 33,3 % à 73,3 %.

L'intérêt tient moins au gain sur les benchmarks LIBERO, déjà proches de la saturation et modestes (+5,1 et +4,2 points), qu'au diagnostic posé : une part notable des échecs des politiques VLA et des politiques à diffusion sur les tâches séquentielles viendrait d'une mauvaise localisation dans la tâche, et non d'un déficit de dextérité ou de perception. Le doublement du succès sur Block Routing, où les états se répètent entre les étapes, va dans ce sens, et l'analyse d'échecs des auteurs indique que l'alignement structuré de la démonstration et la mémoire causale contribuent conjointement. Pour les intégrateurs, la promesse est de spécifier un comportement par une démonstration unique sans réentraîner de politique par étape, ce qui réduit le coût de mise en production d'enchaînements d'assemblage ou de tri. Les réserves sont nettes : les résultats proviennent de simulation, d'une seule version préprint, sans validation sur robot réel ni mesure de latence ajoutée par la mémoire. Le gain sur Block Routing part en outre d'une base très basse, ce qui en amplifie l'effet apparent.

PACE s'inscrit dans la lignée des politiques généralistes de type VLA (Pi-0, GR00T, Helix) et des approches par imitation conditionnée sur démonstration, qui peinent sur les horizons longs faute de mémoire d'exécution explicite. Il rejoint les travaux sur les mémoires épisodiques et les couches à poids rapides pour la robotique. Les auteurs ne citent pas de déploiement industriel ni de calendrier. Les prochaines étapes logiques sont des tests sur robots physiques, des comparaisons directes avec les grands VLA du marché et une évaluation sur des tâches plus longues que deux étapes. Aucun acteur français ou européen n'est mentionné dans cette publication.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

ReCo : locomotion cohérente avec la réponse de la politique grâce à une MPC adaptée, pour la manipulation par robots à pattes
1arXiv cs.RO 

ReCo : locomotion cohérente avec la réponse de la politique grâce à une MPC adaptée, pour la manipulation par robots à pattes

Des chercheurs publient sur arXiv ReCo (Response-Consistent Locomotion), un cadre logiciel pour la manipulation continue sur robots à pattes, c'est-à-dire la tâche qui consiste à suivre précisément une trajectoire avec l'effecteur d'un bras pendant que la base continue de marcher. L'approche combine apprentissage par renforcement (RL) et commande prédictive (MPC). La politique apprise assure une locomotion robuste, tandis que le MPC coordonne la base et le bras pour compenser les erreurs de suivi. La contribution tient en deux briques. Un « response shaping » entraîne la politique à répondre aux commandes de façon cohérente et répétable malgré des dynamiques randomisées. Un modèle de réponse en boucle fermée, identifié ensuite, permet au MPC de planifier conjointement les commandes de locomotion et le mouvement du bras. Sur un benchmark en simulation, ReCo réduit l'erreur quadratique moyenne (RMSE) de position de 28,7 % et celle d'orientation de 27,4 % par rapport au meilleur point de comparaison pour chaque métrique. Des essais sur robot réel démontrent une manipulation continue embarquée, base et bras coordonnés. Le résumé ne précise ni la plateforme, ni la charge utile, ni les temps de cycle. L'enjeu est un problème que connaissent bien les intégrateurs de robots mobiles manipulateurs. Le MPC ne peut compenser que le mouvement de base qu'il sait prédire. Or la réponse d'une politique RL à une commande de vitesse varie avec la phase de marche, les contacts et la charge portée. Cette variabilité rend la compensation imprécise précisément quand le robot transporte quelque chose ou marche sur un sol irrégulier. Rendre la réponse de la politique prévisible plutôt que la corriger après coup est une voie pragmatique pour rapprocher les politiques apprises des contrôleurs à modèle, sans renoncer à la robustesse du RL. Pour un décideur industriel, cela concerne la précision en conditions réelles, souvent le point faible des démonstrations de manipulation sur quadrupèdes. Les gains annoncés restent toutefois mesurés en simulation, face à des références choisies par les auteurs, et la validation matérielle semble qualitative. Il s'agit d'un résultat de recherche, sans produit ni déploiement associé. Ces travaux s'inscrivent dans la lignée de la manipulation « loco-manipulation » sur quadrupèdes équipés d'un bras, où deux écoles s'opposent. L'une repose sur des politiques RL de bout en bout pour l'ensemble du corps. L'autre est hybride, avec un RL pour la marche et une optimisation pour le bras. ReCo se range dans la seconde. Elle vise à combler l'écart entre une politique de marche opaque et un planificateur qui a besoin d'un modèle fiable. La suite logique serait des essais sur d'autres plateformes, avec des charges variées et des tâches plus longues, ainsi qu'une comparaison avec des politiques de corps entier entraînées de bout en bout. Le texte n'annonce aucun calendrier de ce type.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
2arXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement. L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives. Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

RechercheActu
1 source
SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon
3arXiv cs.RO 

SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon

Des chercheurs présentent SeeQ (Subtask-elicited Q-functions) dans un preprint publié sur arXiv sous la référence 2609.22085v1, classé comme soumission nouvelle. La méthode s'attaque à un problème connu des politiques robotiques généralistes : leur fragilité sur des tâches longues et multi-étapes qui exigent plusieurs tentatives et une délibération répétée sur une même sous-étape avant de réussir. Plutôt que d'apprendre une fonction de valeur Q sur la récompense globale de la tâche, ce qui impose un horizon de crédit-assignation très long et des mises à jour de Bellman difficiles à stabiliser, SeeQ apprend une valeur Q pour la sous-tâche activement en cours, ce qui raccourcit l'horizon de prédiction et rend possible un apprentissage par différence temporelle efficace. Pendant l'entraînement, des annotations de sous-tâches déjà présentes dans des jeux de données robotiques hors ligne fournissent la décomposition, permettant d'exploiter des données larges et potentiellement sous-optimales. Au moment de l'inférence, aucune annotation humaine ni module séparé de prédiction de sous-tâche n'est nécessaire : l'architecture, construite sur un socle vision-langage, prédit d'abord de manière autorégressive la sous-tâche active en langage naturel avant d'en estimer la valeur, puis est pré-entraînée sur des données ouvertes de manipulation robotique et affinée sur les tâches cibles. Les auteurs rapportent des essais sur quatre tâches de manipulation réelles, menées sur deux plateformes robotiques bimanuelles, avec une amélioration jugée substantielle du pilotage de politique en best-of-N, sans toutefois donner de chiffres précis de taux de réussite ni d'écart avec les méthodes de référence, une imprécision qu'il convient de relever. Cette approche cible un point de friction central pour les politiques génératives de type vision-langage-action (VLA) : leur capacité à enchaîner plusieurs étapes sans dérive ni blocage répété sur la même sous-tâche. Les fonctions de valeur Q sont déjà utilisées pour classer des actions candidates ou guider l'amélioration d'une politique, mais leur entraînement sur des récompenses éparses au niveau de la tâche entière se heurte à des coûts de calcul et de couverture de données prohibitifs. En ramenant le problème à une valeur par sous-tâche et en supprimant le besoin d'un module de prédiction de sous-tâche séparé au moment du déploiement, SeeQ propose une piste concrète pour rendre le pilotage de politiques exploitable par des intégrateurs qui s'appuient sur des politiques VLA pré-entraînées, sans pipeline d'annotation supplémentaire côté production. SeeQ s'inscrit dans un courant de recherche qui cherche à doter les politiques VLA généralistes, dans la lignée de travaux comme Pi-0 ou GR00T N2, de mécanismes de vérification et de guidage complémentaires plutôt que de s'appuyer uniquement sur l'imitation. Il s'agit d'un preprint de recherche académique, non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun nom de robot commercial ni calendrier de mise sur le marché n'apparaît dans l'article, et les expériences restent limitées à deux plateformes bimanuelles en conditions de laboratoire. La suite logique, non précisée par les auteurs, serait une extension à davantage de plateformes et de tâches ainsi qu'un chiffrage plus détaillé des gains, avant toute intégration envisageable dans des piles logicielles de production.

RecherchePaper
1 source
HCPG-Flow : guidage hiérarchique de progression de contact pour la manipulation robotique par politique de flux
4arXiv cs.RO 

HCPG-Flow : guidage hiérarchique de progression de contact pour la manipulation robotique par politique de flux

Les chercheurs à l'origine de HCPG-Flow présentent une nouvelle méthode de sélection d'actions pour les politiques de manipulation robotique de type "flow", publiée sur arXiv (2607.17651). Le problème visé est concret : ces politiques génèrent plusieurs propositions d'actions multimodales à chaque étape de contrôle, mais le robot ne peut en exécuter qu'une seule, et le classement habituel par un critique (critic-based ranking) fausse la collecte de données lorsque les candidates sont mal représentées dans le buffer de replay. HCPG-Flow ajoute à SAC-Flow un mécanisme de guidage hiérarchique centré sur l'objet, actif au moment du rollout, sans modifier les objectifs d'acteur et de critique existants. Le système bascule d'abord sur l'approche de l'effecteur terminal, puis, une fois le contact établi, sur la progression de la tâche, en notant chaque proposition selon la réduction de premier ordre d'une distance pertinente pour la tâche, standardisée au sein de l'ensemble de candidats, avant d'exécuter une combinaison d'actions contrôlée par température. Sur dix tâches simulées, la méthode améliore le taux de succès moyen par rapport à SAC-Flow sur les deux bancs d'essai testés, avec un gain de 9,5 points de pourcentage sur Maniskill. En conditions réelles, sur quatre tâches physiques, HCPG-Flow atteint un haut taux de succès tout en réduisant de 17,4 % le nombre d'étapes nécessaires pour compléter une tâche avec succès. Pour le secteur de la robotique manipulative, ce travail s'attaque à un goulot d'étranglement bien identifié des politiques par apprentissage par renforcement à base de flow matching : la fiabilité de la sélection d'action au moment de l'exécution, distincte de la qualité de l'apprentissage lui-même. En s'appuyant sur une heuristique physique simple, le progrès de contact plutôt qu'une pure estimation de valeur, la méthode réduit la dépendance à des estimations de critique potentiellement biaisées, un point sensible pour les intégrateurs qui cherchent des politiques robustes et transférables du simulateur au réel (sim-to-real), notamment sur des tâches de manipulation fine où le contact physique conditionne la réussite. HCPG-Flow s'inscrit dans la lignée des travaux récents combinant flow policies et SAC (Soft Actor-Critic), une famille de méthodes qui a gagné en popularité pour représenter des distributions d'actions multimodales en robotique, en concurrence directe avec les approches par diffusion. Les auteurs mettent à disposition une page de projet (hitxraz.github.io/HCPG-Flow) présentant probablement code et démonstrations, sans toutefois préciser à ce stade de calendrier de déploiement industriel ni de partenariat avec des acteurs commerciaux du secteur.

RecherchePaper
1 source