Aller au contenu principal
SCREP : génération de trajectoires perceptuelles par régression de coordonnées de scène et apprentissage évidentiel
RecherchearXiv cs.RO 

SCREP : génération de trajectoires perceptuelles par régression de coordonnées de scène et apprentissage évidentiel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2507.07467v3) SCREP, un planificateur de trajectoire dit "perception-aware" conçu pour les drones autonomes évoluant en intérieur sans signal GPS. Le système repose sur la régression de coordonnées de scène (SCR, ou Scene Coordinate Regression) couplée à un apprentissage évidentiel : au lieu d'effectuer une reconstruction de carte 3D par appariement de features (approche classique mais coûteuse en calcul et en stockage), le réseau prédit directement les coordonnées 3D associées à chaque pixel de l'image embarquée, ce qui permet une estimation de pose absolue en temps réel. Un optimiseur de trajectoire à horizon glissant (receding-horizon) oriente activement la caméra vers les zones de la scène présentant la plus faible incertitude de localisation. Un lisseur à retard fixe (fixed-lag smoother) fusionne ensuite les estimations de pose SCR, de basse fréquence, avec les données IMU haute fréquence pour produire une estimation de pose continue et de haute qualité. En simulation, SCREP réduit l'erreur quadratique moyenne (RMSE) de translation d'au moins 4,9 % et celle de rotation d'au moins 30,8 % par rapport aux méthodes de référence. Des expériences hardware-in-the-loop valident la faisabilité dans des conditions proches du déploiement réel.

L'intérêt industriel de cette approche tient à deux tensions classiques dans la navigation autonome en intérieur : la scalabilité des cartes de localisation visuelle et le coût de calcul embarqué. Les méthodes par appariement de features (comme celles utilisées dans ORB-SLAM ou HLoc) imposent une reconstruction préalable de la carte et souffrent d'une explosion mémoire dans les grands environnements entrepôts ou industriels. La SCR résout ce problème par un réseau compact appris offline, directement exploitable onboard sur un calculateur de drone. L'apport d'SCREP va plus loin : en intégrant l'incertitude estimée dans la boucle de planification de trajectoire, le système évite activement les zones visuellement ambiguës plutôt que de subir leur dégradation localement. C'est un changement de paradigme notable par rapport aux planificateurs classiques qui traitent la localisation comme une boîte noire externe. Pour un intégrateur ou un décideur industriel déployant des drones d'inspection ou d'inventaire, cela réduit le risque de dérive de pose dans les couloirs peu texturés ou les allées sombres.

La navigation en environnement GPS-denied est un verrou technique persistant pour les drones d'intérieur autonomes, avec une communauté de recherche active depuis une décennie autour de VIO (Visual-Inertial Odometry), SLAM et, plus récemment, des méthodes apprises comme NeRF ou les champs de scène implicites. La SCR elle-même est une alternative proposée initialement par la communauté relocalisation visuelle (travaux pionniers Microsoft Research, DSAC++), mais son application dans une boucle de planification proactive reste peu explorée. SCREP se positionne comme une contribution de recherche académique, présentée sous forme de preprint arXiv sans affiliation industrielle identifiée ni annonce de déploiement commercial. Les résultats hardware-in-the-loop sont encourageants mais ne constituent pas une validation terrain à grande échelle. Les concurrents directs incluent les approches VIO+planification certifiée (ETH Zurich, MIT CSAIL), ainsi que des acteurs industriels comme Skydio ou Exotec pour la navigation autonome en entrepôt. Les prochaines étapes attendues seraient une évaluation sur des environnements réels de grande dimension et une comparaison avec des champs de scène neuraux récents comme l'iNeRF ou les Gaussian Splats.

Impact France/UE

Impact indirect sur Exotec (France) et autres opérateurs européens de drones d'entrepôt : si l'approche SCR+planification proactive se confirme à l'échelle terrain, elle pourrait réduire le coût des cartes de localisation visuelle dans les grands entrepôts logistiques européens.

Dans nos dossiers

À lire aussi

Traj-VLN : apprentissage de l'interaction dans l'espace des pixels par génération autorégressive de trajectoire
1arXiv cs.RO 

Traj-VLN : apprentissage de l'interaction dans l'espace des pixels par génération autorégressive de trajectoire

Des chercheurs présentent Traj-VLN, une méthode publiée en prépublication sur arXiv (référence 2607.10744) pour la navigation vision-langage en environnements continus (VLN-CE), où un agent embarqué doit se déplacer dans un lieu inconnu en suivant des instructions en langage naturel du type « marche jusqu'au bout du canapé et tourne à gauche ». Plutôt que d'injecter des données de profondeur ou une géométrie 3D explicite dans le modèle vision-langage (VLM), les auteurs proposent de faire apprendre directement au VLM, par fine-tuning, à générer une trajectoire dans l'espace des pixels de l'image 2D, de façon autorégressive : à partir de l'instruction et de l'historique d'observations, le modèle prédit une séquence de coordonnées de pixels formant un chemin depuis le centre bas de l'image courante. Les auteurs indiquent que cette supervision par trajectoire en pixels, dont un signal proche (le pixel-goal) avait déjà montré sa supériorité sur l'apprentissage d'actions discrètes dans des travaux antérieurs, améliore sensiblement les performances de navigation, et que leur modèle principal atteint un niveau état de l'art avec des ressources de calcul et un volume de données d'entraînement relativement limités. L'intérêt dépasse l'exercice académique : la navigation vision-langage en continu reste un verrou central pour tout robot mobile ou humanoïde censé exécuter des instructions naturelles dans un environnement non cartographié au préalable, un scénario clé pour la logistique d'entrepôt, l'assistance domestique ou l'inspection industrielle. Le choix de contourner la profondeur et la géométrie 3D est significatif : les VLM généralistes sont entraînés quasi exclusivement sur des conversations autour d'images RGB, et leur faire ingérer des cartes de profondeur ou des nuages de points exige d'ordinaire des architectures spécialisées ou des données rares. En reformulant le problème comme une génération de trajectoire en pixels, modalité que ces modèles maîtrisent déjà nativement, Traj-VLN illustre une tendance de fond du secteur : réutiliser les priors des VLM plutôt que d'entraîner des chaînes de perception 3D dédiées, ce qui pourrait réduire le coût d'intégration pour les fabricants de robots mobiles autonomes (AMR) et les intégrateurs cherchant à connecter leurs plateformes à des VLM existants. Ce travail s'inscrit dans la lignée des approches vision-langage-action (VLA) qui, ces deux dernières années, cherchent à faire des sorties en pixels ou en points-objectifs une interface universelle entre perception et action, aussi bien pour la manipulation que pour la navigation. Le résumé du papier ne précise ni les benchmarks utilisés, ni les chiffres de performance exacts, ni la disponibilité du code ou des poids, ce qui invite à la prudence tant que ces éléments ne sont pas comparés indépendamment aux systèmes concurrents. Publié comme simple prépublication arXiv (catégorie « cross »), Traj-VLN n'est rattaché à aucun laboratoire nommé ni à un acteur français ou européen dans les informations disponibles ; la suite logique, comme pour la plupart des travaux VLN académiques, sera une évaluation sur des benchmarks standards du domaine (R2R, RxR ou équivalents en continu) et, potentiellement, un transfert au delà de la simulation vers des plateformes robotiques réelles.

RechercheOpinion
1 source
ReinforceGen : politiques de compétences hybrides avec génération automatisée de données et apprentissage par renforcement
2arXiv cs.RO 

ReinforceGen : politiques de compétences hybrides avec génération automatisée de données et apprentissage par renforcement

Une équipe de recherche en robotique publie ReinforceGen, un système combinant décomposition de tâches, génération automatisée de données, apprentissage par imitation et planification de mouvement, le tout affiné par apprentissage par renforcement. Le principe consiste à segmenter une tâche de manipulation longue en plusieurs compétences localisées, reliées entre elles par un planificateur de mouvement. Ces compétences sont d'abord entraînées par imitation à partir d'un jeu de données généré depuis seulement 10 démonstrations humaines, puis affinées via adaptation en ligne et renforcement. Sur le benchmark Robosuite, ReinforceGen atteint 80% de taux de réussite sur l'ensemble des tâches en contrôle visuomoteur, dans la configuration la plus exigeante de réinitialisation des positions de départ. Des études d'ablation montrent que les étapes de fine-tuning apportent un gain de performance moyen de 89%. Le système a également été testé en conditions réelles, avec des améliorations significatives rapportées après affinage. Vidéos et résultats complémentaires sont disponibles sur le site du projet. La manipulation longue durée reste l'un des obstacles majeurs en robotique manipulative: enchaîner plusieurs sous-tâches sans dérive d'erreur cumulative est difficile pour l'imitation pure, tandis que le renforcement seul peine à converger sur des horizons longs sans démonstration initiale. En combinant les deux, ReinforceGen s'inscrit dans un mouvement plus large cherchant à réduire la dépendance aux données humaines coûteuses (ici seulement 10 démonstrations) tout en conservant une robustesse comparable à des méthodes plus gourmandes. Le passage réussi vers des évaluations réelles, au-delà de la simulation, est le point le plus significatif pour les acteurs industriels: il suggère que l'écart simulation-réel, souvent le talon d'Achille des politiques visuomotrices, peut être réduit par cette architecture hybride plutôt que par du pur scaling de données. Le papier, publié sur arXiv (version révisée, v2), s'appuie sur le benchmark Robosuite, référence standard pour comparer les politiques de manipulation robotique en simulation. Le score de 80% est annoncé dans le réglage le plus difficile testé, un détail à garder en tête: les performances dans des configurations moins contraignantes ne sont pas précisées dans le résumé. Aucun acteur commercial ni institution n'est nommé dans l'abstract, ce travail relevant pour l'instant de la recherche académique plutôt que d'un produit destiné à un déploiement industriel immédiat.

RecherchePaper
1 source
Apprentissage robotique par démonstration : trajectoires d'alphabet manuscrit et évaluation de la ressemblance humaine
3arXiv cs.RO 

Apprentissage robotique par démonstration : trajectoires d'alphabet manuscrit et évaluation de la ressemblance humaine

Le Fil Robotique 21/10/25, dataset de démonstrations manuscrites (data.researchgate ou arXiv). Cadre LfD (Learning from Demonstration) pas de déploiement produit. Une équipe de recherche présente un nouveau cadre d'apprentissage par démonstration (Learning from Demonstration, LfD) destiné à produire des trajectoires robotiques perçues comme humaines. Le dataset comprend 3 142 démonstrations d'écriture manuscrite collectées auprès de 22 participants, couvrant les 52 combinaisons majuscules/minuscules de l'alphabet latin, via une interface de téléopération tactile capturant position dans le plan, force de contact et timing. La méthode s'appuie sur les modèles de mélange gaussien (GMM) et la régression associée (GMR), une approche classique en LfD, mais l'étend en intégrant des dimensions de force et de temps normalisé, et en l'adaptant aux trajectoires multi-segments non continues, comme celles nécessaires pour tracer un « i » avec son point ou un « t » avec sa barre. Une étude perceptuelle menée auprès de 21 participants a évalué le caractère humain des trajectoires générées sur une échelle continue de 0 à 100, où 50 marque le point neutre entre mouvement robotique et mouvement humain. Le score moyen obtenu est de 71,50, avec un écart type élevé de 22,56, signe d'une perception assez dispersée selon les évaluateurs. Ce travail s'attaque à une limite connue du LfD classique : la plupart des méthodes GMM/GMR gèrent mal les gestes discontinus, alors que la majorité des tâches manuelles réelles (écriture, assemblage, gestes chirurgicaux) combinent plusieurs segments distincts. Réduire la dépendance à la programmation explicite pour transmettre un geste à un robot est un enjeu direct pour la téléopération et les cobots amenés à collaborer avec des humains, où la naturalité du mouvement conditionne la confiance perçue. Le score de 71,5 reste toutefois une mesure subjective issue d'un panel restreint de 21 personnes et non d'un test sur robot physique embarqué : il faut le lire comme un indicateur de perception préliminaire plutôt que comme une validation opérationnelle. L'écriture manuscrite est choisie comme banc d'essai car elle combine complexité géométrique, modulation de force (pression du stylet) et segmentation naturelle des tracés, ce qui en fait un proxy pertinent pour des tâches de transfert de compétences motrices plus larges. Le dataset et le code sont publiés en open source, offrant un benchmark reproductible pour la communauté LfD, actuellement dominée par des approches alternatives comme les primitives de mouvement dynamiques (DMP) ou, plus récemment, les modèles d'imitation à grande échelle de type VLA. Les prochaines étapes attendues incluent des tests sur bras robotiques physiques et des comparaisons avec ces méthodes plus récentes.

RecherchePaper
1 source
MinInter : minimiser l'interpolation de trajectoire lors de l'augmentation de données pour l'apprentissage par imitation
4arXiv cs.RO 

MinInter : minimiser l'interpolation de trajectoire lors de l'augmentation de données pour l'apprentissage par imitation

Une équipe de chercheurs a publié en juin 2026 sur arXiv (arXiv:2606.24078) une méthode baptisée MinInter (Minimizing Interpolation), destinée à améliorer la qualité des données synthétiques générées lors de l'apprentissage par imitation pour la manipulation robotique. Le principe est ciblé : lorsqu'un pipeline d'augmentation de données recompose des démonstrations d'experts à partir de configurations initiales variées, il doit typiquement intercaler des segments d'interpolation entre les morceaux de trajectoire, segments qui ne correspondent à aucun comportement expert et dégradent la qualité des données générées. MinInter résout ce problème en sélectionnant, pour chaque configuration initiale échantillonnée, la démonstration source qui nécessite le moins d'interpolation pour former une trajectoire complète. Sur le benchmark MimicGen, la méthode a été évaluée sur 12 tâches de manipulation couvrant 26 variantes, et améliore systématiquement à la fois les taux de succès de génération de données et les taux de succès des politiques apprises, avec les gains les plus importants sur les tâches dites contact-rich (en contact physique intensif), long-horizon (longues séquences d'actions) et high-variance (configurations initiales très dispersées). L'intérêt principal de MinInter réside dans sa capacité à améliorer la qualité des données sans modifier l'architecture du pipeline d'augmentation existant : la méthode est compatible avec les frameworks actuels et agit uniquement sur la stratégie de sélection de trajectoire. C'est un levier pratique pour les laboratoires qui cherchent à réduire le coût humain de la collecte de démonstrations tout en maintenant la qualité des politiques apprises. Les résultats sur les tâches contact-rich sont particulièrement notables, car ce type de tâche est historiquement difficile à traiter par augmentation synthétique, les dynamiques de contact étant sensibles aux discontinuités introduites par les segments d'interpolation. La surperformance face à SkillGen, un framework récent et plus complexe, questionne l'utilité d'approches sophistiquées quand une heuristique de sélection bien ciblée suffit. Le contexte est celui de la montée en puissance de l'apprentissage par imitation (IL) comme alternative au reinforcement learning pour la robotique de manipulation, notamment avec des méthodes comme BC (Behavioral Cloning), ACT ou Diffusion Policy. MimicGen, le benchmark utilisé, est devenu une référence du domaine pour comparer les méthodes d'augmentation de trajectoire. MinInter s'inscrit dans la même lignée que SkillGen (2024), mais avec une philosophie de minimalisme algorithmique. La prochaine étape logique serait de valider ces gains sur du matériel réel, où les dynamiques de contact et la variabilité du monde physique dépassent largement ce que les simulateurs capturent, et où le sim-to-real gap reste la principale incertitude non résolue.

UELes laboratoires européens travaillant sur l'apprentissage par imitation (INRIA, CEA-List, universités techniques) peuvent intégrer directement MinInter dans leurs pipelines d'augmentation MimicGen sans modifier leur architecture existante.

RecherchePaper
1 source