Aller au contenu principal
RecherchearXiv cs.RO 

Complétion de scène 3D orientée planification : représentation couplée TUDF et occupation apprise à partir d'observations partielles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent, dans un préprint arXiv (2609.36543v1), un réseau de complétion de scène 3D conçu explicitement pour la planification de trajectoire, à partir d'observations LiDAR partielles. Le système prédit conjointement deux représentations : un champ de distance non signé tronqué (TUDF, Truncated Unsigned Distance Field), qui donne une géométrie continue, et une carte d'occupation par voxels. Un schéma d'apprentissage à couplage bidirectionnel les relie. Les caractéristiques TUDF apportent un guidage géométrique dense pour reconstruire l'occupation. En retour, les caractéristiques d'occupation imposent des contraintes structurelles qui affinent l'estimation du champ de distance. Le réseau sort directement l'occupation complète et le TUDF, et ce dernier s'intègre à la planification de trajectoire sans post-traitement. Les auteurs annoncent des gains à la fois en qualité de reconstruction géométrique et en performance de planification sur des environnements jamais vus à l'entraînement. Le résumé ne donne ni chiffres, ni jeux de données, ni comparaison chiffrée avec des méthodes existantes.

L'enjeu est d'abord de méthode. La plupart des travaux de complétion de scène se jugent sur la fidélité de la reconstruction (IoU, erreur géométrique), sans mesurer ce que la carte complétée change pour le robot. Ici, la complétion est évaluée sur son effet en aval, la planification. C'est l'angle qui compte pour un intégrateur de robots mobiles (AMR, véhicules autonomes, robots d'inspection) : en zone occultée, une grille d'occupation binaire dit peu sur la distance aux obstacles, alors que les planificateurs (optimisation de trajectoire, fonctions de coût de type ESDF) en ont besoin. Fournir cette information directement, sans étape de conversion, peut réduire la latence et les erreurs de chaîne. La généralisation à des environnements inédits est le bon test, mais un préprint sans chiffres publiés dans le résumé ne permet pas de savoir si les gains sont marginaux ou décisifs, ni s'ils tiennent hors simulation ou hors jeux de données académiques. Rien n'indique non plus de tests sur robot réel, de temps d'inférence embarqué ou de contraintes de calcul.

Ce travail s'inscrit dans la lignée des méthodes de complétion sémantique de scène et de prédiction d'occupation, issues de la conduite autonome, et des représentations par champs de distance (SDF, TSDF, ESDF), historiquement utilisées en cartographie et en planification. Il s'agit d'un préprint non évalué par des pairs, et aucune entreprise, aucun produit ni calendrier de déploiement n'est annoncé. La suite logique serait la publication du code et des benchmarks, une comparaison avec les approches d'occupation actuelles, puis une validation sur plateformes réelles. C'est à ces étapes que l'on pourra juger si le couplage TUDF-occupation apporte un vrai bénéfice à la navigation en environnement partiellement observé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

BiView-Touch : apprentissage de représentations tactiles bimanuelles par complétion croisée des mains
1arXiv cs.RO 

BiView-Touch : apprentissage de représentations tactiles bimanuelles par complétion croisée des mains

Des chercheurs présentent BiView-Touch dans un article arXiv (2609.23352v1, catégorie "cross"), publié en soumission anonyme pour relecture en double aveugle. Le cadre auto-supervisé reconstruit les latents masqués d'une main cible à partir des régions tactiles encore visibles de cette même main et de la main controlatérale synchronisée. Il repose sur un encodeur étudiant associé à un décodeur directionnel conditionné par la géométrie, qui prédit des cibles latentes complètes calculées par moyenne mobile exponentielle (EMA) sur un réseau enseignant. Des contrefactuels temporels et de disposition spatiale forcent le modèle à exploiter une information controlatérale réellement alignée dans le temps et organisée anatomiquement, et non un simple bénéfice de l'entrée bilatérale brute. Évalué sur le jeu de données public HumanTouch, BiView-Touch dépasse des méthodes auto-supervisées de référence en régime de faible annotation: avec seulement 5% des étiquettes disponibles pour l'entraînement en aval, les gains relatifs de précision équilibrée atteignent 7,1% pour la reconnaissance du mouvement bimanuel du poignet et 14,1% pour la reconnaissance de phase d'interaction dérivée des forces mesurées. Les auteurs publient aussi BVT-20, un nouveau jeu de données tactile bilatéral couvrant 20 tâches, et montrent un transfert des représentations entre sessions d'enregistrement et corpus de pré-entraînement, y compris vers une tâche bimanuelle totalement absente de l'entraînement. L'intérêt pour la robotique tient au fait que la plupart des approches tactiles auto-supervisées traitent encore chaque main indépendamment, ou ne fusionnent les deux flux qu'au niveau de la prédiction finale, sans modéliser leur relation croisée. Montrer qu'une structure inter-mains explicite améliore la qualité des représentations, surtout avec très peu d'étiquettes, cible un vrai goulot d'étranglement: les données tactiles annotées avec vérité terrain force/contact restent coûteuses à produire. Le résultat intéresse directement les pipelines de téléopération, l'apprentissage par imitation pour la manipulation bimanuelle ou humanoïde, et les tâches d'assemblage sensibles à la force en industrie, où généraliser sans gros volumes annotés est un enjeu concret. Le travail s'inscrit dans la lignée des méthodes de prédiction de latents masqués avec schéma enseignant-étudiant EMA (type data2vec/JEPA), jusqu'ici surtout appliquées à la vision ou à une seule main, en les adaptant spécifiquement au tactile bimanuel. L'article ne nomme aucun concurrent industriel ni laboratoire, conformément à sa soumission anonyme; le code et les détails du jeu de données sont déjà accessibles sur une page projet anonyme, une publication complète étant probable après l'issue du processus de relecture.

RecherchePaper
1 source
Imagine-TAMP : planification des tâches et des mouvements guidée par l'imagination en observabilité partielle
2arXiv cs.RO 

Imagine-TAMP : planification des tâches et des mouvements guidée par l'imagination en observabilité partielle

Un cycle de planification robotique conçu pour décider quand observer et quand agir vient d'être détaillé dans un article arXiv publié le 18 septembre 2026 (arXiv:2609.20396v1), intitulé Imagine-TAMP: Imagination-Guided Task and Motion Planning in Partial Observability. Le système cible un problème concret des robots manipulateurs en environnement encombré : quand la position d'un objet cible est partiellement cachée, faut-il chercher un nouvel angle d'observation ou déplacer d'abord l'objet qui obstrue la vue. Imagine-TAMP combine deux mécanismes d'"imagination" : un modèle vision-langage qui met à jour une croyance probabiliste (particle belief) sur la position de la cible en s'appuyant sur des relations de bon sens avec les objets visibles, et un modèle génératif de scène qui estime la géométrie plausible des zones non observées. À partir de ces hypothèses, le système génère plusieurs squelettes de plan symboliques, leur attribue des coûts non uniformes reflétant à la fois l'effort de manipulation et la probabilité de révéler la cible, puis affine le squelette retenu en plan moteur exécuté, avec replanification si de nouvelles observations contredisent la croyance initiale. Dans des scènes d'étagère à points de vue contraints, l'évaluation géométrique non uniforme fait passer le taux de succès de 46,0% à 84,0% par rapport à une approche de référence, et l'ajout du modèle sémantique réduit encore les manipulations et replanifications inutiles. Sur un robot réel, le système complet réduit le temps de planification de 32% comparé à une version n'utilisant que la géométrie. L'enjeu dépasse la démonstration académique : la décision observer-versus-manipuler est un goulot d'étranglement classique pour les robots de logistique et de préparation de commandes travaillant dans des bacs ou étagères encombrés, où les approches TAMP classiques s'appuient sur des coûts symboliques grossiers ou une planification géométrique coûteuse, sans jamais estimer la probabilité qu'une observation révèle réellement la cible. En montrant qu'un modèle vision-langage peut injecter du bon sens dans cette décision avant d'engager un calcul moteur coûteux, les auteurs illustrent une tendance plus large où les VLM servent de couche de raisonnement pour la planification plutôt que de générateur direct d'actions, à la différence des approches VLA comme Pi-0 ou GR00T N2. Le travail s'inscrit dans la lignée du TAMP, qui combine planification symbolique et planification de mouvement continue, en cherchant à corriger sa faiblesse historique face à l'observabilité partielle. Il s'agit d'un preprint, sans validation par les pairs ni partenaire industriel identifié dans le résumé ; les auteurs ne précisent pas de calendrier de suite ni d'extension à d'autres classes de tâches.

RecherchePaper
1 source
Planification et contrôle de mouvement sensibles au risque sous dynamique inconnue avec observations hybrides
3arXiv cs.RO 

Planification et contrôle de mouvement sensibles au risque sous dynamique inconnue avec observations hybrides

Des chercheurs ont publié sur arXiv (arXiv:2609.23792v1, septembre 2026) un nouveau cadre de planification de mouvement et de commande robotique pour des systèmes à dynamique inconnue et observations d'état hybrides, c'est-à-dire des cas où le robot ne dispose de mesures d'état complètes que dans certaines zones de l'espace d'état, laissant des "régions aveugles" ailleurs. Le travail s'appuie sur un cadre hiérarchique existant qui combine identification de système, calcul d'atteignabilité prédite, recherche de graphe et synthèse de contrôleur, en modélisant la dynamique par des approximations affines locales sur un découpage polytopique de l'espace d'état. Pour traiter les zones aveugles, où l'identification et la rétroaction deviennent impossibles faute de mesures, les auteurs proposent de sélectionner une dynamique nominale et de précalculer une séquence de commande en boucle ouverte avant la perte d'observation. Comme la dynamique réelle peut s'écarter de ce modèle nominal, le robot risque de quitter un polytope aveugle par une facette non prévue ; ce risque de transition est quantifié puis intégré dans un système de transition stochastique, et le problème de planification de haut niveau est reformulé comme un plus court chemin stochastique dont la politique guide la synthèse finale du contrôleur. Une étude de cas illustre la méthode en montrant un robot rejoindre un état cible en arbitrant entre efficacité de trajet et risque de traversée des zones aveugles. L'apport concret vise les robots opérant dans des environnements où la perception est intermittente ou partielle, occlusions, angles morts de capteurs, zones hors portée de caméras ou de lidars, un scénario fréquent en robotique industrielle et de champ mais souvent ignoré par les méthodes de planification qui supposent une observabilité complète de l'état. En quantifiant explicitement le risque associé à la navigation sans retour capteur plutôt qu'en l'ignorant ou en l'interdisant, l'approche s'adresse aux intégrateurs devant certifier ou arbitrer des trajectoires en environnements partiellement instrumentés, un enjeu distinct de la course actuelle aux modèles vision-langage-action (VLA) appris de bout en bout, qui promettent la généralisation mais restent peu auditables sur le plan du risque. Ce travail prolonge une lignée de recherche en planification formelle sous incertitude qui allie identification de système et synthèse de contrôleurs garantis, plutôt que les approches par apprentissage bout en bout actuellement médiatisées en robotique humanoïde. Il reste à ce stade une contribution algorithmique validée par simulation via une étude de cas, sans précision sur une plateforme matérielle réelle ni déploiement en conditions industrielles ; les auteurs ne mentionnent pas d'étape suivante de validation sur robot physique, ce qui invite à considérer ces résultats comme une preuve de concept méthodologique plutôt qu'une solution prête à l'industrialisation.

RecherchePaper
1 source
SplatCtrl : couplage perception-action via représentations de scène gaussiennes et contrôle robotique réactif
4arXiv cs.RO 

SplatCtrl : couplage perception-action via représentations de scène gaussiennes et contrôle robotique réactif

Des chercheurs présentent SplatCtrl, un système qui combine reconstruction 3D en temps réel et contrôle réactif de bras robotique pour éviter les collisions dans des environnements inconnus et changeants. Le framework s'appuie sur le 3D Gaussian Splatting, une technique de représentation de scène par nuages de gaussiennes 3D, et introduit une méthode hybride de filtrage voxel combinée à une relocalisation dynamique des gaussiennes, permettant de reconstruire la scène à partir de flux RGB-D tout en s'adaptant aux changements de l'environnement en continu. Pour le contrôle, les auteurs dérivent des fonctions de distance signée continues directement depuis les gaussiennes isotropes, ce qui fournit des estimations de probabilité de collision stables et différentiables, faisant le pont entre les champs de distance classiques et les représentations implicites modernes. Ces métriques sont ensuite injectées dans des fonctions de barrière de contrôle (control barrier functions), aboutissant à un couplage perception-action unifié capable de générer des mouvements fluides en réaction aux changements de scène. Le système a été validé en simulation, sur un robot physique réel, et dans un espace de travail partagé humain-robot. L'intérêt pour l'industrie tient à la promesse centrale du papier: rendre les bras manipulateurs, aujourd'hui performants surtout en environnement structuré et statique, capables d'opérer en sécurité dans des contextes dynamiques et partagés avec des humains, sans reprogrammation manuelle des trajectoires. Si les résultats se confirment à plus grande échelle, cela toucherait directement les intégrateurs industriels et logistiques confrontés à des cellules de travail non figées, ainsi que les applications de cobotique où la coexistence humain-robot impose une réactivité aux obstacles imprévus. C'est aussi un signal supplémentaire que le 3D Gaussian Splatting, initialement pensé pour le rendu photoréaliste, s'impose progressivement comme brique de perception robotique. Le travail s'inscrit dans une lignée de recherches récentes cherchant à exploiter le 3D-GS pour la robotique, au-delà de son usage d'origine en vision par ordinateur et rendu de scènes. L'article ne précise pas d'affiliation industrielle ni de partenaire de déploiement identifié: il s'agit d'une contribution de recherche académique publiée sur arXiv, sans indication de commercialisation ni de calendrier de transfert vers un produit. Les prochaines étapes attendues concernent le passage à l'échelle sur des scènes plus complexes et des tests prolongés en conditions réelles d'usine ou d'entrepôt.

RecherchePaper
1 source