Aller au contenu principal
RecherchearXiv cs.RO 

Voir à travers le cadre décalé : distillation de bruit privilégié pour l'assemblage de précision vision-force

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.07745) une méthode d'assemblage de précision par vision et force, centrée sur un problème précis : l'erreur de pose ne fausse pas seulement ce que le robot observe, elle déplace aussi le repère dans lequel il agit. Sur le benchmark FORGE, la politique officielle fondée sur l'état réussit 97 à 99 % des épisodes avec la pose exacte. Elle tombe à 32-60 % avec le bruit de pose du benchmark (σ = 5 mm). La même pose estimée alimente l'observation et ancre le repère d'action. Avant le contact, le décalage est donc impossible à identifier à partir de la seule proprioception. Les auteurs injectent cette information manquante pendant l'entraînement, de deux façons. Un professeur privilégié voit le décalage en simulation. Sinon, des démonstrations propres sont réétiquetées dans le repère déplacé, en forme fermée. L'élève, entraîné par clonage comportemental puis un tour de DAgger, ne reçoit au test que l'état bruité, une fenêtre brute de couple-force et deux caméras RGB.

Les résultats sont nets, mais ils restent ceux d'un papier académique. Sur les tâches FORGE non modifiées, l'élève issu du professeur garde 92 à 99 % de réussite pour σ de 0 à 5 mm. Six références sans information privilégiée chutent à 2-80 %. Une expérience contrôlée isole la cause, avec la même architecture, le même budget de données et la même procédure. Les démonstrations générées sans accès au décalage donnent 31,5 % à σ = 5 mm. Les démonstrations privilégiées atteignent 88,7 % et les démonstrations réétiquetées 95,8 %. En déploiement zéro-shot sur un Franka, l'élève obtient 83,3 % de réussite agrégée à 5 mm, contre 34,4 % pour la meilleure politique fondée sur l'état. Le test réel ne porte que sur un seul bras, et le papier ne détaille pas le nombre d'essais dans l'extrait disponible.

Pour les intégrateurs, le message est que de meilleurs capteurs ne suffisent pas. Ajouter vision et force à une politique ne règle pas le problème si la supervision n'encode pas la compensation du décalage latent. Cela touche directement les cellules d'insertion, de connecteurs ou de vissage, où l'incertitude de calibration et de perception est la norme. Le résultat suggère aussi que la distillation de bruit privilégié, ou le réétiquetage en forme fermée quand c'est possible, peut réduire l'écart simulation-réel. Il reste à voir si cela tient sur des pièces et des tolérances industrielles variées.

Le travail s'appuie sur FORGE, un benchmark d'assemblage de précision en simulation, et sur la tradition du professeur privilégié suivi d'un élève déployable, déjà courante en locomotion et en manipulation. Il se distingue des grands modèles vision-langage-action généralistes (Pi-0, GR00T), qui visent la généralité plutôt que la précision sub-millimétrique. Une page projet est disponible, mais aucun déploiement commercial n'est annoncé. Les prochaines étapes probables sont des tests sur d'autres bras et d'autres tâches, puis une intégration dans des politiques plus générales.

À lire aussi

Estimation du décalage par force pour l'assemblage de pièces clavetées en trou grâce à la régression par processus gaussien local
1arXiv cs.RO 

Estimation du décalage par force pour l'assemblage de pièces clavetées en trou grâce à la régression par processus gaussien local

Une équipe de recherche présente, dans une prépublication arXiv (2608.17691v1), une méthode d'estimation de désalignement basée sur la force pour l'assemblage de type clé-rainure (keyed peg-in-hole), une opération de précision très sensible aux erreurs de préhension. Le système repose sur un pipeline en trois étapes, perception, validation, insertion, et estime le désalignement résiduel directement à partir des mesures de force et de couple au poignet du bras robotique, sans capteur de vision haute précision dédié à l'insertion. Un régresseur hybride combinant recherche des plus proches voisins (KNN) et processus gaussien local traite ces signaux, en distinguant deux régimes de contact, collision dure et insertion guidée par chanfrein, chacun orienté vers un modèle dédié grâce à un seuil de durée de fenêtre de contact. La précision du régresseur est renforcée en combinant le KNN à une recherche déterministe s'appuyant sur les résultats d'une validation visuelle monoculaire post-préhension, dans une application de pick-and-place fondée sur la détection de points clés. Testée sur le capteur force/couple intégré d'un bras collaboratif, la méthode a fait passer le taux de réussite de l'insertion de 67 % à 87 %. Cette approche s'attaque à un problème classique et coûteux en robotique industrielle: l'assemblage par insertion de pièces clavetées ou chanfrenées exige une tolérance géométrique très serrée, difficile à garantir avec des cobots équipés de capteurs standards plutôt que de systèmes de vision 3D ou de gabarits mécaniques onéreux. En exploitant uniquement les données de force/couple déjà présentes sur de nombreux bras collaboratifs du marché, la méthode ouvre la voie à des solutions d'assemblage flexible moins dépendantes d'un outillage spécialisé, un enjeu direct pour les intégrateurs en électronique, automobile ou petite série industrielle où les connecteurs et pièces clavetées sont fréquents. Le gain de 20 points de réussite illustre aussi une tendance plus large: l'usage de modèles d'apprentissage statistique légers (GP, KNN) pour compenser l'incertitude de perception plutôt que de chercher une précision mécanique absolue en amont. Ce travail s'inscrit dans la recherche continue sur la manipulation robotique riche en contact, où la fusion de signaux de force et de vision reste un axe actif face aux approches purement visuelles ou par apprentissage par renforcement, plus gourmandes en données. L'article ne mentionne ni partenaire industriel ni déploiement commercial: il s'agit d'un résultat expérimental en laboratoire, sur un seul type de bras collaboratif, dont la généralisation à d'autres géométries de pièces ou d'autres capteurs reste à démontrer dans de futurs travaux.

RecherchePaper
1 source
REBOOT : de l'échec à la récupération, un jeu de données et un benchmark pour l'assemblage de précision
2arXiv cs.RO 

REBOOT : de l'échec à la récupération, un jeu de données et un benchmark pour l'assemblage de précision

Une équipe de recherche a mis en ligne fin septembre 2026 sur arXiv (2609.22591) REBOOT, pour Recovery Episode Benchmark for Off-nominal Trajectories, un jeu de données et un benchmark de manipulation robotique construit autour de l'échec comme signal d'apprentissage à part entière. L'ensemble comprend 2 160 démonstrations réparties sur 18 tâches d'assemblage de précision, chacune découpée en cinq phases communes : alignement en prise, engagement en prise, transport, alignement en dépôt et engagement en dépôt, ce qui permet une évaluation phase par phase plutôt qu'un simple résultat final binaire. Des échecs sont introduits à chaque phase puis appariés à des trajectoires de récupération réalisées par des experts, qui ramènent le système vers un état permettant de poursuivre la tâche. Chaque tâche est annotée en symétrie rotationnelle, précision d'engagement et direction d'assemblage via des paires installation-retrait, avec des flux RGB-D synchronisés sur quatre points de vue et des descriptions en langage naturel par phase. La moitié des démonstrations est experte, l'autre reproduit des échecs observés lors de déploiements réels de politiques entraînées par imitation. Trois architectures ont été testées : un transformeur à chunks d'actions, un modèle de diffusion et π0-FAST. Les jeux d'entraînement robotique actuels contiennent presque exclusivement des démonstrations réussies, et les benchmarks existants réduisent la performance à un score binaire de succès ou d'échec, ce qui masque où et pourquoi une politique échoue réellement. En mesurant des taux de complétion par phase, REBOOT révèle des points de défaillance propres à chaque architecture, invisibles en évaluation binaire classique. Pour les intégrateurs et laboratoires qui déploient des politiques vision-language-action sur des tâches d'assemblage industriel, cela offre un diagnostic localisé, permettant d'identifier si l'échec survient à l'alignement, à l'engagement ou pendant le transport de la pièce, et fournit une base pour entraîner explicitement la capacité de récupération après erreur, une condition nécessaire à l'assemblage de précision en environnement réel non contrôlé. Le benchmark s'inscrit dans l'essor des politiques vision-language-action génériques telles que π0, GR00T N2 ou Helix, dont la promesse se heurte encore à l'écart entre démonstrations en laboratoire et fiabilité sur des tolérances millimétriques. Contrairement aux jeux de référence existants comme Open X-Embodiment ou DROID, centrés sur le volume de démonstrations réussies, REBOOT se présente comme le premier construit explicitement autour de l'échec et de sa récupération. Le jeu de données et le code associés sont publiés en accès libre (nanayawoa.github.io/REBOOT). Il s'agit d'une contribution de recherche en prépublication, sans déploiement industriel annoncé à ce stade ; son adoption par les laboratoires et fournisseurs de piles VLA reste à observer dans les prochains mois.

RecherchePaper
1 source
Distillation de fonctions de barrière de contrôle privilégiées en filtres de sécurité RGB seul pour la navigation visuelle dynamique
3arXiv cs.RO 

Distillation de fonctions de barrière de contrôle privilégiées en filtres de sécurité RGB seul pour la navigation visuelle dynamique

Des chercheurs proposent une méthode pour doter les politiques de navigation visuelle « RGB seul » d'une couche de sécurité embarquée, sans reconstruction 3D ni rendu en ligne. Le travail, publié sur arXiv (2609.36520) avec une page projet, repose sur une distillation enseignant-élève. L'enseignant est une Control Barrier Function (CBF), un filtre mathématique qui corrige une commande jugée dangereuse pour maintenir le robot dans un ensemble sûr. Il exploite des états « privilégiés » (position du robot et des obstacles réels) dans un environnement dynamique real-to-sim en Gaussian Splatting. L'élève, un filtre de sécurité, reçoit un court historique d'images RGB, la vitesse du robot et l'action nominale de la politique de navigation, et renvoie directement une action sûre. Au déploiement, seuls l'image et la vitesse sont nécessaires. Aucun chiffre de latence, de taux de collision ou de plateforme matérielle n'apparaît dans le résumé. Pour réduire l'écart d'information entre enseignant et élève, l'enseignant ne construit ses contraintes qu'à partir des obstacles visibles dans l'historique d'images de l'élève. Il intègre aussi une incertitude sur la vitesse des obstacles, pour tolérer des mouvements variés. Enfin, une augmentation d'actions expose l'élève à des commandes nominales sûres et dangereuses, afin qu'il apprenne mieux la frontière de sécurité. Les auteurs affirment surpasser les CBF visuelles de référence et améliorer la sécurité de politiques de navigation RGB sous obstacles mobiles, mais les gains chiffrés et les baselines exactes ne sont pas précisés dans le texte disponible. L'enjeu est pratique pour les intégrateurs : les politiques de navigation de bout en bout entraînées en imitation ou par apprentissage par renforcement restent fragiles face à des piétons ou à d'autres véhicules, et les approches CBF visuelles existantes exigent du rendu en temps réel ou une reconstruction de scène, coûteux pour un calcul embarqué. Déplacer ce coût vers l'entraînement rend un filtre de sécurité plausible sur des robots mobiles à capteurs limités. Il faut toutefois rester prudent : le résultat est académique, les évaluations décrites relèvent probablement en partie de la simulation, et une distillation ne fournit pas les garanties formelles d'une CBF exacte. La question de la certification reste donc ouverte pour un usage industriel. Ce travail s'inscrit dans deux tendances : la montée des modèles de navigation RGB de bout en bout, plus légers en capteurs que le LiDAR, et l'usage du Gaussian Splatting comme pont entre données réelles et simulation pour l'entraînement de politiques robotiques. Les filtres de sécurité par CBF, souvent comparés aux approches de type shielding, servent déjà de couche de protection au-dessus de contrôleurs appris. La suite logique serait une validation sur robot réel, des mesures de latence embarquée et des tests dans des scènes plus denses. Aucun partenaire industriel, pilote ou calendrier n'est annoncé.

RecherchePaper
1 source
Robots à double bras : des gains de performance en assemblage de précision
4arXiv cs.RO 

Robots à double bras : des gains de performance en assemblage de précision

Assemblage de précision (tight assembly) par une paire de bras robotiques coordonnés : des chercheurs proposent un nouveau framework de bout en bout permettant à deux bras robotiques d'exécuter conjointement une opération d'assemblage, à partir des modèles CAO des pièces et de leur positionnement relatif visé une fois assemblées. Publié sur arXiv (2607.17876v1), le travail a été validé à la fois en simulation et sur des robots physiques réels. Les auteurs montrent que la coordination de deux bras réduit le temps d'exécution moyen de plus de 50% par rapport à un système à un seul bras, tout en produisant des trajectoires de meilleure qualité et en accélérant la recherche de positionnements valides pour les robots. La méthode fournit également des garanties théoriques sur le temps d'exécution et la précision des trajectoires, appuyées par des résultats empiriques, ainsi que des bornes sur les dimensions minimales requises pour la cellule robotique. Le code est publié en open source, accompagné de démonstrations vidéo sur la page du projet. Pour les intégrateurs industriels et les concepteurs de lignes d'assemblage, ce résultat interroge une hypothèse répandue : qu'un seul bras robotique, correctement programmé, suffit pour la plupart des tâches d'assemblage serré, la coordination bi-bras étant réservée à des cas de niche jugés trop complexes à orchestrer. En démontrant un gain de temps de cycle supérieur à 50% assorti de garanties théoriques, et pas seulement de chiffres de démonstration, les auteurs apportent une preuve quantifiée que l'investissement dans une cellule à deux bras peut se justifier économiquement pour des opérations de précision, en particulier quand l'espace disponible est contraint : les bornes dimensionnelles calculées permettent justement de dimensionner la cellule au plus juste. C'est aussi un signal pour la recherche en planification de mouvement multi-bras, un domaine où peu de méthodes offrent des garanties formelles plutôt que de simples heuristiques validées empiriquement. La coordination de deux bras robotiques pour des tâches d'assemblage est étudiée depuis plusieurs années, portée notamment par des plateformes industrielles bi-bras comme l'ABB YuMi, mais la littérature manquait encore d'une méthode end-to-end couvrant à la fois la planification à partir de CAO, l'optimisation du placement des robots et des garanties de performance chiffrées. Ce travail se positionne comme une contribution académique ouverte, l'équipe ayant publié à la fois le code source et des démonstrations vidéo sur robots réels, ce qui distingue la publication d'une simple étude en simulation. Aucun partenaire industriel ni déploiement pilote n'est mentionné à ce stade ; la suite logique, comme souvent pour ce type de publication arXiv, sera de voir si la méthode est reprise ou testée par des équipes tierces sur d'autres géométries de pièces et d'autres configurations de cellules robotiques.

RecherchePaper
1 source