Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage du ciblage de préhension à partir de nuages de points pour le dégagement de piles de grumes avec une grue hydraulique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (2610.07613) une politique apprise qui choisit où placer et orienter le grappin d'une grue forestière hydraulique, montée sur remorque, pour vider des piles de grumes dans une cour de scierie. Ces piles comptent des centaines de billes en contact, et chaque prélèvement modifie la pile vue par la prise suivante. Le réseau prend en entrée des nuages de points bruts, non segmentés. Il classe le point observé où saisir, puis prédit la profondeur et l'orientation du grappin en ce point. Les mêmes sorties servent à l'imitation (BC), à l'apprentissage par renforcement (RL) et au déploiement. La BC apprend de démonstrations réussies prises au sommet de la pile. Le RL affine la politique clonée (BC→RL) ou s'entraîne de zéro. En simulation, la BC vide 98 piles sur 100, chacune de 200 billes.

Sur la grue réelle, douze essais comparent une heuristique géométrique, le RL depuis zéro, la BC et la BC→RL, sur des cycles complets de saisie, transport et dépôt. La BC et la BC→RL déposent 93,8 % et 88,9 % de l'inventaire cumulé, contre 80,4 % pour l'heuristique. La BC→RL dépose des billes dans 83,6 % de ses cycles, contre 79,6 % pour l'heuristique et 65,7 % pour la BC. Le gain de stabilité de charge observé en simulation avec la BC→RL ne se retrouve pas sur le banc d'essai. Les politiques ont été entraînées entièrement en simulation et exécutées sans adaptation sur la grue.

Le résultat est intéressant parce qu'il touche un cas de manipulation lourde, en contact dense, sur un engin hydraulique, loin des bras électriques de laboratoire. Un transfert simulation-réel sans recalage est démontré sur une tâche où chaque prise déforme la scène suivante. Les politiques apprises dépassent une heuristique dont les nuages avaient été filtrés à la main, alors qu'elles reçoivent des nuages bruts contenant encore les rails et poteaux du rack de stockage. Il faut toutefois lire les chiffres avec prudence. Douze essais sur un seul banc de test donnent peu de puissance statistique. Les gains restent modestes, d'environ 8 à 13 points d'inventaire déposé. Le gain de stabilité obtenu par RL en simulation ne se transfère pas, ce qui montre que l'écart simulation-réel persiste sur la dynamique de charge. Le résumé ne donne pas de temps de cycle, de payload ni de débit en tonnes par heure, des données que demanderait un exploitant.

Ce travail s'inscrit dans l'automatisation des machines forestières et de manutention de bois, où la téléopération et l'assistance au conducteur dominent encore. Le schéma est classique : une imitation de démonstrations expertes, puis un affinage par RL en simulation, déjà courant en manipulation robotique. Le résumé ne cite aucun acteur industriel, aucun pilote ni aucune échéance. Les suites logiques seraient des essais sur grue de scierie en exploitation, sur davantage de configurations de piles, et une mesure des cadences réelles face à un opérateur humain.

À lire aussi

Apprentissage de la préhension dextérique à partir d'une taxonomie clairsemée
1arXiv cs.RO 

Apprentissage de la préhension dextérique à partir d'une taxonomie clairsemée

Une équipe de recherche a présenté GRIT, un système de manipulation dextre en deux étapes conçu pour piloter des mains robotiques multi-doigts sans exiger de plan de préhension dense pour chaque objet et chaque tâche. Concrètement, GRIT prédit d'abord une spécification de prise à partir d'une taxonomie de préhension (un ensemble limité de catégories de prises, comme on en trouve en robotique manipulatoire depuis des taxonomies classiques à une vingtaine d'entrées), en s'appuyant sur la scène observée et le contexte de la tâche. Une politique de contrôle continue génère ensuite les mouvements des doigts nécessaires pour exécuter la tâche tout en respectant la structure de prise choisie. Selon les auteurs, cette approche atteint un taux de réussite global de 87,9 % et généralise mieux à des objets jamais vus que les méthodes de référence, avec des expérimentations validées en conditions réelles (real-world experiments) et non uniquement en simulation. Le papier, republié sur arXiv en tant que version corrigée (v2), ne précise pas la plateforme matérielle exacte ni le nombre de degrés de liberté de la main utilisée dans le résumé disponible. L'intérêt de ce travail dépasse la simple métrique de succès : il s'attaque à un vrai dilemme d'ingénierie pour les intégrateurs de mains robotiques dextres. D'un côté, spécifier des cibles de contact ou de pose détaillées pour chaque objet est impraticable à l'échelle industrielle. De l'autre, l'apprentissage par renforcement de bout en bout, guidé uniquement par une récompense de tâche, produit des comportements peu contrôlables, difficiles à corriger quand un échec survient sur une chaîne de production ou en logistique. En montrant qu'une guidance taxonomique éparse suffit à préserver à la fois généralisation et contrôlabilité, GRIT offre une piste concrète pour des systèmes où un opérateur pourrait ajuster la stratégie de prise via une sélection de haut niveau, plutôt que de reprogrammer une trajectoire complète. Cette recherche s'inscrit dans un courant plus large de travaux sur la manipulation dextre qui cherchent un compromis entre commande explicite et apprentissage bout-en-bout, un axe également exploré par des laboratoires travaillant sur les architectures VLA (vision-language-action) pour la robotique généraliste. Le texte ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial : il s'agit à ce stade d'un résultat académique, dont la prochaine étape logique serait un portage sur des plateformes de préhension dextre plus largement utilisées en laboratoire ou en intégration industrielle.

RecherchePaper
1 source
Vider les bacs jusqu'au bout : une approche hybride hiérarchique à auto-apprentissage des points de préhension pour le bin-picking industriel
2arXiv cs.RO 

Vider les bacs jusqu'au bout : une approche hybride hiérarchique à auto-apprentissage des points de préhension pour le bin-picking industriel

Des chercheurs décrivent, dans un article arXiv (2608.28175v1), une méthode hybride hiérarchique a quatre niveaux pour le bin-picking industriel, visant le vidage complet d'un bac de pièces sans intervention humaine. Le système associe un pipeline model-based, qui sert de colonne vertébrale robuste, a un "exploration agent" model-free charge de résoudre les blocages quand les prises prédéfinies sont occultées ou que la perception échoue, et de découvrir de nouveaux points de préhension. Un module d'auto-apprentissage en ligne exploite le retour de course de la pince (gripper-stroke feedback) et des intervalles de Wilson score pour classer automatiquement les candidats de prise, sans réglage manuel préalable. Teste sur trois pièces automobiles, le système fait passer le taux de vidage complet du bac de 50,9% pour la baseline model-based seule a 100% sur l'ensemble des expériences, tout en surpassant une baseline purement model-free en taux de réussite de prise. Le problème cible est classique et couteux en usine: les méthodes model-based, précises, se bloquent des qu'une prise attendue est cachée ou mal perçue, et demandent un réglage manuel long des points de préhension a chaque nouvelle référence, tandis que les approches model-free, flexibles des la sortie de boite, manquent de la fiabilité et de la répétabilité exigées en production. En combinant les deux logiques plutôt qu'en les traitant séparément, comme le faisaient les travaux antérieurs, l'approche vise a réduire la commission manuelle et a atteindre un vidage total et répétable des bacs, une étape présentée comme significative vers une opération industrielle autonome. Pour les intégrateurs, le saut de 50,9% a 100% sur des pièces automobiles est notable, mais reste a confirmer sur un eventail plus large de géométries et de volumes, la validation actuelle se limitant a trois références de test. Le bin-picking demeure l'un des défis récurrents de la robotique industrielle, car il melange perception en environnement encombre, planification de prise et gestion de cas limites que les données d'entrainement ne couvrent jamais complètement; le secteur automobile, avec ses pièces métalliques variées et ses cadences élevées, en est un banc d'essai habituel. L'article, classe comme nouvelle publication arXiv, ne mentionne ni industriel partenaire ni calendrier de déploiement commercial: il s'agit a ce stade d'une contribution de recherche non revue par les pairs, positionnée face aux méthodes model-based et model-free existantes plutôt que face a des produits commerciaux nommes. Les suites logiques, non détaillées dans le résume, porteraient sur l'extension a davantage de types de pièces et sur des essais en conditions de production réelles.

RecherchePaper
1 source
Précision à grande vitesse : apprentissage par renforcement en ligne, économe en échantillons, pour piloter les pelles hydrauliques
3arXiv cs.RO 

Précision à grande vitesse : apprentissage par renforcement en ligne, économe en échantillons, pour piloter les pelles hydrauliques

Une équipe de recherche présente dans un article publié sur arXiv (référence 2609.31025, soumis fin septembre 2026) un système d'apprentissage par renforcement basé sur un modèle, entraîné en ligne et directement sur le matériel, pour contrôler une pelle hydraulique. Le framework apprend depuis zéro un modèle d'ensemble probabiliste de la dynamique de la machine, utilisé ensuite pour du contrôle prédictif par échantillonnage (sampling-based MPC). Une fonction de récompense originale, dite « précision-gated contouring », conditionne la récompense de progression à la précision de la trajectoire, pour privilégier l'exactitude du geste plutôt que la vitesse pure. Sur un simulateur d'excavatrice construit à partir de données réelles, la méthode dépasse en efficacité d'échantillonnage les approches de référence testées. Surtout, les chercheurs valident l'approche directement sur une pelle hydraulique Menzi Muck M445 de 11,5 tonnes, sans aucune démonstration humaine ni pré-entraînement en simulation. Après seulement 20 minutes d'interaction réelle, le contrôleur atteint une précision de suivi comparable à celle de contrôleurs appris antérieurement sur 100 à 150 minutes de données. Après 40 minutes, l'erreur moyenne de trajectoire descend sous le centimètre, y compris à haute vitesse d'opération. Pour l'automatisation des engins de chantier et de terrassement, ce résultat s'attaque frontalement au principal frein de l'apprentissage par renforcement sur machines lourdes : le coût et le risque d'interagir avec du matériel réel aux dynamiques d'actionnement hydraulique fortement non linéaires. Diviser par trois à sept le temps d'apprentissage nécessaire pour égaler des performances déjà connues, sans passer par du sim-to-real ni de la téléopération enregistrée, rend l'apprentissage embarqué sur chantier nettement plus praticable pour les intégrateurs de robotique de construction, de mines ou d'agriculture lourde. Le travail s'inscrit dans une lignée de recherches sur l'autonomie des pelles hydrauliques, un terrain d'essai classique pour la robotique de terrain en raison de la complexité de ses vérins et de ses temps de réponse. Il reste, à ce stade, un résultat de recherche publié en preprint arXiv, non encore évalué par les pairs, testé sur une seule machine et un jeu de tâches de suivi de trajectoire : la généralisation à d'autres opérations de creusement ou d'autres modèles d'engins n'est pas démontrée dans cette publication.

UELa validation a été réalisée sur une pelle Menzi Muck, fabricant suisse reconnu dans la robotique de chantier, mais aucune entreprise ou institution française n'est impliquée dans ces travaux.

RecherchePaper
1 source
Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde
4arXiv cs.RO 

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde

Des chercheurs publient sur arXiv (2610.03391) NAVA-WAM, un « world action model » (WAM) qui apprend une politique d'action directement à partir de vidéos sans annotation d'actions. Un WAM combine la prédiction de la dynamique visuelle future et celle des actions du robot. Jusqu'ici, ces modèles dépendaient de trajectoires robotiques annotées avec les actions, rares et coûteuses à collecter. NAVA-WAM s'entraîne en deux étapes. Le pré-entraînement porte sur des vidéos d'observation seule : une supervision par flow matching sur les transitions visuelles futures est propagée, via une attention jointe structurée par transitions, jusqu'à l'Action-DiT, le module de diffusion qui produit les actions. Celui-ci acquiert ainsi des « priors » d'action. La seconde étape affine l'Action-DiT sur des démonstrations étiquetées par un flow matching conjoint vidéo-action. Une attention asymétrique découple la branche visuelle du débruitage itératif des actions, ce qui permet une inférence rapide, limitée aux actions. Les auteurs affirment de meilleurs résultats que les approches antérieures, en distribution comme hors distribution, une bonne efficacité en nombre d'étiquettes d'action et une généralisation sur robot réel. Le résumé ne fournit ni score chiffré, ni liste de tâches, ni nom de plateforme robotique. L'enjeu est celui du goulot d'étranglement des données. Les modèles vision-langage-action (VLA) et leurs variantes à modèle de monde se heurtent au coût de la téléopération. Les vidéos humaines ou robotiques sans étiquettes, elles, existent en grande quantité. Les méthodes actuelles les exploitent par deux voies indirectes : pré-entraîner des représentations visuelles qu'il faut ensuite adapter au contrôle, ou inférer des « actions latentes » à ancrer ensuite sur des commandes robot. NAVA-WAM supprime ces intermédiaires, ce qui limiterait les pertes de transfert et la complexité d'un modèle d'action latente séparé. Si le résultat tient à grande échelle, le volume de données robotiques annotées nécessaires pour une nouvelle tâche ou un nouvel embodiment pourrait baisser. Un intégrateur pourrait alors réutiliser des vidéos de ses propres lignes. Prudence toutefois : il s'agit d'un preprint non évalué par des pairs. Les gains annoncés restent à confirmer par des benchmarks indépendants, avec des détails sur la quantité de vidéos et la diversité des tâches réelles testées. Ce travail s'inscrit dans la course aux WAM et aux politiques apprises de vidéo, face aux VLA entraînés sur démonstrations (Pi-0, GR00T) et aux approches par actions latentes. Les prochaines étapes à surveiller sont la publication du code et des poids, des évaluations sur des corpus vidéo plus larges, et une comparaison directe avec les modèles de fondation industriels. Les auteurs ne signalent aucun partenaire industriel ni déploiement.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source