Aller au contenu principal
Maintenir en vie le Franka Emika Panda : une stack ROS 2 avec une interface de position fiable
RecherchearXiv cs.RO 

Maintenir en vie le Franka Emika Panda : une stack ROS 2 avec une interface de position fiable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2608.19740v1) une pile logicielle open-source qui restaure le support ROS 2 pour le bras collaboratif Franka Emika Panda et corrige un défaut connu de longue date de son interface de contrôle en position externe. L'analyse identifie l'origine des vibrations et des arrêts de protection qui affectaient jusqu'ici l'implémentation officielle : non pas une limite matérielle du robot, mais le calage temporel de la boucle de contrôle externe et la gigue d'échantillonnage. La solution combine trois éléments : une interface matérielle asynchrone qui découple la communication temps réel de la boucle de contrôle ROS 2, un mécanisme de mise à l'échelle du taux de commande pour les sources plus lentes, et une stratégie de génération de références en position produisant des commandes fluides et fiables. Les tests, menés sur deux plateformes Panda indépendantes, couvrent la planification de mouvement, le contrôle en compliance, la manipulation en position et la téléopération haptique, avec un suivi amélioré des références de vitesse et une réduction des artefacts de mouvement par rapport à la pile officielle. Le code et des vidéos de démonstration sont publiés sur sites.google.com/view/fer-ros2/.

Pour les laboratoires et intégrateurs qui utilisent le Panda comme plateforme de recherche en manipulation et en interaction humain-robot, cette contribution comble un manque d'infrastructure plutôt qu'elle n'annonce une percée spectaculaire : elle rend l'écosystème ROS 2 du robot de nouveau utilisable de manière fiable pour des applications combinant planification, perception et autonomie partagée. C'est un signal utile dans un secteur où la migration de ROS 1 vers ROS 2 a souvent laissé des interfaces matérielles instables ou mal maintenues, forçant certaines équipes à rester sur d'anciennes piles logicielles ou à développer des correctifs maison non partagés.

Le Panda, lancé par Franka Emika à partir de 2017, reste l'un des bras collaboratifs les plus utilisés dans la recherche académique en robotique malgré les turbulences financières traversées par l'entreprise, passée sous le giron de Franka Robotics après une insolvabilité en 2023. Ce travail s'inscrit dans l'effort plus large de la communauté robotique pour maintenir à jour les piles logicielles de plateformes de recherche largement déployées, sans lien annoncé avec un acteur commercial ni de calendrier de déploiement industriel : il s'agit d'une publication de recherche accompagnée de code ouvert, destinée à être reprise et validée par d'autres laboratoires.

Dans nos dossiers

À lire aussi

HIL-UMI : intégrer le post-entraînement supervisé par l'humain des modèles vision-langage-action à l'interface universelle de manipulation
1arXiv cs.RO 

HIL-UMI : intégrer le post-entraînement supervisé par l'humain des modèles vision-langage-action à l'interface universelle de manipulation

Des chercheurs présentent HIL-UMI, un framework de post-entraînement en boucle humaine pour les modèles vision-langage-action (VLA), décrit dans une prépublication arXiv (2609.20659). Contrairement aux méthodes interactives classiques qui exigent d'exécuter la politique sur un robot réel avec intervention humaine, HIL-UMI s'appuie sur l'Universal Manipulation Interface (UMI), un dispositif de démonstration portatif, sans robot. Pendant que l'humain manipule l'objet, le système interroge silencieusement la politique VLA en cours sur le même flux d'observations, sans exécuter ses prédictions. Un "Energy Score" compare la trajectoire humaine à l'inférence de la politique pour repérer les régions hors distribution et déclencher une collecte ciblée. En parallèle, un estimateur d'avantage basé sur la progression identifie les segments les plus utiles, qui alimentent ensuite un clonage comportemental conditionné par l'avantage, mêlant démonstrations de base et nouvelles données. Testé sur quatre tâches réelles de manipulation, longues ou de précision, HIL-UMI améliore systématiquement les résultats par rapport au simple fine-tuning supervisé (SFT), et bat HG-DAgger sur la tâche "Clean Up Table" avec un temps de collecte par image plus faible. L'enjeu est le goulot d'étranglement du post-entraînement des VLA: le SFT sur données statiques ne couvre pas les états rencontrés en déploiement réel, et les méthodes interactives comme HG-DAgger monopolisent robot et opérateur, ce qui freine leur passage à l'échelle. En découplant la collecte interactive du déploiement robotique, HIL-UMI laisse entrevoir une spécialisation de politiques génériques (type Pi-0, GR00T) réalisable hors ligne, avec un matériel de capture portable bien moins coûteux qu'une cellule robotique complète. Les résultats restent toutefois limités à quatre tâches de laboratoire, sans données de coûts ni de volumes, ce qui invite à la prudence avant d'y voir une preuve de scalabilité industrielle. Le travail s'inscrit dans la lignée d'UMI, outil déjà utilisé pour collecter des démonstrations sans robot, et répond aux limites connues du fine-tuning supervisé des grands VLA. Il se positionne explicitement face à HG-DAgger, référence de l'apprentissage interactif nécessitant un robot physique. Aucune affiliation industrielle ni calendrier de déploiement n'est précisé: il s'agit d'une publication de recherche, pas d'un produit ni d'un pilote annoncé, les suites logiques étant une validation sur davantage de tâches et de plateformes.

RechercheActu
1 source
EmboAlign : aligner la génération vidéo avec des contraintes de composition pour la manipulation en zero-shot
2arXiv cs.RO 

EmboAlign : aligner la génération vidéo avec des contraintes de composition pour la manipulation en zero-shot

EmboAlign, décrit dans une version révisée d'un article arXiv (2603.05757v2), est un framework de manipulation robotique zero-shot qui combine modèles génératifs vidéo (VGM) et modèles vision-langage (VLM) pour convertir une instruction textuelle en trajectoire robot exécutable, sans donnée d'entraînement spécifique à la tâche. À l'inférence, un VLM extrait des contraintes compositionnelles à partir de l'instruction ; elles servent d'abord à filtrer un lot de vidéos générées par le VGM pour ne garder que le rollout le plus physiquement plausible, puis à optimiser la trajectoire robot correspondante afin de corriger les erreurs de retargeting géométrique. Sur six tâches de manipulation exécutées sur robot réel exigeant une précision fine, les auteurs rapportent un gain de 43,3 points de pourcentage de taux de succès par rapport à la meilleure baseline testée, sans aucune donnée d'entraînement propre à la tâche. Ce résultat cible un problème connu du secteur : les modèles vidéo pré-entraînés sur des corpus internet produisent des séquences visuellement cohérentes mais souvent physiquement invraisemblables, et leur conversion en commandes robot par estimation de profondeur et suivi de points clés accumule des erreurs à chaque étape. En traitant le VLM comme un module de raisonnement spatial complémentaire, plutôt que comme un générateur d'actions entraîné de bout en bout, EmboAlign teste l'idée que des modèles génériques, jamais affinés sur des démonstrations robotiques, peuvent piloter une manipulation fine sans la collecte massive de données de téléopération qui alimente la plupart des piles VLA commerciales actuelles. Ce gain reste toutefois à relativiser tant que le niveau absolu de performance de la baseline et la diversité réelle du panel de tâches ne sont pas détaillés au-delà du résumé. Ce travail prolonge une ligne de recherche qui utilise la génération vidéo comme modèle du monde pour la planification robotique, longtemps freinée par l'écart entre vidéos plausibles et actions exécutables en toute sécurité. Il se positionne à contre-courant de la stratégie dominante de l'industrie, portée par des modèles vision-langage-action entraînés de bout en bout sur de vastes jeux de démonstrations téléopérées ou simulées, à l'image de Pi-0 de Physical Intelligence, de la série GR00T de NVIDIA ou de Helix de Figure AI, qui misent sur le volume de données plutôt que sur des contraintes ajoutées à l'inférence. L'article ne précise ni l'affiliation des auteurs ni de calendrier de déploiement industriel ; il s'agit à ce stade d'un résultat de recherche publié sur arXiv, validé en laboratoire sur un nombre restreint de tâches, sans pilote ni produit commercial annoncé.

RecherchePaper
1 source
Vers une interaction fiable plongeur-robot sous l'eau : conception des gestes, logique d'interaction et évaluation en conditions réelles
3arXiv cs.RO 

Vers une interaction fiable plongeur-robot sous l'eau : conception des gestes, logique d'interaction et évaluation en conditions réelles

Des chercheurs ont présenté sur arXiv (papier 2609.23392, mis en ligne le 22 septembre 2026) un système d'interaction homme-robot par gestes destiné aux plongeurs sous-marins. Le dispositif repose sur un vocabulaire compact de sept gestes, une reconnaissance légère fondée sur le suivi de points caractéristiques (landmarks) de la main, et une couche de logique d'interaction au niveau des commandes plutôt qu'au niveau de chaque image reconnue individuellement. L'équipe a validé son approche en deux temps : une étude utilisateur mesurant la capacité de plongeurs à reproduire les gestes après un bref apprentissage, puis des essais avec un robot sous-marin réel, menés à la fois dans un bassin de laboratoire et en piscine. Le résumé de l'article ne communique aucun chiffre précis de taux de reconnaissance, de nombre de participants ou de temps de cycle, ce qui limite l'évaluation quantitative de la performance annoncée et invite à la prudence sur l'ampleur réelle des gains. L'intérêt pour l'industrie robotique sous-marine tient moins à un chiffre qu'à une architecture : découpler la reconnaissance gestuelle brute, intrinsèquement bruitée sous l'eau à cause de la visibilité limitée et des poses intermédiaires ambiguës pendant la formation d'un geste, de la décision d'exécution du robot. En filtrant au niveau commande plutôt qu'image par image, le système réduit les déclenchements intempestifs et les interruptions prématurées de tâche, un problème classique des interfaces gestuelles embarquées. Pour les intégrateurs de robots d'inspection, d'AUV ou de ROV assistant des plongeurs sur des opérations offshore, scientifiques ou de maintenance, cela ouvre une voie pour remplacer ou compléter les signaux manuels traditionnels entre plongeurs par un canal de commande direct vers une machine, sans dépendre d'une liaison acoustique ou d'une tablette étanche. Le travail s'inscrit dans un champ de recherche encore jeune, l'interaction homme-robot sous-marine, où les approches concurrentes passent généralement par la communication acoustique, des interfaces tactiles étanches ou des marqueurs fiduciaires plutôt que par la gestuelle nue. Contrairement à une majorité d'études testées seulement en simulation ou en environnement contrôlé, celle-ci a été évaluée en conditions réelles, en bassin puis en piscine, ce qui la rapproche d'un cas d'usage opérationnel sans constituer pour autant un déploiement industriel : il s'agit d'un résultat de recherche académique, sans partenaire commercial ni calendrier de pilote annoncé à ce stade.

RecherchePaper
1 source
Robotique recompositionnelle : une modularité interdomaine, en ensemble ouvert et tout au long de la vie, au-delà de la morphologie
4arXiv cs.RO 

Robotique recompositionnelle : une modularité interdomaine, en ensemble ouvert et tout au long de la vie, au-delà de la morphologie

Des chercheurs proposent de déplacer l'objectif de la robotique modulaire : plutôt que de construire des robots dont la structure change, concevoir des robots dont les capacités fondamentales peuvent évoluer. Publié sur arXiv (2609.37734, première version), le papier définit la « robotique recompositionnelle », une adaptation sur un ensemble hétérogène de modules couvrant le matériel, le logiciel, le calcul et les comportements. Chaque composant y est abstrait par les interfaces qu'il requiert et qu'il fournit, ce qui permet de raisonner sur l'ensemble de manière holistique. Les auteurs introduisent deux mesures : l'« intégration span », qui désigne l'étendue des domaines reconfigurables (cinémato-dynamique, perception, calcul, comportements de coordination de haut niveau), et l'« intégration inertia », qui mesure la résistance à la reconfiguration. Le texte s'appuie sur deux systèmes déployés et sur des travaux de recherche en cours, sans chiffres de performance dans le résumé disponible. Il s'agit d'un cadre conceptuel et d'une liste de questions ouvertes, pas d'un produit ni d'une démonstration commerciale. L'argument vise une limite du champ. Les travaux récents sur les robots modulaires savent changer de morphologie en ligne, choisir la morphologie à adopter et propager ce choix jusqu'à la planification de mouvement et au contrôle. Selon les auteurs, l'inertie d'intégration y est donc faible côté structure, mais reste élevée dans les autres domaines. Un robot reconfigurable dans un seul domaine a une capacité de changement limitée par rapport à un robot reconfigurable sur plusieurs. Pour les intégrateurs et les responsables industriels, cela déplace la question : changer un préhenseur ou un bras suffit rarement si la perception, le logiciel de contrôle et la logique de mission doivent être réécrits à la main. Le papier suggère que la valeur pratique de la modularité dépend des interfaces standardisées entre couches, pas seulement de connecteurs mécaniques. Ce constat rejoint les difficultés bien connues du déploiement, où le coût d'intégration domine souvent celui du matériel. Il s'agit toutefois d'une thèse à valider : aucune preuve d'un gain mesurable n'apparaît dans le résumé. Ce travail prolonge deux décennies de recherche sur les robots modulaires auto-reconfigurables, qui ont surtout optimisé la forme et la locomotion. Il croise aussi des courants actuels, comme les modèles vision-langage-action (VLA) généralistes, qui déplacent la capacité vers le logiciel, et les architectures logicielles à composants du type ROS. Les auteurs ne désignent pas dans ce résumé d'entreprises concurrentes ni d'acteurs européens. La suite est celle d'un programme de recherche : formaliser les interfaces entre modules, définir des critères de comparaison via l'intégration span et l'intégration inertia, puis tester la recomposition en environnement ouvert et sur la durée de vie du robot, dimensions annoncées par le titre (inter-domaines, ensemble ouvert, apprentissage tout au long de la vie).

RecherchePaper
1 source