Aller au contenu principal
RecherchearXiv cs.RO 

Le titre semble déjà en anglais et technique (acronyme GASP). Traduction :

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent GASP (GPU-Accelerated Safe Planner), un planificateur temps réel de trajectoires dans l'espace articulaire, conscient des collisions, pour environnements connus. L'architecture combine une paramétrisation par B-spline clampée avec un réseau convolutif résiduel qui prédit les points de contrôle intérieurs, complétés par des points de contrôle aux limites insérés analytiquement pour respecter les contraintes de dérivée initiale et finale. Un autoencodeur variationnel conditionnel échantillonne plusieurs trajectoires candidates, décodées et validées en parallèle sur GPU, pour un temps d'inférence proche de la milliseconde. GASP atteint des taux de réussite comparables aux méthodes analytiques tout en réduisant nettement le temps de calcul face à l'optimisation de trajectoire classique sur GPU. Déployé comme planificateur de réinitialisation dans un pipeline d'apprentissage par renforcement appliqué au tennis de table robotique compétitif, il égale le taux de retour de balle de la méthode de référence tout en réduisant d'environ moitié les collisions survenues pendant l'entraînement.

Pour l'industrie robotique, l'enjeu est de lever un goulot d'étranglement classique : la planification de trajectoire évitant les collisions reste souvent trop lente pour un contrôle temps réel à haute fréquence, surtout pour des bras à plusieurs degrés de liberté couplés. En ramenant l'inférence à l'échelle de la milliseconde via l'échantillonnage parallèle sur GPU plutôt que la résolution d'une optimisation à chaque pas, GASP illustre une tendance de fond : remplacer l'optimisation itérative par des réseaux entraînés à en approximer la sortie. L'intérêt dépasse la vitesse : moins de collisions pendant l'entraînement réduit aussi le coût et la durée de l'apprentissage de politiques par renforcement.

Le domaine s'appuie historiquement sur des méthodes d'optimisation comme CHOMP ou TrajOpt, ou des planificateurs par échantillonnage type RRT, coûteux en calcul dès que la dimension du problème augmente ; les versions récentes accélérées par GPU réduisent ce coût sans l'éliminer, d'où la comparaison directe faite dans l'article. En s'appuyant sur un CVAE plutôt qu'un réseau de prédiction unique, GASP mise sur la diversité de candidats plutôt qu'une trajectoire unique, une stratégie proche de travaux récents de diffusion de trajectoires. Publié sur arXiv sans relecture par les pairs ni mention de code source ouvert ou de partenaire industriel, l'article ne donne aucun calendrier de transfert vers une plateforme robotique commerciale ; la validation reste circonscrite aux tests articulaires décrits et à la tâche de tennis de table présentée.

Dans nos dossiers

À lire aussi

Le titre traite d'un article de recherche technique, pas de robotique, je le traduis directement
1arXiv cs.RO 

Le titre traite d'un article de recherche technique, pas de robotique, je le traduis directement

Des chercheurs publient un nouveau cadre méthodologique pour évaluer la fiabilité des modèles de monde (World Models, WM) utilisés en robotique et en conduite autonome, dans un article arXiv (2607.07196) diffusé début juillet 2026. Le constat de départ : ces modèles génératifs, de plus en plus employés comme "oracles" pour tester des politiques d'action en simulant les conséquences de leurs décisions, rendent un verdict de succès ou de sécurité sans que leur propre fiabilité soit vérifiée. Les auteurs pointent une faille des métriques actuelles comme la Fréchet Video Distance (FVD), qui juge le réalisme visuel des vidéos générées mais ignore si le monde simulé réagit correctement aux actions testées, notamment celles absentes des données d'entraînement. Pour y remédier, ils proposent une "échelle d'admissibilité" en cinq niveaux (L0 à L4) que tout WM devrait franchir avant que ses verdicts en boucle fermée soient acceptés comme preuve d'assurance qualité. Le cadre, conçu pour être indépendant du type de robot, est testé sur deux modèles de monde dédiés à la conduite autonome. Le résultat le plus frappant : le modèle qui obtient le meilleur score en qualité visuelle de génération (niveau L0) se classe moins bien sur le suivi effectif des actions demandées (niveaux L1-L2). Autrement dit, la fidélité visuelle d'une simulation ne garantit pas sa robustesse à l'action, ce qui remet en cause l'usage de métriques purement esthétiques pour valider des systèmes destinés à juger des politiques de conduite ou de manipulation robotique en conditions réelles. Pour les industriels et intégrateurs qui misent sur les modèles génératifs pour accélérer les tests en sim-to-real, notamment dans le contexte des architectures VLA (vision-langage-action) où la simulation sert de banc d'essai avant déploiement physique, ce travail est un signal d'alerte méthodologique plutôt qu'une remise en cause technologique. L'approche s'appuie sur des pratiques éprouvées de la simulation critique pour la sécurité, comme la Vérification, Validation et Accréditation (VV&A), le cadre SOTIF (Safety of the Intended Functionality) et les normes de test par scénarios, déjà utilisées dans l'aéronautique et l'automobile. Les auteurs choisissent la conduite autonome comme premier terrain d'application car les méthodes d'assurance qualité pour la simulation classique y sont les plus matures, ouvrant la voie à une extension future vers d'autres domaines robotiques comme la manipulation ou l'humanoïde.

RecherchePaper
1 source
Système d'automatisation de titres modulaire pour la robotique en intérieur, basé sur un modèle vision-langage-action
2arXiv cs.RO 

Système d'automatisation de titres modulaire pour la robotique en intérieur, basé sur un modèle vision-langage-action

Une équipe de recherche présente un système modulaire conçu pour le CMU Vision-Language-Action (VLA) Challenge, une compétition universitaire visant à faire exécuter des instructions en langage naturel par un agent robotique autonome évoluant en intérieur. L'architecture repose sur deux pipelines parallèles. Le premier, dédié à la perception, construit en temps réel une carte voxel sémantique de l'environnement à partir de flux caméra, en s'appuyant sur des embeddings issus du modèle OwlViT. Le second traite le langage : il classifie les commandes utilisateur grâce à un modèle vision-langage (VLM). La cartographie est bornée dans le temps, avec une limite d'exploration fixée à 500 secondes, au-delà de laquelle le système continue d'opérer avec une carte partielle plutôt que d'attendre une couverture complète. La requête classifiée est ensuite ancrée dans le contexte géométrique et sémantique de cette carte pour générer un prompt détaillé soumis au VLM, produisant en sortie une action exploitable par le robot. L'intérêt de ce travail dépasse le cadre du concours : il illustre concrètement comment combler l'écart entre instruction en langage naturel et action robotique physique, un défi central pour toute la famille des modèles VLA actuellement en déploiement industriel, de Pi-0 à GR00T N2 en passant par Helix. En imposant une contrainte de temps stricte sur la cartographie, les auteurs mettent en lumière un problème rarement traité frontalement dans les démonstrations commerciales : la robustesse face à une perception incomplète, plus représentative des conditions réelles que des environnements soigneusement scannés en amont. Le CMU VLA Challenge s'inscrit dans une vague de benchmarks académiques cherchant à standardiser l'évaluation des architectures VLA modulaires, en concurrence avec les approches end-to-end privilégiées par les laboratoires industriels. Les prochaines étapes attendues concernent la publication des résultats comparatifs de la compétition et l'éventuelle extension de cette architecture voxel-plus-VLM à des plateformes robotiques réelles au-delà du cadre expérimental du challenge.

RecherchePaper
1 source
Le Fil IA n'a pas besoin d'audit ni de skill ici, c'est une simple traduction de titre
3arXiv cs.RO 

Le Fil IA n'a pas besoin d'audit ni de skill ici, c'est une simple traduction de titre

Une équipe de recherche a testé en conditions réelles une tête robotique humanoïde interactive dans trois lieux publics allemands : un office de tourisme, une bibliothèque municipale et l'accueil d'une administration du bâtiment (Bauamt). Le robot y a fonctionné en continu pendant plusieurs jours, engageant la conversation avec les visiteurs dans leur propre langue grâce à un pipeline de traitement du langage naturel couplé à un moteur de simulation émotionnelle, qui génère des réponses verbales multimodales enrichies d'expressions faciales. Les chercheurs ont mesuré l'acceptation des usagers via le questionnaire TAM2 (Technology Acceptance Model), un outil standard évaluant l'utilité perçue et la facilité d'usage. Résultat global : les utilisateurs se sont montrés motivés à interagir avec le robot et l'ont jugé plutôt utile et facile à prendre en main, quel que soit le site. Mais un usager sur cinq a trouvé le temps de réponse du système trop lent, ce qui nuisait à la fluidité du dialogue. L'enseignement principal dépasse la simple démonstration technique : l'acceptation d'un robot humanoïde conversationnel dépend fortement du contexte d'usage, pas seulement de ses capacités. L'office de tourisme et la bibliothèque, lieux où l'interaction est perçue comme légitime et sans enjeu, se sont révélés bien plus favorables que l'accueil administratif, où la volonté d'engager la conversation était nettement plus faible. Pour les intégrateurs et décideurs qui envisagent de déployer des robots d'accueil ou d'assistance multilingue, ce résultat suggère de prioriser les environnements à faible friction sociale plutôt que les guichets administratifs, et de traiter la latence de réponse comme un frein d'adoption aussi critique que la précision linguistique elle-même. Ce travail s'inscrit dans la lignée des recherches en interaction homme-robot social, où l'acceptation en conditions réelles reste plus rarement documentée que les démonstrations en laboratoire. Contrairement aux plateformes humanoïdes orientées tâches industrielles ou logistiques, ce projet cible l'accueil du public et la médiation linguistique. Les auteurs identifient la réduction du temps de réponse comme priorité pour les développements futurs, condition jugée nécessaire avant d'envisager un déploiement plus large de ce type de tête robotique interactive dans d'autres services publics.

UEL'étude a été menée dans des lieux publics allemands (office de tourisme, bibliothèque, administration du bâtiment), fournissant des enseignements directement applicables au déploiement de robots d'accueil dans les services publics européens.

RecherchePaper
1 source
TinySDP : optimisation semi-définie en temps réel pour une robotique embarquée certifiable et agile
4arXiv cs.RO 

TinySDP : optimisation semi-définie en temps réel pour une robotique embarquée certifiable et agile

Des chercheurs ont publié sur arXiv (preprint 2605.13748, mai 2025) TinySDP, qu'ils présentent comme le premier solveur de programmation semi-définie (SDP) conçu explicitement pour les systèmes embarqués à ressources contraintes. L'objectif : permettre un contrôle prédictif en temps réel (MPC) sur microcontrôleurs, en intégrant des contraintes d'obstacles non convexes jusqu'ici réservées à des machines de calcul bien plus puissantes. Le solveur associe des projections de cônes semi-définis positifs à un algorithme ADMM (Alternating Direction Method of Multipliers) avec factorisation de Riccati mise en cache. Un certificat de rang 1 a posteriori convertit à chaque pas de temps les solutions relaxées en garanties géométriques explicites. Les expériences portent sur des scénarios d'évitement d'obstacles dynamiques et de cul-de-sac, où les méthodes locales classiques échouent ; TinySDP y produit des trajectoires sans collision et jusqu'à 73 % plus courtes que les baselines de référence. La validation matérielle est conduite sur un quadrirotor Crazyflie, nano-drone de recherche développé par Bitcraze. L'enjeu industriel est réel : les relaxations SDP offrent depuis des années des garanties de certification pour la planification de mouvement, mais leur coût computationnel les confinait aux stations de calcul hors-ligne ou aux serveurs de cloud. Les embarquer sur un microcontrôleur ouvre la voie à des robots autonomes certifiés opérant sans infrastructure réseau : drones d'inspection, AMR en environnement dynamique, bras cobots sans liaison cloud. Le gain de 73 % sur la longueur de chemin dans des scénarios difficiles dépasse ce que la littérature locale obtient habituellement, bien qu'il faille noter que ces benchmarks sont choisis par les auteurs, et que les conditions réelles d'industrialisation restent à établir. La programmation semi-définie est un outil établi en robotique depuis les travaux sur les relaxations de Lasserre et les problèmes de manipulation certifiée, mais aucun solveur embarqué n'en avait rendu le déploiement praticable avant ce travail. Côté concurrents, les solveurs embarqués dominants comme OSQP ou ECOS ciblent les problèmes quadratiques ou coniques de second ordre, sans support natif des contraintes SDP. Le papier reste un preprint non relu par les pairs ; les prochaines étapes naturelles seraient une validation sur des plateformes plus contraintes encore (STM32, Cortex-M) et des scénarios multi-obstacles en environnement non structuré.

UEBitcraze, entreprise suédoise (EU) dont le nano-drone Crazyflie sert de plateforme de validation, bénéficie d'une visibilité accrue ; les équipes R&D européennes travaillant sur des AMR ou cobots embarqués sans connexion cloud pourraient intégrer TinySDP dans leurs pipelines de planification de mouvement certifiable.

RecherchePaper
1 source