Aller au contenu principal
Pulvérisation adaptative de pesticides pour robots agricoles selon la météo et le terrain, grâce aux modèles vision-langage
RecherchearXiv cs.RO 

Pulvérisation adaptative de pesticides pour robots agricoles selon la météo et le terrain, grâce aux modèles vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent, dans une préimpression arXiv (2610.08807), un cadre de pulvérisation adaptative pour robots agricoles fondé sur des modèles vision-langage (VLM). Le système fusionne plusieurs sources : le type de culture identifié par la caméra, le type de pesticide appliqué et les données météorologiques, notamment la température et la vitesse du vent. À partir de ces entrées, le VLM raisonne spatialement et décide du volume de produit à pulvériser et de la vitesse d'avance. L'exécution repose sur un contrôleur de suivi de trajectoire de type MPPI (Model Predictive Path Integral), qui assure la navigation le long des rangs et le déclenchement précis de la pulvérisation aux emplacements des plants. Les auteurs annoncent un gain de précision d'au moins 30 % dans la détection des rangs de culture par rapport aux méthodes comparées. Deux environnements d'essai ont montré que le robot ajuste son volume de pulvérisation et sa vitesse, avec une réduction de la dérive des pesticides. Le résumé ne donne ni le nom du robot, ni les modèles de VLM utilisés, ni les surfaces testées, ni les volumes économisés.

L'intérêt tient au déplacement du problème. La plupart des robots de pulvérisation de précision se concentrent sur la détection des cultures et appliquent ensuite des paramètres fixes, définis à l'avance. Un opérateur humain, lui, module sa dose et son allure selon le vent, la chaleur, la parcelle et le produit, car ces variables déterminent la dérive, l'uniformité du dépôt et donc l'efficacité du traitement. Utiliser un VLM comme couche de décision contextuelle revient à tester si ce raisonnement de « bon sens agronomique » peut être confié à un modèle généraliste, sans règles codées à la main pour chaque combinaison culture, produit et météo. Pour les constructeurs et les exploitants, l'enjeu est double : moins de produit phytosanitaire gaspillé ou emporté hors parcelle, et une pression réglementaire à la baisse sur les intrants. Les limites sont à garder en tête. Le gain de 30 % porte sur la détection des rangs, pas sur la qualité agronomique du traitement. Les résultats de deux environnements d'essai ne disent rien de la robustesse en conditions réelles, ni de la latence d'inférence d'un VLM embarqué, ni de la fiabilité face à des erreurs de raisonnement du modèle sur des doses de produits chimiques.

Ce travail s'inscrit dans la convergence entre robotique agricole et modèles fondationnels, déjà visible dans la manipulation avec les VLA (vision-language-action). Il côtoie des acteurs commerciaux de la pulvérisation ciblée, comme Carbon Robotics avec le désherbage laser, Blue River (John Deere) avec See & Spray, ou, en Europe, des acteurs comme Naïo Technologies ou FarmDroid, qui misent sur la détection plutôt que sur l'adaptation contextuelle. MPPI, méthode de contrôle par échantillonnage, est un choix répandu pour la navigation robuste en terrain irrégulier. Les prochaines étapes logiques seraient des essais en plein champ sur plusieurs saisons, une comparaison chiffrée avec des opérateurs humains et une mesure directe de la dérive et de la consommation de produit. À ce stade, il s'agit d'une démonstration académique, sans produit ni pilote annoncé.

Impact France/UE

Intérêt indirect pour la robotique agricole européenne (Naïo Technologies, FarmDroid) et la réduction des intrants phytosanitaires, mais il s'agit d'une démonstration académique sans acteur ni pilote européen.

Dans nos dossiers

À lire aussi

PIVOT : navigation de robots de terrain grâce à un modèle vision-langage pour évaluer la praticabilité hors-piste
1arXiv cs.RO 

PIVOT : navigation de robots de terrain grâce à un modèle vision-langage pour évaluer la praticabilité hors-piste

Des chercheurs présentent PIVOT (Physically Informed Vision-Language Off-Road Traversability), un système de navigation pour robots terrestres combinant planification géométrique classique et raisonnement sémantique fondé sur un modèle vision-langage (VLM). Publiée sur arXiv (2609.20983v1), l'architecture retient deux niveaux : la planification géométrique reste le mode par défaut, rapide à calculer, et le VLM n'est sollicité pour un replanning sémantique que lorsque cette méthode échoue à trouver un chemin. Pour ancrer les prédictions du VLM dans la réalité physique, les auteurs mesurent la corrélation entre le coût énergétique de franchissement estimé par le modèle, les vibrations relevées sur le robot et le glissement des roues, puis construisent un score de franchissabilité unifié pondérant chaque modalité selon sa corrélation avec les mesures réelles. Le système a été testé sur cinq essais répétés en boucle fermée, sur un parcours de terrain mixte totalisant environ 6,4 kilomètres. Comparé à une navigation purement géométrique, PIVOT fait passer le taux d'autonomie de 59,6% à 97,0%, réduit les interventions humaines de 11 à 3, et porte la distance moyenne entre interventions de 69,2 à 412,9 mètres. Ces résultats visent un problème concret pour les robots de terrain agricoles, militaires ou d'exploration : les planificateurs purement géométriques, qui jugent la franchissabilité à partir de la seule géométrie (pente, hauteur d'obstacles), sont souvent trop prudents en environnement non structuré, écartant des chemins en réalité praticables faute de comprendre la nature du sol, herbe haute, gravier meuble ou feuilles mortes. En couplant le VLM à des mesures physiques réelles plutôt qu'en traitant ses jugements comme fiables par défaut, les auteurs répondent à une critique récurrente sur l'écart entre démonstrations et fiabilité en conditions réelles. La quasi-triplication de la distance entre interventions suggère qu'un raisonnement sémantique par VLM peut s'intégrer à moindre coût de calcul dans des piles de navigation existantes, sans remplacer la planification géométrique éprouvée, un argument qui parlera aux intégrateurs de robots agricoles ou de logistique tout-terrain cherchant à réduire la supervision humaine. Ce travail s'inscrit dans la tendance plus large d'hybridation entre modèles vision-langage et robotique de terrain, où plusieurs équipes de recherche explorent l'usage de VLM pour la sémantique de scène sans disposer encore de standards communs d'évaluation. La contribution principale de PIVOT est méthodologique : quantifier empiriquement la fiabilité des prédictions d'un VLM avant de les exploiter pour la décision, plutôt que de les supposer correctes. Les auteurs ne mentionnent ni calendrier de déploiement commercial ni partenariat industriel ; il s'agit à ce stade d'une publication de recherche, dont la suite logique serait une validation sur une flotte plus large et des terrains plus variés.

RecherchePaper
1 source
Grands modèles de récompense : génération de récompenses robotiques en ligne et généralisable grâce aux modèles vision-langage
2arXiv cs.RO 

Grands modèles de récompense : génération de récompenses robotiques en ligne et généralisable grâce aux modèles vision-langage

Des chercheurs proposent les Large Reward Models (LRM), un cadre qui transforme des modèles vision-langage (VLM) de base en générateurs de récompense image par image, destinés à affiner des politiques de manipulation robotique. Le VLM de pointe retenu est spécialisé sur un jeu de données multi-sources : trajectoires de robots réels, interactions humain-objet et environnements de manipulation simulés. Contrairement aux approches qui évaluent les trajectoires a posteriori, les LRM exposent trois interfaces de récompense à partir des seules observations visuelles : estimation de progression, détection d'achèvement de la tâche et comparaison contrastive temporelle. Partant d'une politique apprise par imitation (IL), les auteurs utilisent ces signaux pour guider un affinage par PPO sur des tâches de manipulation à long horizon non vues pendant l'entraînement. La récompense de progression s'impose comme le meilleur signal en ligne sans information privilégiée : elle améliore la politique IL de référence et réduit l'écart avec les récompenses « privilégiées » issues de l'état interne de l'environnement. Côté matériel réel, elle sert à pondérer un clonage comportemental (behavioral cloning) selon la progression, sur quatre tâches de manipulation et deux plateformes robotiques, avec un gain sur le fine-tuning supervisé (SFT) classique dans les quatre cas. Le résumé ne donne ni modèle de VLM, ni taux de réussite chiffrés, ni noms de robots. L'enjeu est celui d'un goulot d'étranglement bien connu : l'apprentissage par renforcement (RL) peut améliorer les politiques de manipulation, mais écrire une fonction de récompense à la fois sémantiquement pertinente et réutilisable d'une tâche à l'autre reste coûteux, et se fait aujourd'hui surtout à la main, tâche par tâche. Si ces résultats se confirment, un VLM spécialisé pourrait servir de récompense générique, ce qui réduirait l'ingénierie de récompense pour les intégrateurs et ouvrirait la voie à une auto-amélioration des robots en déploiement, sans instrumentation de la scène. Des réserves s'imposent : l'écart avec les récompenses privilégiées est réduit, pas comblé ; la validation réelle ne porte que sur quatre tâches, et sur du clonage comportemental pondéré plutôt que sur du RL en ligne sur robot physique. Le travail relève de la recherche (preprint arXiv, version 3), sans produit ni déploiement industriel. Ces travaux s'inscrivent dans la montée des modèles de fondation pour la robotique, des VLA (vision-langage-action) comme Pi-0 ou GR00T aux VLM utilisés comme juges ou générateurs de récompense. Les approches précédentes de récompense par modèle de langage ou de vision restaient souvent limitées à une évaluation après coup, ce que les LRM cherchent à dépasser avec un signal exploitable en ligne. La suite logique serait de tester ces récompenses en RL directement sur robot réel, sur un plus grand nombre de tâches, et de mesurer leur robustesse face aux erreurs d'estimation de progression, qui peuvent être exploitées par la politique. Le résumé ne cite aucun acteur européen ni partenaire industriel.

RecherchePaper
1 source
VISOR : un oracle de test basé sur un modèle vision-langage pour tester les robots
3arXiv cs.RO 

VISOR : un oracle de test basé sur un modèle vision-langage pour tester les robots

Une équipe de chercheurs a présenté VISOR, un oracle de test automatisé pour la robotique basé sur des modèles vision-langage (VLM). Publiée sur arXiv (2605.10408), la méthode vise à résoudre ce que le domaine nomme le "problème de l'oracle de test" : déterminer automatiquement si un robot a accompli une tâche de manière correcte et avec une qualité suffisante. Jusqu'ici, deux approches coexistaient : les oracles symboliques, limités à des jugements binaires pass/fail et spécifiques à chaque tâche, et l'évaluation humaine manuelle, coûteuse, subjective et sujette aux erreurs. VISOR s'appuie sur GPT (OpenAI) et Gemini (Google) pour évaluer à la fois la correction et la qualité d'exécution, et pour quantifier son propre niveau d'incertitude lors des assessments. Le système a été validé sur plus de 1 000 vidéos couvrant quatre tâches robotiques distinctes. Les résultats montrent des profils contrastés : Gemini obtient un meilleur rappel (recall), identifiant davantage de vraies défaillances, tandis que GPT affiche une meilleure précision avec moins de faux positifs. Ces résultats nuancent l'idée d'un VLM universellement fiable comme juge de comportements robotiques. Plus problématique : les deux modèles présentent une faible corrélation entre leur score d'incertitude auto-déclaré et la correction réelle de leurs jugements. L'incertitude ne peut donc pas servir d'indicateur fiable pour filtrer les erreurs d'évaluation, ce qui est une limite directe pour tout déploiement en pipeline de test continu, où un tel signal de fiabilité serait précieux. Le "problème de l'oracle de test" est une problématique classique du génie logiciel, qui prend une dimension particulière en robotique physique : les comportements y sont continus, bruités et difficiles à formaliser symboliquement. L'approche VLM-as-judge, popularisée dans l'évaluation des LLMs textuels via des benchmarks comme MT-Bench ou AlpacaEval, est ici transposée à des sorties vidéo de robots, ce qui constitue une extension non triviale. Des travaux concurrents explorent des métriques spécifiques aux tâches ou des simulateurs avec vérification formelle, mais VISOR mise sur la généralité au détriment d'une calibration encore insuffisante. La prochaine étape identifiée par les auteurs est précisément d'améliorer cette corrélation incertitude-correction, condition nécessaire avant toute intégration dans un pipeline CI/CD robotique.

RecherchePaper
1 source
Apprendre à accélérer les modèles vision-langage-action grâce à la mise en cache adaptative de tokens visuels
4arXiv cs.RO 

Apprendre à accélérer les modèles vision-langage-action grâce à la mise en cache adaptative de tokens visuels

Des chercheurs ont publié sur arXiv une version révisée d'un article intitulé "Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching" (identifiant arXiv:2602.00686v2), qui reformule l'accélération de l'inférence des modèles Vision-Language-Action (VLA) en robotique manipulatrice comme un problème d'apprentissage de politique plutôt qu'une règle fixe. Le système repose sur deux modules légers entraînés conjointement avec le modèle: un Cached Token Selector, qui choisit quels tokens visuels réutiliser d'une étape à l'autre, et un Cache Ratio Predictor, qui détermine la proportion de tokens à mettre en cache selon l'évolution de la scène. Ces décisions étant discrètes par nature, les auteurs les rendent différentiables pour permettre un entraînement de bout en bout par descente de gradient. Évaluée sur les bancs d'essai LIBERO et SIMPLER ainsi que sur un robot réel, la méthode atteint une accélération de 1,76x du temps d'inférence en conditions réelles, tout en améliorant le taux de réussite moyen de 1,9 point sur LIBERO (de 75,0% à 76,9%) et de 5,0 points sur les tâches en environnement physique, devançant les méthodes de référence existantes. L'enjeu pour les intégrateurs et concepteurs de systèmes robotiques tient au goulot d'étranglement bien connu des modèles VLA: leur coût de calcul freine le déploiement embarqué, notamment sur des contrôleurs à ressources limitées. Les approches actuelles de mise en cache ou d'élagage de tokens sont généralement statiques et fondées sur des heuristiques, donc mal adaptées aux changements dynamiques de scène. Montrer qu'une politique apprise peut à la fois accélérer l'inférence et améliorer légèrement la précision, plutôt que la dégrader comme c'est souvent le cas avec les techniques de compression, va à l'encontre de l'hypothèse répandue d'un compromis strict entre vitesse et fiabilité pour les architectures VLA. Ce travail s'inscrit dans la lignée des recherches sur l'efficacité des modèles VLA à grande échelle, un axe jugé aussi critique que la généralisation elle-même pour leur adoption industrielle. Les auteurs comparent explicitement leur approche aux méthodes existantes de cache par règles, sans toutefois nommer de modèles VLA commerciaux précis dans le résumé fourni. Il s'agit à ce stade d'une contribution académique publiée en preprint, testée en laboratoire et sur un nombre limité de tâches réelles, et non d'un produit ou d'un déploiement industriel; les suites annoncées concernent l'extension de ces politiques d'allocation de calcul apprises à d'autres familles de modèles VLA.

RecherchePaper
1 source