[Introduction] Les modèles VLA peuvent déjà effectuer des tâches, mais les robots réels sont encore lents ! PolicyTrim est une méthode pour optimiser l'efficacité d'exécution des robots VLA sans réentraînement. Elle aide les robots à accomplir les tâches plus directement et à améliorer la vitesse globale en prolongeant les séquences d'actions fiables et en réduisant les étapes redondantes.
Les modèles Vision-Langage-Action (VLA) unifient les observations visuelles, les instructions en langage naturel et les actions du robot en un seul modèle de politique, permettant aux robots d'effectuer des tâches de manipulation complexes basées sur le langage naturel.
De OpenVLA, OpenVLA-OFT à π0.5, GR00T, ces modèles deviennent une voie technique importante pour l'intelligence incarnée.
Cependant, lorsque les modèles VLA sont réellement déployés sur des robots, un goulot d'étranglement clé apparaît immédiatement : le temps total pour qu'un robot accomplisse une tâche dépend non seulement de la rapidité de chaque inférence, mais aussi du nombre d'inférences et d'actions physiques réelles que la politique doit exécuter.
Dans plusieurs déploiements de la même tâche, le nombre d'étapes d'exécution du modèle VLA fluctue considérablement, indiquant que des chemins de réussite plus courts et plus directs sont réalisables, mais la politique actuelle ne les trouve souvent que par hasard.
Queue peu fiable des blocs d'actions : Le modèle prédit plusieurs actions à la fois, mais les actions ultérieures sont plus sujettes à des erreurs accumulées, forçant le système à re-planifier fréquemment. Allonger de force l'horizon d'exécution réduit le taux de réussite et augmente les étapes physiques.
Redondance sévère dans les actions physiques : Même si la tâche aboutit finalement, la trajectoire peut contenir un grand nombre d'actions correctives, de retours en arrière et d'actions répétitives.
Par conséquent, l'efficacité de déploiement des VLA dépend non seulement de la latence d'inférence par étape, mais aussi de l'efficacité de la politique : combien d'actions dans une seule prédiction peuvent être exécutées en toute sécurité ? Combien d'étapes physiques réelles sont nécessaires pour accomplir la tâche ?
Les méthodes existantes partent principalement du côté calcul, comme l'élagage des jetons visuels, la quantification, la réutilisation du cache KV, la distillation ou l'optimisation du moteur d'inférence. Ces méthodes peuvent réduire la latence d'inférence unique, mais si la politique nécessite encore de nombreuses étapes physiques redondantes, le temps réel de la tâche reste long.
Fixer directement des blocs d'actions plus longs est également peu fiable.
Les expériences de l'article montrent que si l'on augmente de force la longueur d'exécution des actions, le taux de réussite peut chuter et le nombre d'étapes physiques peut augmenter. Cela indique que les prédictions de queue de mauvaise qualité introduisent des erreurs dans le monde physique, nécessitant plus d'actions correctives de la part du robot.
Question clé : Pouvons-nous, sans sacrifier le taux de réussite des tâches, permettre aux politiques VLA existantes d'apprendre automatiquement à « prendre moins de détours » et à accomplir les tâches avec moins d'étapes physiques grâce à un post-entraînement ?
Une équipe dirigée par le professeur Yinjie Lei de l'Université du Sichuan a proposé PolicyTrim—un cadre de post-entraînement par apprentissage par renforcement en deux étapes pour « l'efficacité de la politique ». Il ne modifie pas l'architecture VLA ni ne recollecte des données d'experts, mais continue d'optimiser le comportement d'exécution réel du robot sur la base de la politique pré-entraînée existante.
Page du projet : https://inceptionwang.github.io/PolicyTrim/
Lien de l'article : https://arxiv.org/abs/2606.22540
Lien du code : https://github.com/INCEPTIONwang/PolicyTrim
Lien du modèle : https://huggingface.co/INCEPTIONwang/PolicyTrim
La nouvelle méthode permet d'obtenir :
- Utilisation de chunks d'action 3×, exécution fiable sur des horizons plus longs ;
- Réduction de 51,4 % des étapes physiques, compression des actions correctives redondantes ;
- Accélération de bout en bout de 5,83× sur LIBERO Object/π0.5 ;
De « Calculer plus vite » à « Agir plus vite »
L'objectif principal de PolicyTrim n'est pas de remplacer l'accélération côté calcul, mais de traiter une autre dimension négligée : réduire le nombre d'inférences directes nécessaires pour accomplir une tâche. Il décompose l'efficacité de la politique en deux objectifs optimisables : d'abord, étendre les chunks d'action fiables, puis compresser les étapes physiques redondantes.
1. Extension fiable des chunks d'action
Actuellement, de nombreuses politiques VLA produisent des séquences d'action sous forme de chunks d'action, mais lors du déploiement, elles n'exécutent souvent que les premières étapes. Dans la première phase, PolicyTrim utilise une exploration dynamique de l'horizon d'exécution : différents taux d'acceptation sont attribués au même groupe de déploiement, permettant au modèle d'explorer des limites fiables en parallèle sur des fenêtres courtes, moyennes et longues.
Les trajectoires qui accomplissent la tâche avec des fenêtres d'exécution plus longues reçoivent des récompenses plus élevées, encourageant le modèle à rendre les actions de fin de chunk initialement non fiables plus utilisables.
La récompense d'horizon n'est activée que lorsqu'une trajectoire réussie apparaît dans le groupe, empêchant le modèle de rechercher aveuglément des longueurs de chunk plus longues en cas d'échec.
2. Réduction des étapes consciente de la redondance
Après l'extension de l'horizon fiable, la deuxième phase réduit davantage le nombre total d'étapes physiques. PolicyTrim introduit une récompense d'économie d'étapes : moins une trajectoire réussie utilise d'étapes pour accomplir la tâche, plus la récompense est élevée.
La récompense d'économie d'étapes encode directement les « trajectoires réussies plus courtes et plus directes » dans l'objectif d'optimisation.
La régularisation ancrée sur le groupe supprime les raccourcis spéculatifs non reproductibles, empêchant le modèle de rechercher des chemins courts au détriment du taux de réussite.
L'optimisation séquentielle en deux phases évite les interférences entre les objectifs « allonger les chunks » et « raccourcir les étapes », réduisant finalement le nombre d'inférences directes nécessaires pour accomplir la tâche.
Résultats expérimentaux
L'article valide PolicyTrim sur LIBERO, ManiSkill, Meta-World et des tâches robotiques réelles, couvrant différentes architectures VLA telles que π0.5, OpenVLA-OFT et GR00T. Les résultats globaux montrent que PolicyTrim améliore significativement l'efficacité d'exécution tout en maintenant des taux de réussite stables.
Dans LIBERO, π0.5 atteint une accélération de bout en bout allant jusqu'à 5,83x tout en maintenant un taux de réussite supérieur à 98 %.
Les résultats inter-benchmarks montrent que PolicyTrim atteint une accélération allant jusqu'à 2,36x sur ManiSkill et 2,52x sur Meta-World.
Les résultats inter-architectures montrent que OpenVLA-OFT réentraîné avec le pipeline complet en deux phases atteint une accélération de 2,97x ; OpenVLA utilisant uniquement la deuxième phase atteint également une accélération de 1,41x.
Comparaison qualitative : moins de détours, des trajectoires plus directes
Dans des tâches LIBERO échantillonnées aléatoirement, la ligne de base présente souvent des actions correctives redondantes et des hésitations/tremblements près de la cible ; les trajectoires de PolicyTrim sont plus fluides et plus directes, accomplissant la même tâche avec moins d'étapes physiques, compressant généralement le nombre d'étapes physiques à environ la moitié.
Déploiement de robots réels : les gains d'efficacité en simulation se transfèrent au monde physique
L'article valide en outre des tâches de robot réel sur un bras robotique Agilex Piper équipé de deux caméras Intel RealSense D435i, incluant trois tâches : FlipMug, HangMug et TapeBox. Les expériences couvrent des paramètres standard avec des positions cibles fixes et des paramètres dynamiques avec des perturbations aléatoires pendant la saisie.
PolicyTrim maintient ou améliore les taux de réussite dans les deux paramètres (standard et perturbation dynamique) tout en réduisant considérablement le temps d'exécution réel. Dans les paramètres standard de robot réel, il atteint une accélération moyenne de bout en bout de 1,86x.
D'après les résultats expérimentaux, PolicyTrim ne se contente pas d'optimiser les métriques de référence : sur les robots physiques, le temps d'accomplissement des tâches est également réduit à environ la moitié de la ligne de base, et la robustesse est maintenue dans les scénarios de perturbation dynamique.
Pourquoi PolicyTrim est-il efficace ?
• Il améliore l'efficacité au niveau de la politique : il réduit les actions redondantes et la replanification inutile, pas seulement la latence d'inférence unique.
• Pas besoin d'entraînement à partir de zéro : en tant que cadre post-entraînement, il peut être optimisé sur la base des modèles VLA existants, réduisant ainsi les coûts de collecte de données et d'entraînement.
• Équilibre entre vitesse et taux de réussite : une expansion fiable de l'horizon évite d'allonger aveuglément les segments, et des contraintes de stabilité empêchent la spéculation sur les chemins courts.
• Peut être combiné avec l'accélération computationnelle : PolicyTrim optimise le nombre d'inférences avant, tandis que des méthodes comme VLA-Cache optimisent le temps par inférence ; les deux approches sont orthogonales et peuvent produire une accélération composée.
L'idée centrale de PolicyTrim est que pour les robots VLA, l'efficacité de déploiement ne provient pas seulement d'une inférence de modèle plus rapide, mais aussi d'un comportement de politique plus efficace. Faire en sorte que les robots « prennent moins de détours » peut également apporter une accélération significative.
Référence : https://arxiv.org/abs/2606.22540
Cet article provient du compte public WeChat « 新智元 », auteur : 新智元 ; éditeur : LRST
Avertissement : Les informations fournies dans cet article ne constituent pas des conseils en investissement. BlockWeeks.com décline toute responsabilité pour les investissements effectués sur la base des informations contenues dans cet article. Nous recommandons vivement de mener des recherches indépendantes ou de consulter des professionnels qualifiés avant de prendre toute décision d'investissement.













