Aceleración 5.83x, PolicyTrim: Hacer que los robots VLA tomen menos desvíos y completen tareas más rápido

PolicyTrimAprendizaje por Refuerzooptimización de eficienciainteligencia encarnadaVLARobótica
2026-07-22Fuente: blockweeks.com
Aceleración 5.83x, PolicyTrim: Hacer que los robots VLA tomen menos desvíos y completen tareas más rápido

[Introducción] Los modelos VLA ya pueden realizar tareas, ¡pero los robots reales siguen siendo lentos! PolicyTrim es un método para optimizar la eficiencia de ejecución de los robots VLA sin reentrenamiento. Ayuda a los robots a completar tareas de manera más directa y mejorar la velocidad general al extender secuencias de acciones confiables y reducir pasos redundantes.

Los modelos de Visión-Lenguaje-Acción (VLA) unifican observaciones visuales, instrucciones de lenguaje y acciones del robot en un único modelo de política, lo que permite a los robots realizar tareas de manipulación complejas basadas en lenguaje natural.

Desde OpenVLA, OpenVLA-OFT hasta π0.5, GR00T, estos modelos se están convirtiendo en una ruta técnica importante para la inteligencia encarnada.

Sin embargo, cuando los modelos VLA se despliegan realmente en robots, surge inmediatamente un cuello de botella clave: el tiempo total para que un robot complete una tarea depende no solo de la rapidez de cada inferencia, sino también de cuántas inferencias y acciones físicas reales necesita ejecutar la política.

robot

En múltiples ejecuciones de la misma tarea, el número de pasos de ejecución del modelo VLA fluctúa significativamente, lo que indica que existen caminos exitosos más cortos y directos, pero la política actual a menudo solo los encuentra por casualidad.

Cola poco confiable de los bloques de acciones: el modelo predice múltiples acciones a la vez, pero las acciones posteriores son más propensas a errores acumulados, lo que obliga al sistema a replanificar con frecuencia. Alargar forzosamente el horizonte de ejecución reduce la tasa de éxito y aumenta los pasos físicos.

Redundancia severa en las acciones físicas: Incluso si la tarea finalmente tiene éxito, la trayectoria puede contener una gran cantidad de acciones correctivas, de retroceso y repetitivas.

Por lo tanto, la eficiencia de despliegue de VLA depende no solo de la latencia de inferencia por paso, sino también de la eficiencia de la política: ¿cuántas acciones en una sola predicción se pueden ejecutar de manera segura? ¿Cuántos pasos físicos reales se necesitan para completar la tarea?

Los métodos existentes se centran principalmente en el lado computacional, como la poda de tokens visuales, la cuantización, la reutilización de caché KV, la destilación o la optimización del motor de inferencia. Estos métodos pueden reducir la latencia de una sola inferencia, pero si la política aún requiere muchos pasos físicos redundantes, el tiempo real de la tarea sigue siendo largo.

Arreglar directamente bloques de acciones más largos tampoco es confiable.

Los experimentos del artículo muestran que a medida que se aumenta forzosamente la longitud de ejecución de las acciones, la tasa de éxito puede disminuir y el número de pasos físicos puede aumentar. Esto indica que las predicciones de baja calidad en la cola introducen errores en el mundo físico, lo que requiere más acciones correctivas por parte del robot.

Pregunta clave: ¿Podemos, sin sacrificar la tasa de éxito de la tarea, permitir que las políticas VLA existentes aprendan automáticamente a "tomar menos desvíos" y completar tareas con menos pasos físicos mediante el post-entrenamiento?

Un equipo liderado por el profesor Yinjie Lei de la Universidad de Sichuan propuso PolicyTrim, un marco de post-entrenamiento de aprendizaje por refuerzo en dos etapas para la "eficiencia de la política". No cambia la arquitectura VLA ni recopila datos de expertos, sino que continúa optimizando el comportamiento de ejecución real del robot sobre la base de la política pre-entrenada existente.

robot

Página del proyecto: https://inceptionwang.github.io/PolicyTrim/

Enlace del artículo: https://arxiv.org/abs/2606.22540

Enlace del código: https://github.com/INCEPTIONwang/PolicyTrim

Enlace del modelo: https://huggingface.co/INCEPTIONwang/PolicyTrim

El nuevo método logra:

  • 3× utilización de fragmentos de acción, ejecución confiable en horizontes más largos;
  • 51.4% de reducción en pasos físicos, comprimiendo acciones correctivas redundantes;
  • 5.83× aceleración de extremo a extremo en LIBERO Object/π0.5;

De "Computar más rápido" a "Actuar más rápido"

El objetivo central de PolicyTrim no es reemplazar la aceleración del lado del cómputo, sino abordar otra dimensión pasada por alto: reducir el número de inferencias hacia adelante requeridas para completar una tarea. Descompone la eficiencia de la política en dos objetivos optimizables: primero, extender fragmentos de acción confiables, luego comprimir pasos físicos redundantes.

robot

1. Extensión confiable de fragmentos de acción

Actualmente, muchas políticas VLA generan secuencias de acción en forma de fragmentos de acción, pero durante el despliegue, a menudo solo ejecutan los primeros pasos. En la primera etapa, PolicyTrim utiliza exploración dinámica del horizonte de ejecución: se asignan diferentes ratios de aceptación al mismo grupo de despliegue, lo que permite que el modelo explore límites confiables en paralelo en ventanas cortas, medias y largas.

Las trayectorias que completan la tarea con éxito con ventanas de ejecución más largas reciben recompensas más altas, alentando al modelo a hacer que las acciones de cola originalmente no confiables del fragmento sean más utilizables.

La recompensa de horizonte solo se activa cuando aparece una trayectoria exitosa en el grupo, evitando que el modelo persiga ciegamente longitudes de fragmento más largas en casos de fallo.

2. Reducción de pasos consciente de redundancia

Después de extender el horizonte confiable, la segunda etapa reduce aún más el número total de pasos físicos. PolicyTrim introduce una recompensa de ahorro de pasos: cuantos menos pasos use una trayectoria exitosa para completar la tarea, mayor será la recompensa.

La recompensa de ahorro de pasos codifica directamente "trayectorias exitosas más cortas y directas" en el objetivo de optimización.

La regularización anclada al grupo suprime los atajos especulativos no reproducibles, evitando que el modelo persiga caminos cortos a expensas de la tasa de éxito.

La optimización secuencial en dos etapas evita la interferencia entre los objetivos de "alargar fragmentos" y "acortar pasos", reduciendo en última instancia el número de inferencias hacia adelante requeridas para completar la tarea.

Resultados experimentales

El artículo valida PolicyTrim en tareas de LIBERO, ManiSkill, Meta-World y robots reales, cubriendo diferentes arquitecturas VLA como π0.5, OpenVLA-OFT y GR00T. Los resultados generales muestran que PolicyTrim mejora significativamente la eficiencia de ejecución mientras mantiene tasas de éxito estables en las tareas.

En LIBERO, π0.5 logra hasta 5.83x de aceleración de extremo a extremo mientras mantiene una tasa de éxito superior al 98%.

Los resultados entre benchmarks muestran que PolicyTrim logra hasta 2.36x de aceleración en ManiSkill y 2.52x en Meta-World.

Los resultados entre arquitecturas muestran que OpenVLA-OFT reentrenado con el pipeline completo de dos etapas logra 2.97x de aceleración; OpenVLA usando solo la segunda etapa también logra 1.41x de aceleración.

Robot

Comparación cualitativa: Menos desvíos, trayectorias más directas

En tareas de LIBERO muestreadas aleatoriamente, la línea base a menudo exhibe acciones correctivas redundantes y vacilación/temblor cerca del objetivo; las trayectorias de PolicyTrim son más suaves y directas, completando la misma tarea con menos pasos físicos, típicamente comprimiendo el número de pasos físicos a aproximadamente la mitad.

Robot

Despliegue de robots reales: las ganancias de eficiencia en simulación se transfieren al mundo físico

El artículo valida además tareas de robots reales en un brazo robótico Agilex Piper equipado con dos cámaras Intel RealSense D435i, incluyendo tres tareas: FlipMug, HangMug y TapeBox. Los experimentos cubren configuraciones estándar con posiciones objetivo fijas y configuraciones dinámicas con perturbaciones aleatorias durante la agarre.

PolicyTrim mantiene o mejora las tasas de éxito tanto en configuraciones estándar como dinámicas con perturbaciones, mientras reduce significativamente el tiempo de ejecución real. En configuraciones estándar de robots reales, logra una aceleración promedio de extremo a extremo de 1.86x.

Robot

Robot

A partir de los resultados experimentales, PolicyTrim no solo optimiza las métricas de referencia: en robots físicos, el tiempo de finalización de la tarea también se reduce a aproximadamente la mitad de la línea base, y se mantiene la robustez en escenarios de perturbación dinámica.

¿Por qué es efectivo PolicyTrim?

• Mejora la eficiencia a nivel de política: reduce acciones redundantes y replanificación innecesaria, no solo la latencia de inferencia individual.

• No necesita entrenamiento desde cero: como marco de post-entrenamiento, puede optimizarse basándose en modelos VLA existentes, reduciendo los costos de recopilación de datos y entrenamiento.

• Equilibra velocidad y tasa de éxito: la expansión confiable del horizonte evita alargar los bloques a ciegas, y las restricciones de estabilidad previenen la especulación de caminos cortos.

• Puede combinarse con aceleración computacional: PolicyTrim optimiza el número de inferencias hacia adelante, mientras que métodos como VLA-Cache optimizan el tiempo por inferencia; los dos enfoques son ortogonales y pueden producir aceleración compuesta.

La idea central de PolicyTrim es que para los robots VLA, la eficiencia de despliegue no solo proviene de una inferencia de modelo más rápida, sino también de un comportamiento de política más eficiente. Hacer que los robots "tomen menos desvíos" también puede traer una aceleración significativa.

Referencia: https://arxiv.org/abs/2606.22540

Este artículo proviene de la cuenta pública de WeChat "新智元", autor: 新智元; editor: LRST

Descargo de responsabilidad: La información proporcionada en este artículo no es asesoramiento de inversión. BlockWeeks.com no asume ninguna responsabilidad por las inversiones realizadas basadas en la información proporcionada en este artículo. Recomendamos encarecidamente realizar una investigación independiente o consultar a profesionales calificados antes de tomar cualquier decisión de inversión.