Aceleração de 5,83x: PolicyTrim faz robôs VLA agirem com mais eficiência e menos desvios

PolicyTrimAprendizado por ReforçoOtimização de EficiênciaInteligência IncorporadaVLARobótica
2026-07-22Fonte: blockweeks.com
Aceleração de 5,83x: PolicyTrim faz robôs VLA agirem com mais eficiência e menos desvios

[Introdução] Os modelos VLA já podem executar tarefas, mas os robôs reais ainda são lentos! PolicyTrim é um método para otimizar a eficiência de execução de robôs VLA sem retreinamento. Ele ajuda os robôs a concluir tarefas de forma mais direta e melhorar a velocidade geral, estendendo sequências de ações confiáveis e reduzindo etapas redundantes.

Os modelos Vision-Language-Action (VLA) unificam observações visuais, instruções de linguagem e ações do robô em um único modelo de política, permitindo que os robôs executem tarefas complexas de manipulação com base na linguagem natural.

De OpenVLA, OpenVLA-OFT a π0.5, GR00T, esses modelos estão se tornando uma importante rota técnica para a inteligência incorporada.

No entanto, quando os modelos VLA são realmente implantados em robôs, um gargalo chave surge imediatamente: o tempo total para um robô concluir uma tarefa depende não apenas da rapidez de cada inferência, mas também de quantas inferências e ações físicas reais a política precisa executar.

robô

Em múltiplas execuções da mesma tarefa, o número de etapas de execução do modelo VLA flutua significativamente, indicando que caminhos de sucesso mais curtos e diretos são alcançáveis, mas a política atual muitas vezes só os encontra por acaso.

Cauda não confiável de blocos de ação: O modelo prevê múltiplas ações de uma vez, mas as ações posteriores são mais propensas a erros acumulados, forçando o sistema a replanejar com frequência. Alongar à força o horizonte de execução reduz a taxa de sucesso e aumenta as etapas físicas.

Redundância severa em ações físicas: Mesmo que a tarefa eventualmente tenha sucesso, a trajetória pode conter um grande número de ações corretivas, de retrocesso e repetitivas.

Portanto, a eficiência de implantação do VLA depende não apenas da latência de inferência por etapa, mas também da eficiência da política: quantas ações em uma única previsão podem ser executadas com segurança? Quantas etapas físicas reais são necessárias para concluir a tarefa?

Os métodos existentes geralmente partem do lado computacional, como poda de tokens visuais, quantização, reutilização de cache KV, destilação ou otimização do mecanismo de inferência. Esses métodos podem reduzir a latência de inferência única, mas se a política ainda exigir muitas etapas físicas redundantes, o tempo real da tarefa permanece longo.

Corrigir diretamente blocos de ação mais longos também não é confiável.

Experimentos no artigo mostram que, à medida que o comprimento de execução da ação é aumentado à força, a taxa de sucesso pode cair e o número de etapas físicas pode aumentar. Isso indica que previsões de cauda de baixa qualidade introduzem erros no mundo físico, exigindo mais ações corretivas do robô.

Pergunta-chave: Podemos, sem sacrificar a taxa de sucesso da tarefa, permitir que as políticas VLA existentes aprendam automaticamente a "fazer menos desvios" e concluir tarefas com menos etapas físicas por meio de pós-treinamento?

Uma equipe liderada pelo Professor Yinjie Lei da Universidade de Sichuan propôs o PolicyTrim—uma estrutura de pós-treinamento de aprendizado por reforço em dois estágios para "eficiência de política". Ele não altera a arquitetura VLA nem recolhe dados de especialistas, mas continua otimizando o comportamento de execução real do robô com base na política pré-treinada existente.

robô

Página do projeto: https://inceptionwang.github.io/PolicyTrim/

Link do artigo: https://arxiv.org/abs/2606.22540

Link do código: https://github.com/INCEPTIONwang/PolicyTrim

Link do modelo: https://huggingface.co/INCEPTIONwang/PolicyTrim

O novo método alcança:

  • Utilização de blocos de ação 3×, execução confiável em horizontes mais longos;
  • Redução de 51,4% nos passos físicos, comprimindo ações corretivas redundantes;
  • Aceleração de ponta a ponta de 5,83× no LIBERO Object/π0.5;

De "Computar Mais Rápido" para "Agir Mais Rápido"

O objetivo central do PolicyTrim não é substituir a aceleração do lado da computação, mas abordar outra dimensão negligenciada: reduzir o número de inferências diretas necessárias para concluir uma tarefa. Ele decompõe a eficiência da política em dois objetivos otimizáveis: primeiro, estender blocos de ação confiáveis e, em seguida, comprimir passos físicos redundantes.

robô

1. Extensão Confiável de Blocos de Ação

Atualmente, muitas políticas VLA geram sequências de ação na forma de blocos de ação, mas durante a implantação, muitas vezes executam apenas os primeiros passos. No primeiro estágio, o PolicyTrim usa exploração dinâmica do horizonte de execução: diferentes taxas de aceitação são atribuídas ao mesmo grupo de rollout, permitindo que o modelo explore limites confiáveis em paralelo em janelas curtas, médias e longas.

Trajetórias que concluem a tarefa com sucesso com janelas de execução mais longas recebem recompensas maiores, incentivando o modelo a tornar as ações de cauda originalmente não confiáveis do bloco mais utilizáveis.

A recompensa de horizonte só é ativada quando uma trajetória bem-sucedida aparece no grupo, evitando que o modelo busque cegamente comprimentos de bloco mais longos em casos de falha.

2. Redução de Passos com Consciência de Redundância

Após a extensão do horizonte confiável, o segundo estágio reduz ainda mais o número total de passos físicos. O PolicyTrim introduz uma recompensa de economia de passos: quanto menos passos uma trajetória bem-sucedida usa para concluir a tarefa, maior a recompensa.

A recompensa de economia de passos codifica diretamente "trajetórias bem-sucedidas mais curtas e mais diretas" no objetivo de otimização.

A regularização ancorada em grupo suprime atalhos especulativos não reproduzíveis, evitando que o modelo busque caminhos curtos às custas da taxa de sucesso.

A otimização sequencial em dois estágios evita interferência entre os objetivos de "alongar blocos" e "encurtar passos", reduzindo, em última análise, o número de inferências diretas necessárias para concluir a tarefa.

Resultados Experimentais

O artigo valida o PolicyTrim em LIBERO, ManiSkill, Meta-World e tarefas de robôs reais, cobrindo diferentes arquiteturas VLA, como π0.5, OpenVLA-OFT e GR00T. Os resultados gerais mostram que o PolicyTrim melhora significativamente a eficiência de execução, mantendo taxas de sucesso estáveis nas tarefas.

No LIBERO, o π0.5 alcança até 5,83x de aceleração de ponta a ponta, mantendo uma taxa de sucesso acima de 98%.

Os resultados entre benchmarks mostram que o PolicyTrim alcança até 2,36x de aceleração no ManiSkill e 2,52x no Meta-World.

Os resultados entre arquiteturas mostram que o OpenVLA-OFT retreinado usando o pipeline completo de dois estágios alcança 2,97x de aceleração; o OpenVLA usando apenas o segundo estágio também alcança 1,41x de aceleração.

Robô

Comparação Qualitativa: Menos Desvios, Trajetórias Mais Diretas

Em tarefas LIBERO amostradas aleatoriamente, a linha de base frequentemente exibe ações corretivas redundantes e hesitação/tremor perto do alvo; as trajetórias do PolicyTrim são mais suaves e diretas, concluindo a mesma tarefa com menos passos físicos, tipicamente comprimindo o número de passos físicos para cerca de metade.

Robot

Implantação em Robôs Reais: Ganhos de Eficiência na Simulação Transferem-se para o Mundo Físico

O artigo valida ainda tarefas com robôs reais em um braço robótico Agilex Piper equipado com duas câmeras Intel RealSense D435i, incluindo três tarefas: FlipMug, HangMug e TapeBox. Os experimentos cobrem configurações padrão com posições-alvo fixas e configurações dinâmicas com perturbações aleatórias durante a preensão.

O PolicyTrim mantém ou melhora as taxas de sucesso tanto em configurações padrão quanto dinâmicas com perturbações, enquanto reduz significativamente o tempo real de execução. Em configurações padrão com robôs reais, alcança uma aceleração média de ponta a ponta de 1,86x.

Robot

Robot

A partir dos resultados experimentais, o PolicyTrim não apenas otimiza métricas de benchmark: em robôs físicos, o tempo de conclusão da tarefa também é reduzido para cerca de metade do valor de referência, e a robustez é mantida em cenários com distúrbios dinâmicos.

Por que o PolicyTrim é Eficaz?

• Melhora a eficiência no nível da política: reduz ações redundantes e replanejamentos desnecessários, não apenas a latência de inferência única.

• Não requer treinamento do zero: como uma estrutura pós-treinamento, pode ser otimizado com base em modelos VLA existentes, reduzindo custos de coleta de dados e treinamento.

• Equilibra velocidade e taxa de sucesso: a expansão confiável do horizonte evita alongar cegamente os blocos, e as restrições de estabilidade previnem especulações de caminhos curtos.

• Pode ser combinado com aceleração computacional: o PolicyTrim otimiza o número de inferências diretas, enquanto métodos como VLA-Cache otimizam o tempo por inferência; as duas abordagens são ortogonais e podem produzir aceleração composta.

A percepção central do PolicyTrim é que, para robôs VLA, a eficiência de implantação vem não apenas de uma inferência de modelo mais rápida, mas também de um comportamento de política mais eficiente. Fazer os robôs "tomarem menos desvios" também pode trazer aceleração significativa.

Referência: https://arxiv.org/abs/2606.22540

Este artigo é da conta pública do WeChat "新智元", autor: 新智元; editor: LRST

Aviso legal: As informações fornecidas neste artigo não são conselhos de investimento. O BlockWeeks.com não assume responsabilidade por quaisquer investimentos feitos com base nas informações fornecidas neste artigo. Recomendamos fortemente realizar pesquisa independente ou consultar profissionais qualificados antes de tomar qualquer decisão de investimento.