Прискорення в 5.83 раза: PolicyTrim допомагає VLA-роботам уникати зайвих кроків і швидше виконувати завдання

PolicyTrimнавчання з підкріпленнямоптимізація ефективностівтілений інтелектVLAробототехніка
2026-07-22Джерело: blockweeks.com
Прискорення в 5.83 раза: PolicyTrim допомагає VLA-роботам уникати зайвих кроків і швидше виконувати завдання

[Вступ] Моделі VLA вже можуть виконувати завдання, але реальні роботи все ще повільні! PolicyTrim — це метод оптимізації ефективності виконання VLA-роботів без перенавчання. Він допомагає роботам виконувати завдання більш прямо та підвищує загальну швидкість, подовжуючи надійні послідовності дій та зменшуючи зайві кроки.

Моделі Vision-Language-Action (VLA) об'єднують візуальні спостереження, мовні інструкції та дії робота в єдину модель політики, що дозволяє роботам виконувати складні маніпуляційні завдання на основі природної мови.

Від OpenVLA, OpenVLA-OFT до π0.5, GR00T, такі моделі стають важливим технічним напрямком для втіленої інтелектуальності.

Однак, коли моделі VLA фактично розгортаються на роботах, одразу виникає ключове вузьке місце: загальний час виконання завдання роботом залежить не лише від швидкості кожного виведення, але й від того, скільки виведень та реальних фізичних дій потрібно виконати політиці.

robot

При багаторазових запусках одного й того ж завдання кількість кроків виконання моделі VLA значно коливається, що вказує на те, що коротші та більш прямі успішні шляхи досяжні, але поточна політика часто знаходить їх лише випадково.

Ненадійний хвіст дійових фрагментів: Модель передбачає кілька дій одночасно, але пізніші дії більш схильні до накопичення помилок, що змушує систему часто перепланувати. Примусове подовження горизонту виконання знижує рівень успіху та збільшує фізичні кроки.

Значна надмірність у фізичних діях: Навіть якщо завдання в кінцевому підсумку успішне, траєкторія може містити велику кількість коригувальних, зворотних та повторюваних дій.

Тому ефективність розгортання VLA залежить не лише від затримки виведення на крок, але й від ефективності політики: скільки дій в одному прогнозі можна безпечно виконати? Скільки реальних фізичних кроків потрібно для завершення завдання?

Існуючі методи здебільшого починають з обчислювального боку, наприклад, проріджування візуальних токенів, квантування, повторне використання KV-кешу, дистиляція або оптимізація механізму виведення. Ці методи можуть зменшити затримку одного виведення, але якщо політика все ще потребує багатьох надлишкових фізичних кроків, фактичний час виконання завдання залишається довгим.

Пряме фіксування довших дійових фрагментів також ненадійне.

Експерименти в статті показують, що при примусовому збільшенні довжини виконання дій рівень успіху може впасти, а кількість фізичних кроків може збільшитися. Це вказує на те, що низькоякісні прогнози хвоста вносять помилки у фізичний світ, вимагаючи від робота більше коригувальних дій.

Ключове питання: Чи можемо ми, не жертвуючи рівнем успіху завдання, дозволити існуючим політикам VLA автоматично навчитися "менше об'їжджати" та виконувати завдання з меншою кількістю фізичних кроків через пост-тренування?

Команда під керівництвом професора Іньцзе Лея з Сичуаньського університету запропонувала PolicyTrim — дворівневу структуру пост-тренування з підкріпленням для "ефективності політики". Вона не змінює архітектуру VLA та не збирає нові дані від експертів, а продовжує оптимізувати реальну поведінку виконання робота на основі існуючої попередньо навченої політики.

robot

Сторінка проєкту: https://inceptionwang.github.io/PolicyTrim/

Посилання на статтю: https://arxiv.org/abs/2606.22540

Посилання на код: https://github.com/INCEPTIONwang/PolicyTrim

Посилання на модель: https://huggingface.co/INCEPTIONwang/PolicyTrim

Новий метод досягає:

  • 3× використання дій-чанків, надійне виконання на довших горизонтах;
  • 51.4% зменшення фізичних кроків, стиснення надлишкових коригувальних дій;
  • 5.83× прискорення наскрізної обробки на LIBERO Object/π0.5;

Від «Обчислювати швидше» до «Діяти швидше»

Основна мета PolicyTrim — не замінити прискорення обчислень, а вирішити інший, часто ігнорований аспект: зменшення кількості прямих інференцій, необхідних для виконання завдання. Вона розкладає ефективність політики на дві оптимізовані цілі: спочатку розширити надійні дій-чанки, а потім стиснути надлишкові фізичні кроки.

robot

1. Надійне розширення дій-чанків

Наразі багато VLA-політик виводять послідовності дій у формі дій-чанків, але під час розгортання вони часто виконують лише перші кілька кроків. На першому етапі PolicyTrim використовує динамічне дослідження горизонту виконання: різні коефіцієнти прийняття призначаються одній і тій же групі розгортання, що дозволяє моделі паралельно досліджувати надійні межі в коротких, середніх і довгих вікнах.

Траєкторії, які успішно виконують завдання з довшими вікнами виконання, отримують вищі винагороди, що спонукає модель робити спочатку ненадійні хвостові дії чанка більш придатними для використання.

Винагорода за горизонт активується лише тоді, коли в групі з'являється успішна траєкторія, що запобігає сліпому прагненню моделі до довших чанків у випадках невдач.

2. Зменшення кроків з урахуванням надмірності

Після розширення надійного горизонту другий етап додатково зменшує загальну кількість фізичних кроків. PolicyTrim вводить винагороду за економію кроків: чим менше кроків використовує успішна траєкторія для виконання завдання, тим вища винагорода.

Винагорода за економію кроків безпосередньо кодує «коротші, більш прямі успішні траєкторії» в ціль оптимізації.

Групове якірне регулювання пригнічує невідтворювані спекулятивні скорочення, запобігаючи прагненню моделі до коротких шляхів за рахунок рівня успішності.

Двоетапна послідовна оптимізація уникає взаємодії між цілями «подовження чанків» і «скорочення кроків», що в кінцевому підсумку зменшує кількість прямих інференцій, необхідних для виконання завдання.

Експериментальні результати

У статті PolicyTrim перевіряється на LIBERO, ManiSkill, Meta-World і реальних роботизованих завданнях, охоплюючи різні VLA-архітектури, такі як π0.5, OpenVLA-OFT і GR00T. Загальні результати показують, що PolicyTrim значно підвищує ефективність виконання, зберігаючи стабільний рівень успішності завдань.

У LIBERO π0.5 досягає до 5.83x наскрізного прискорення, зберігаючи рівень успішності вище 98%.

Результати між бенчмарками показують, що PolicyTrim досягає до 2.36x прискорення на ManiSkill і 2.52x прискорення на Meta-World.

Результати між архітектурами показують, що перенавчений OpenVLA-OFT з використанням повного двоетапного конвеєра досягає 2.97x прискорення; OpenVLA, що використовує лише другий етап, також досягає 1.41x прискорення.

Robot

Якісне порівняння: менше об'їздів, більш прямі траєкторії

У випадково вибраних завданнях LIBERO базова лінія часто демонструє надлишкові коригувальні дії та коливання/тремтіння поблизу цілі; траєкторії PolicyTrim є більш плавними та прямими, виконуючи те саме завдання з меншою кількістю фізичних кроків, зазвичай стискаючи кількість фізичних кроків приблизно вдвічі.

Robot

Розгортання реальних роботів: переваги ефективності в симуляції переносяться у фізичний світ

У статті додатково перевіряються реальні завдання робота на роботизованій руці Agilex Piper, оснащеній двома камерами Intel RealSense D435i, включаючи три завдання: FlipMug, HangMug і TapeBox. Експерименти охоплюють стандартні налаштування з фіксованими позиціями цілей та динамічні налаштування з випадковими збуреннями під час захоплення.

PolicyTrim зберігає або покращує показники успішності як у стандартних умовах, так і в умовах динамічних збурень, значно скорочуючи реальний час виконання. У стандартних умовах реального робота він досягає в середньому 1,86-кратного прискорення від кінця до кінця.

Robot

Robot

З результатів експериментів видно, що PolicyTrim не просто оптимізує контрольні показники: на фізичних роботах час виконання завдання також скорочується приблизно до половини базового рівня, а стійкість зберігається в сценаріях динамічних збурень.

Чому PolicyTrim ефективний?

• Підвищує ефективність на рівні політики: зменшує надлишкові дії та непотрібне перепланування, а не лише затримку одного виведення.

• Не потребує навчання з нуля: як пост-тренувальна структура, вона може бути оптимізована на основі існуючих моделей VLA, зменшуючи витрати на збір даних і навчання.

• Збалансовує швидкість і показник успішності: надійне розширення горизонту уникає сліпого подовження фрагментів, а обмеження стабільності запобігають спекуляціям на коротких шляхах.

• Може поєднуватися з обчислювальним прискоренням: PolicyTrim оптимізує кількість прямих виведень, тоді як такі методи, як VLA-Cache, оптимізують час одного виведення; ці два підходи є ортогональними і можуть давати сукупне прискорення.

Основна ідея PolicyTrim полягає в тому, що для роботів VLA ефективність розгортання залежить не лише від швидшого виведення моделі, але й від більш ефективної поведінки політики. Змушуючи роботів «робити менше обхідних шляхів», також можна досягти значного прискорення.

Посилання: https://arxiv.org/abs/2606.22540

Ця стаття з публічного акаунта WeChat «新智元», автор: 新智元; редактор: LRST

Дисклеймер: Інформація, надана в цій статті, не є інвестиційною порадою. BlockWeeks.com не несе відповідальності за будь-які інвестиції, зроблені на основі інформації, наведеної в цій статті. Ми наполегливо рекомендуємо проводити незалежне дослідження або консультуватися з кваліфікованими фахівцями перед прийняттям будь-яких інвестиційних рішень.