Что такое «модель мира»? Как её трактуют Ли Фэйфэй, Чжу Цзюнь и другие?

универсальная модель мираархитектура ИИобучение роботовMotusвоплощённый интеллектVidu
1 час назадИсточник: blockweeks.com
Что такое «модель мира»? Как её трактуют Ли Фэйфэй, Чжу Цзюнь и другие?

В 2026 году «мировая модель» — один из наименее согласованных терминов в мире ИИ.

Видео, которое можно генерировать непрерывно, называется мировой моделью; цифровая среда, которая меняется в реальном времени при работе с клавиатурой и мышью, также называется мировой моделью; системы, предсказывающие будущие состояния в латентном пространстве, а также политики, напрямую выдающие действия робота, равным образом используют это название.

Все эти модели обрабатывают информацию о мире, однако их границы возможностей далеко не совпадают. Изображения в сгенерированных видео могут быть достаточно реалистичными, но при этом нарушать реальные физические законы; робот может выполнить захват, но он также может быть знаком лишь с объектами, положениями камеры и траекториями движения в лаборатории. Вопрос о том, усвоила ли система визуальные корреляции, физическую структуру или связь между действиями и результатами, трудно решить на основании одной лишь демонстрации.

Концептуальная путаница повышает сложность технической оценки. Качество изображения, геометрическая точность, способность к предсказанию и показатели успешности выполнения задач смешиваются вместе для сравнения; разные команды, по-видимому, соревнуются на одной и той же дорожке, но на самом деле могут отвечать на разные вопросы.

Поэтому исследования мировых моделей начинают возвращаться к базовому вопросу: какими способностями должна обладать модель, чтобы перейти от генерации контента к пониманию и изменению мира?

Ли Фэйфэй и World Labs делят мировые модели по функции на рендереры, симуляторы и планировщики, которые выдают соответственно пиксели, состояния мира и действия.

世界模型

Ссылка: https://www.worldlabs.ai/blog/taxonomy-of-world-models

ЛеКун, напротив, выступает за изучение предсказуемых мировых структур в абстрактном латентном пространстве, что позволяет модели сохранять информацию, полезную для понимания, рассуждения и планирования.

世界模型

Ссылка: https://ai.meta.com/research/vjepa/

Чжу Цзюнь из Университета Цинхуа предлагает третий угол зрения. Ещё в декабре прошлого года, когда была выпущена Motus, он публично изложил общее видение «общей мировой модели»; в марте этого года он позиционировал её как основу, связывающую цифровой мир и физический мир. Несколько месяцев спустя Чжу Цзюнь и его команда дополнительно уточнили эту структуру в статье «Общие мировые модели с первых принципов», определив ключевые способности исходя из первых принципов и предложив пятиуровневую дорожную карту эволюции.

世界模型

Ссылка на статью: https://www.shengshu.com/assets/gwm-principles-and-roadmap.pdf

Технический отчёт: https://www.shengshu.com/zh/general-world-model/

В статье ключевые способности общей мировой модели обобщаются как понимание, воображение и действие. Модель должна сформировать суждение о текущем мире на основе исторических наблюдений, смоделировать возможные будущие различных выборов, предпринять действия, а затем использовать новые наблюдения для самокоррекции.

В рамках этой структуры генерация видео, интерактивное взаимодействие в реальном времени, предсказание в латентном пространстве и управление роботом можно рассматривать как разные этапы на одном и том же пути развития способностей.

Насколько мировые модели далеки от общего интеллекта, также преобразуется в более конкретные вопросы: Может ли она поддерживать связный мир? Может ли она предсказывать последствия вмешательств? Может ли она учиться на реальной обратной связи? И может ли она постепенно формировать цели и организовывать более сложные действия?

Первые принципы мировых моделей

Многие люди имели опыт обучения езде на велосипеде.

Сначала тело всегда шатается. Видя, как руль наклоняется в одну сторону, и чувствуя, как центр тяжести тела начинает опускаться, человек немедленно корректирует направление, а затем продолжает исправлять на основе новой обратной связи. С большей практикой мозг постепенно учится предугадывать, какой результат принесёт определённое действие.

Именно в этом заключается самое базовое значение мировой модели.

В 1943 году Кеннет Крейк предположил, что люди формируют в своём сознании «модели небольшого масштаба» реальности, используя их для моделирования возможных исходов различных действий. POMDP в обучении с подкреплением дополнительно описывает этот процесс: агент получает частичные наблюдения, оценивает состояние мира, предпринимает действия, а затем обновляет своё суждение на основе новых наблюдений.

Команда Чжу Цзюня обобщает эту логику как три основные способности общей мировой модели, которые связаны друг с другом и образуют непрерывно обновляющийся замкнутый цикл:

Понимание: интеграция такой информации, как зрение, язык, звук, осязание или сенсоры робота, во внутреннее суждение о текущем мире;

Воображение: моделирование множества возможных будущих из текущего состояния, особенно «что произошло бы, если бы я предпринял действие A вместо действия B»;

Действие: превращение предсказаний во вмешательства в цифровой или физической среде и позволение новым наблюдениям после действия, в свою очередь, проверять и корректировать модель.

世界模型

Три основные способности общей мировой модели образуют замкнутый цикл: понимание отвечает за вывод текущего состояния, воображение отвечает за предсказание возможных будущих, а действие изменяет мир и предоставляет новые доказательства для следующего раунда понимания.

Именно поэтому генерация видео не является всей сущностью мировой модели.

Видеомодели могут ответить, как может выглядеть следующая

Laihua
сцена, но чтобы двигаться к общей мировой модели, она также должна отвечать на вопросы вроде «Если я изменю это условие, перемещу этот объект или применю это действие, чем мир будет отличаться?» Только предсказания с такими условиями действия затрагивают причинность, контрфактичность и исполняемое принятие решений.

Понимание, воображение, действие — как они образуют замкнутый цикл?

Чтобы описать, как развиваются мировые модели, команда Чжу Цзюня дополнительно предложила пятиуровневую дорожную карту, а именно от L1, генерирующего мир, L2, взаимодействующего с миром, и L3, действующего в мире, постепенно продвигаясь к L4 автономным мировым агентам и L5 мировым организаторам.

世界模型

Это более интуитивно понятно на примере стеклянного стакана, подтолкнутого к краю стола.

Модель L1 может генерировать непрерывную последовательность того, как чашка соскальзывает, ударяется и разбивается; модель L2 может продолжать развивать этот мир после того, как пользователь меняет точку зрения или направление толчка; на уровне L3 модель должна определять, упадёт ли чашка, предсказывать, успеет ли протянутая рука, и выдавать действие захвата, которое робот действительно может выполнить. Только после выполнения действия она узнает, были ли её суждения о весе чашки, трении и времени захвата правильными.

Поднимаясь ещё выше, L4 больше не просто ждёт инструкций от людей; она должна уметь обнаруживать риски, активно наблюдать, дополнять информацию и пересматривать стратегии после неудач. L5 далее сталкивается с многоагентным взаимодействием, например, кто хватает чашку, кто избегает препятствий, кто распределяет инструменты и как перераспределить задачи после изменения среды.

Значение этой дорожной карты в том, что она превращает «мировую модель» из существительного в набор вопросов, которые можно проверять уровень за уровнем.

L1 смотрит, связны ли генерируемые траектории, L2 — может ли мир непрерывно реагировать, L3 — может ли модель изменять физическую среду, L4 — может ли система активно исследовать и непрерывно учиться, а L5 — может ли она организовывать многоагентное взаимодействие в открытых средах.

世界模型

Формальные цели моделирования и приобретаемые возможности пятиуровневой дорожной карты для общих мировых моделей (GWM).

Согласно суждению, приведённому в статье, существующие системы уже достигли первых трёх уровней, тогда как L4 и L5 остаются открытыми проблемами. Основные пробелы включают причинно-следственную и физическую обоснованность, постоянную память, онлайн-обучение, эффективное развёртывание и контроль безопасности. Оценка также должна сравнивать предсказания с реальными результатами и изучать переносимость модели на незнакомые задачи, среды и воплощения.

От видео к воплощению: две проверки одной и той же гипотезы

Сложность мировых моделей не только в алгоритмах.

Интернет-видео огромно по масштабу и фиксирует широкий спектр объектов, людей, сцен и движений. Модели могут учиться на нём пространственной структуре, постоянству объектов, поведению людей и тому, как обычно разворачиваются события, но видео редко одновременно фиксирует действия, силы и намерения, вызывающие изменения. Траектории роботов могут связывать наблюдения, действия и результаты, но затраты на сбор выше, и они легко привязываются к конкретному оборудованию и задачам.

Путь, предложенный командой Чжу Цзюня, состоит в том, чтобы поместить эти два типа данных в пирамиду данных, движущуюся от наблюдения к действию.

世界模型

Пирамида данных общих мировых моделей (GWM) и её связь с пятиуровневой дорожной картой возможностей.

Внизу находится видео интернет-масштаба, используемое для приобретения знаний о мире и динамических приоров. Выше него по порядку идут доменное видео, видео от первого лица, демонстрации людей с записями действий и на вершине — данные реального взаимодействия роботов. Чем выше, тем реже и дороже данные, но тем яснее соответствие между действиями, задачами и воплощениями роботов.

Это объясняет, почему Shengshu Technology продвигает как генерацию видео, так и воплощённый интеллект: видео обеспечивает широту знаний о мире, а данные роботов завершают привязку действий.

В цифровом мире серия

Vidu
продолжает исследовать генерацию и взаимодействие с визуальным миром. Видео — это не конечная точка моделей мира, но важная отправная точка, позволяющая моделям учиться тому, как объекты, сцены, движения и события развиваются в условиях крупномасштабных пространственно-временных изменений.

Vidu
S1 дополнительно продвигает одноразовую генерацию к отклику в реальном времени, позволяя пользовательскому вводу непрерывно изменять последующее содержание и проверяя, может ли модель поддерживать непрерывность состояния во время взаимодействия.

В физическом мире Motus и Motubrain соединяют понимание окружающей среды, прогнозирование состояния и действия робота в единый конвейер. Модель должна ясно видеть окружающую среду, предсказывать последствия вмешательства, затем переводить суждения в исполняемые действия и подвергать их проверке реальными результатами.

世界模型

Существующие репрезентативные системы, реализующие L1–L3.

Таким образом, две продуктовые линии образуют две проверки одной и той же гипотезы о модели мира. Цифровая среда проверяет, может ли модель понимать и воображать мир, а физическая среда проверяет, может ли это знание поддерживать действие и корректироваться через обратную связь.

Чтобы два типа верификации могли совместно использовать базовые возможности, изображения, видео, язык и действия робота должны вычисляться совместно вокруг одного и того же состояния мира. Традиционные модульные системы передают информацию уровень за уровнем, что легко теряет геометрическую, временную информацию и информацию о неопределённости на интерфейсах. Полное совместное использование параметров для всех модальностей также может вызвать конфликты при обучении, позволяя огромным объёмам видеоданных подавлять редкие сигналы робота.

Предложенная командой Чжу Цзюня архитектура MoT (Mixture-of-Transformers) пытается найти баланс между этими двумя подходами. Разные модальности сохраняют собственные экспертные параметры, а затем обмениваются контекстом через общий механизм внимания. Зрение сообщает модели, что происходит в окружающей среде, язык задаёт цели и ограничения, а действие вносит вмешательство в среду; эти три типа информации совместно обновляют суждение модели о мире.

MoT обеспечивает основу для унифицированных вычислений, но физические законы, перенос между различными воплощениями, вывод в реальном времени и управление безопасностью всё ещё нуждаются в решении через данные, обучение и системную инженерию. Цель, на которую он указывает, очень ясна: универсальная модель мира нуждается в состоянии мира, которое может совместно читаться и записываться разными модальностями и непрерывно обновляться.

Motus2:

Позвольте роботам, прежде чем действовать,

сначала попробовать это в своём собственном мире

Если Motus и Motubrain продвинули исследование модели мира Shengshu до L3, позволив роботам генерировать действия на основе понимания окружающей среды и прогнозирования будущего, то недавно предложенный Motus2 дополнительно добавляет оценку результатов и обратную связь по политике, пытаясь придать циклу действий способность к самоулучшению.

Motus2 не делает генерацию действий, моделирование будущего и оценку результатов тремя взаимно независимыми системами. Вместо этого он использует единую видеодейственную модель с общими параметрами, чтобы предоставить три управляющих интерфейса:

Политика (Policy / World-Action Model): предлагает исполняемые кандидатные действия;

Симулятор (Simulator / Action-Conditioned World Model): предсказывает возможные последствия этих действий в визуальном мире;

Оценщик (Evaluator / Value Model): определяет, какой результат ближе к цели задачи, и использует это суждение для выбора и улучшения.

Можно думать об этом как о настоящем случае «сначала разум, затем руки».

Робот больше не просто выдаёт действие напрямую, увидев объект. Вместо этого он сначала предлагает несколько возможных планов, проигрывает в модели изображения и прогресс задачи, к которым приведёт каждый из них, а затем выбирает лучший шаг. После выполнения успех, неудача и неидеальные результаты больше не являются просто потерянными данными, а становятся свидетельствами для следующего раунда моделирования динамики и обучения ценности.

Действие, предсказание, оценка, обратная связь и повторное действие таким образом входят в один и тот же цикл принятия решений и обучения, что также является замкнутым циклом самоэволюции, подчёркиваемым Motus2.

На стороне данных Motus2 использует иерархический путь обучения, расширяясь от монокулярного видео от первого лица к синхронизированным бинокулярным данным от первого лица, а затем завершая адаптацию воплощения через данные робота. Для его обучения используется около 130 000 часов записей от первого лица человека, а также более 100 часов траекторий робота и данных выравнивания человек-робот.

Этот путь сначала позволяет модели накопить общий опыт того, как человек взаимодействует с миром, а затем позволяет ей через данные робота узнать, как это тело превращает понимание в действие.

世界模型

На стороне выполнения Motus2 также использует независимого лёгкого тактильного эксперта для уточнения коротких действий, которые вот-вот будут выполнены, и предсказания силовой обратной связи после контакта. Зрение хорошо видит, где находятся объекты и как примерно меняется мир, а осязание заполняет самый сложный «последний сантиметр» при контакте, давая модели дополнительный слой коррекции в реальном времени для деликатных операций, таких как нажатие, касание, захват и вращение, выходящих за пределы «способности видеть».

Motus2 всё ещё находится на стадии расширения от L3 к L4. Текущая валидация в основном сосредоточена на конкретных роботах и задачах манипуляции, а автономное формирование целей, постоянная память, обобщение в открытой среде, долгосрочное онлайн-обучение и управление безопасностью остаются неисследованными.

Его основной прогресс заключается в помещении генерации политики, симуляции будущего, оценки ценности и тактильной обратной связи в одну систему, что позволяет роботам проигрывать последствия перед действием и использовать результаты для улучшения стратегий после действия, предоставляя проверяемый путь к автономным мировым агентам уровня L4.

От вероятностного обучения к мировому интеллекту

Китайский технологический путь

Рамки общих мировых моделей также продолжают долгосрочное исследовательское направление, накопленное Чжу Цзюнем и Tsinghua TSAIL.

Профессор Чжу Цзюнь долгое время изучал байесовские методы, вероятностное машинное обучение, генеративные модели и обучение с подкреплением, соответственно имея дело с неопределённостью, распределением данных, генерацией будущего и принятием решений о действиях.

TSAIL также подготовил и оказал влияние на группу исследователей, которые вошли в ведущие мировые команды. Сун Ян сотрудничал с Чжу Цзюнем в исследованиях байесовского обучения в годы своей undergraduate, а Сун Цзямин также участвовал в связанной работе в период undergraduate, позже оказав важное влияние в направлениях генеративных моделей на основе score и DDIM соответственно.

От вероятностного моделирования к генерации и принятию решений эта академическая линия также отражает два типа точек входа для развития AGI. Один начинается с языка и постепенно усиливает возможности рассуждения, вызова инструментов и выполнения задач; другой начинается со зрения и динамического мира и продолжается в направлении взаимодействия в реальном времени и воплощённого действия.

В ландшафте китайской индустрии AGI Zhipu и Shengshu можно рассматривать как представителей двух путей. Zhipu начинается с языковых моделей и непрерывно усиливает возможности рассуждения, Coding и Agent; Shengshu начинается с генерации видео и далее входит в взаимодействие в реальном времени, воплощённое действие и оптимизацию политики.

Эти два маршрута проникают друг в друга. Языковым Agent'ам нужна визуальная обратная связь и модели среды, а мировым моделям также нужен язык для выражения целей, правил и планов. Разные точки входа в конечном итоге все указывают на совместное моделирование языка, состояния мира и действия.

Заключение

Конкуренция в мировых моделях в конечном итоге сместится от шокового эффекта демо к способности систем выдерживать обратную связь.

Изображения могут создавать достоверное первое впечатление, геометрия и физика определяют, можно ли использовать этот мир многократно, а действие воплощает суждение модели в реальность. Подтвердится ли предсказание, можно узнать только после того, как произойдёт вмешательство; успешность задачи также должна быть проверена в незнакомых сценариях, при долгосрочной работе и непрерывных изменениях.

Работа команды Чжу Цзюня не даёт окончательного ответа на спор о моделях мира, но предлагает набор вопросов, которые можно продолжать проверять: что понимает модель, насколько далеко она может вообразить и может ли она исправить себя после действия.

За последнее десятилетие наиболее важный прогресс в области ИИ был достигнут благодаря изучению закономерностей в языке и данных. На следующем этапе моделям также придётся иметь дело с непрерывно меняющейся средой. Когда модели смогут постоянно формировать суждения, нести последствия действий и продолжать учиться в такой среде, модели мира постепенно превратятся из перегруженного технического термина в основу на пути к общему искусственному интеллекту.

Эта статья взята из публичного аккаунта WeChat «机器之心» (ID: almosthuman2014), автор: Ян Вэнь