¿Qué es exactamente un modelo del mundo? ¿Cómo lo interpretan Fei-Fei Li, Zhu Jun y otros?

modelo del mundo generalarquitectura de IAaprendizaje robóticoMotusinteligencia encarnadaVidu
hace 1 horaFuente: blockweeks.com
¿Qué es exactamente un modelo del mundo? ¿Cómo lo interpretan Fei-Fei Li, Zhu Jun y otros?

En 2026, "modelo del mundo" es uno de los términos menos consensuados en el mundo de la IA.

Un video que se puede generar de forma continua se denomina modelo del mundo; un entorno digital que cambia en tiempo real con operaciones de teclado y ratón también se denomina modelo del mundo; los sistemas que predicen estados futuros en el espacio latente, así como las políticas que emiten directamente acciones de robots, igualmente usan este nombre.

Todos estos modelos procesan información sobre el mundo, pero sus límites de capacidad están muy distantes entre sí. Las imágenes en videos generados pueden ser lo suficientemente realistas, pero violan las leyes físicas reales; un robot puede completar un agarre, pero también puede estar familiarizado solo con los objetos, las posiciones de cámara y las trayectorias de movimiento en el laboratorio. Si un sistema ha aprendido correlaciones visuales, estructura física o la relación entre acciones y resultados es difícil de responder solo con una demostración.

La confusión conceptual aumenta la dificultad del juicio técnico. La calidad de imagen, la precisión geométrica, la capacidad de predicción y las tasas de éxito de tareas se mezclan para compararlas; diferentes equipos parecen competir en la misma pista, pero en realidad pueden estar respondiendo preguntas diferentes.

Por lo tanto, la investigación sobre modelos del mundo está comenzando a volver a una pregunta básica: ¿qué capacidades debe tener un modelo para pasar de generar contenido a comprender y cambiar el mundo?

Li Feifei y World Labs dividen los modelos del mundo por función en renderizadores, simuladores y planificadores, que producen píxeles, estados del mundo y acciones, respectivamente.

世界模型

Enlace: https://www.worldlabs.ai/blog/taxonomy-of-world-models

LeCun, por el contrario, aboga por aprender estructuras del mundo predecibles en un espacio latente abstracto, permitiendo que el modelo retenga información útil para la comprensión, el razonamiento y la planificación.

世界模型

Enlace: https://ai.meta.com/research/vjepa/

Zhu Jun de la Universidad de Tsinghua ofrece un tercer ángulo. Ya en diciembre pasado, cuando se lanzó Motus, expuso públicamente la visión general de un "modelo general del mundo"; en marzo de este año, lo posicionó como la base que conecta el mundo digital y el mundo físico. Unos meses después, Zhu Jun y su equipo refinaron aún más este marco en el artículo "General World Models from First-Principles", definiendo capacidades centrales desde primeros principios y proporcionando una hoja de ruta evolutiva de cinco niveles.

世界模型

Enlace del artículo: https://www.shengshu.com/assets/gwm-principles-and-roadmap.pdf

Informe técnico: https://www.shengshu.com/zh/general-world-model/

El artículo resume las capacidades centrales de un modelo general del mundo como comprensión, imaginación y acción. Un modelo necesita formar un juicio sobre el mundo actual a partir de observaciones históricas, simular los futuros posibles de diferentes elecciones, tomar acciones y luego usar nuevas observaciones para corregirse a sí mismo.

A lo largo de este marco, la generación de video, la interacción en tiempo real, la predicción en espacio latente y el control de robots pueden considerarse como diferentes etapas en la misma trayectoria de capacidades.

Qué tan lejos están los modelos del mundo de la inteligencia general también se transforma en preguntas más específicas: ¿Puede mantener un mundo coherente? ¿Puede predecir las consecuencias de las intervenciones? ¿Puede aprender de la retroalimentación real? ¿Y puede formar gradualmente objetivos y organizar acciones más complejas?

Los primeros principios de los modelos del mundo

Muchas personas han tenido la experiencia de aprender a andar en bicicleta.

Al principio, el cuerpo siempre se tambalea. Al ver el manillar inclinarse hacia un lado y sentir que el centro de gravedad del cuerpo comienza a hundirse, la persona ajusta inmediatamente la dirección y luego continúa corrigiendo según la nueva retroalimentación. Con más práctica, el cerebro aprende gradualmente a anticipar qué resultado traerá una determinada acción.

Este es precisamente el significado más básico de un modelo del mundo.

En 1943, Kenneth Craik propuso que los humanos forman "modelos a pequeña escala" de la realidad en sus mentes, usándolos para simular los posibles resultados de diferentes acciones. El POMDP en el aprendizaje por refuerzo describe además este proceso: el agente recibe observaciones parciales, estima el estado del mundo, toma acciones y luego actualiza su juicio basándose en nuevas observaciones.

El equipo de Zhu Jun resume esta lógica como las tres capacidades centrales de un modelo del mundo general, que se conectan entre sí y forman un bucle cerrado que se actualiza continuamente:

Comprensión: integrar información como visión, lenguaje, sonido, tacto o sensores robóticos en un juicio interno sobre el mundo actual;

Imaginación: simular múltiples futuros posibles a partir del estado actual, especialmente "qué pasaría si tomara la acción A en lugar de la acción B";

Acción: convertir las predicciones en intervenciones en el entorno digital o físico, y dejar que las nuevas observaciones después de la acción a su vez prueben y corrijan el modelo.

世界模型

Las tres capacidades centrales de un modelo del mundo general forman un bucle cerrado: la comprensión se encarga de inferir el estado actual, la imaginación se encarga de predecir futuros posibles, y la acción cambia el mundo y proporciona nueva evidencia para la siguiente ronda de comprensión.

Esto también explica por qué la generación de video no es la totalidad de un modelo del mundo.

Los modelos de video pueden responder cómo podría verse la próxima

Laihua
escena, pero para avanzar hacia un modelo del mundo general, también necesita responder preguntas como "Si cambio esta condición, muevo este objeto o aplico esta acción, ¿en qué sería diferente el mundo?". Solo las predicciones con condiciones de acción como estas tocan la causalidad, los contrafactuales y la toma de decisiones ejecutable.

Comprender, imaginar, actuar: ¿cómo forman un bucle cerrado?

Para describir cómo evolucionan los modelos del mundo, el equipo de Zhu Jun propuso además una hoja de ruta de cinco niveles, es decir, desde L1 generando el mundo, L2 interactuando con el mundo y L3 actuando en el mundo, avanzando gradualmente hacia L4 agentes autónomos del mundo y L5 organizadores del mundo.

世界模型

Es más intuitivo entender esto con un vaso de vidrio empujado al borde de una mesa.

Un modelo L1 puede generar una secuencia continua de la taza deslizándose, golpeando y rompiéndose; un modelo L2 puede seguir evolucionando este mundo después de que el usuario cambie el punto de vista o la dirección del empuje; en L3, el modelo necesita juzgar si la taza caerá, predecir si extender la mano llegará a tiempo y emitir una acción de agarre que un robot pueda ejecutar realmente. Solo después de actuar sabrá si sus juicios sobre el peso, la fricción y el momento de agarre de la taza eran correctos.

Avanzando más, L4 ya no solo espera instrucciones de las personas; debe ser capaz de descubrir riesgos, observar activamente, complementar información y revisar estrategias después de fallos. L5 se enfrenta además a la colaboración multiagente, como quién agarra la taza, quién evita obstáculos, quién asigna herramientas y cómo reorganizar las tareas después de que cambie el entorno.

La importancia de esta hoja de ruta es que convierte "modelo del mundo" de un sustantivo en un conjunto de preguntas que pueden probarse nivel por nivel.

L1 examina si las trayectorias generadas son coherentes, L2 examina si el mundo puede responder de forma continua, L3 examina si el modelo puede cambiar el entorno físico, L4 examina si el sistema puede explorar activamente y aprender continuamente, y L5 examina si puede organizar la colaboración multiagente en entornos abiertos.

世界模型

Los objetivos de modelado formal y las capacidades adquiridas de la hoja de ruta de cinco niveles para el modelo del mundo general (GWM).

Según el juicio dado en el artículo, los sistemas existentes ya han alcanzado los primeros tres niveles, mientras que L4 y L5 siguen siendo problemas abiertos. Las principales brechas incluyen la fundamentación causal y física, la memoria persistente, el aprendizaje en línea, el despliegue eficiente y el control de seguridad. La evaluación también debe comparar las predicciones con los resultados reales y examinar la transferibilidad del modelo a tareas, entornos y encarnaciones desconocidos.

Del video a la encarnación, dos validaciones de la misma hipótesis

La dificultad de los modelos del mundo no está solo en los algoritmos.

El video de internet es masivo en escala y registra una amplia gama de objetos, personas, escenas y movimientos. Los modelos pueden aprender estructura espacial, permanencia de objetos, comportamiento humano y cómo suelen desarrollarse los eventos a partir de él, pero el video rara vez registra simultáneamente las acciones, fuerzas e intenciones que causan los cambios. Las trayectorias de robots pueden conectar observaciones, acciones y resultados, pero los costos de recolección son mayores y fácilmente quedan atados a hardware y tareas específicos.

La ruta propuesta por el equipo de Zhu Jun es colocar estos dos tipos de datos en una pirámide de datos que va de la observación a la acción.

世界模型

La pirámide de datos del modelo del mundo general (GWM) y su relación con la hoja de ruta de capacidades de cinco niveles.

En la base está el video a escala de internet, utilizado para adquirir conocimiento del mundo y prioridades dinámicas. Por encima, en orden, están el video de dominio, el video humano en primera persona, las demostraciones humanas con registros de acciones y, en la cima, los datos de interacción real de robots. Cuanto más arriba se sube, más escasos y costosos son los datos, pero más clara es la correspondencia entre acciones, tareas y encarnaciones de robots.

Esto explica por qué Shengshu Technology impulsa tanto la generación de video como la inteligencia encarnada: el video proporciona la amplitud del conocimiento del mundo, mientras que los datos de robots completan la fundamentación de la acción.

En el lado del mundo digital,

Vidu
la serie continúa explorando la generación e interacción con el mundo visual. El video no es el punto final de los modelos del mundo, pero es un punto de partida importante, que permite a los modelos aprender cómo los objetos, escenas, movimientos y eventos evolucionan en medio de cambios espacio-temporales a gran escala.

Vidu
S1 lleva aún más la generación de una sola vez a la respuesta en tiempo real, permitiendo que la entrada del usuario cambie continuamente el contenido posterior y poniendo a prueba si el modelo puede mantener la continuidad del estado durante la interacción.

En el lado del mundo físico, Motus y Motubrain conectan la comprensión del entorno, la predicción del estado y las acciones del robot en el mismo pipeline. El modelo necesita ver claramente el entorno, predecir las consecuencias de la intervención, luego traducir los juicios en acciones ejecutables y someterlos a la validación de resultados reales.

世界模型

Sistemas representativos existentes que realizan L1 a L3.

Las dos líneas de productos forman así dos validaciones de la misma hipótesis de modelo del mundo. El entorno digital pone a prueba si el modelo puede comprender e imaginar el mundo, mientras que el entorno físico pone a prueba si este conocimiento puede respaldar la acción y ser revisado mediante retroalimentación.

Para permitir que los dos tipos de verificación compartan capacidades subyacentes, las imágenes, el video, el lenguaje y las acciones del robot necesitan computar de forma colaborativa en torno al mismo estado del mundo. Los sistemas modulares tradicionales pasan información nivel por nivel, lo que fácilmente pierde información geométrica, temporal y de incertidumbre en las interfaces. Compartir completamente los parámetros entre todas las modalidades también puede causar conflictos de entrenamiento, permitiendo que los macrodatos de video supriman las escasas señales del robot.

La arquitectura MoT (Mixture-of-Transformers) propuesta por el equipo de Zhu Jun intenta lograr un equilibrio entre las dos. Las diferentes modalidades conservan sus propios parámetros expertos, luego intercambian contexto a través de un mecanismo de atención compartido. La visión le dice al modelo qué está sucediendo en el entorno, el lenguaje proporciona objetivos y restricciones, y la acción lleva la intervención al entorno; los tres tipos de información actualizan conjuntamente el juicio del modelo sobre el mundo.

MoT proporciona la base para la computación unificada, pero las leyes físicas, la transferencia entre encarnaciones, la inferencia en tiempo real y el control de seguridad aún deben resolverse mediante datos, entrenamiento e ingeniería de sistemas. El objetivo al que apunta es muy claro: un modelo general del mundo necesita un estado del mundo que pueda ser leído y escrito conjuntamente por diferentes modalidades y actualizado continuamente.

Motus2:

Deja que los robots, antes de actuar,

primero lo prueben en su propio mundo

Si Motus y Motubrain llevaron la exploración del modelo del mundo de Shengshu a L3, permitiendo a los robots generar acciones basadas en la comprensión del entorno y la predicción del futuro, entonces el recientemente propuesto Motus2 añade además la evaluación de resultados y la retroalimentación de políticas, intentando dotar al bucle de acción de capacidad de automejora.

Motus2 no convierte la generación de acciones, la simulación futura y la evaluación de resultados en tres sistemas mutuamente independientes. En su lugar, utiliza un único modelo de video-acción con parámetros compartidos para exponer tres interfaces de control:

Política (Policy / World-Action Model): propone acciones candidatas ejecutables;

Simulador (Simulator / Action-Conditioned World Model): predice las posibles consecuencias de estas acciones en el mundo visual;

Evaluador (Evaluator / Value Model): juzga qué resultado está más cerca del objetivo de la tarea, y utiliza este juicio para la selección y mejora.

Puedes pensarlo como un caso real de "primero la mente, luego las manos".

El robot ya no simplemente da una acción directamente después de ver un objeto. En cambio, primero propone varios planes candidatos, ensaya en el modelo las imágenes y el progreso de la tarea que cada uno traería, y luego elige el mejor paso. Después de la ejecución, el éxito, el fracaso y los resultados menos que ideales ya no son solo datos desperdiciados, sino que se convierten en evidencia para la siguiente ronda de modelado de dinámicas y aprendizaje de valor.

Acción, predicción, evaluación, retroalimentación y reacción entran así en el mismo bucle de decisión y aprendizaje, que es también la autoevolución en bucle cerrado enfatizada por Motus2.

En el lado de los datos, Motus2 adopta una ruta de entrenamiento jerárquica, expandiéndose desde video monocular en primera persona hasta datos binoculares sincronizados en primera persona, y luego completando la adaptación de encarnación mediante datos de robots. Su entrenamiento utiliza aproximadamente 130.000 horas de grabaciones humanas en primera persona, así como más de 100 horas de trayectorias de robots y datos de alineación humano-robot.

Esta ruta primero permite al modelo acumular una experiencia compartida de cómo los humanos interactúan con el mundo, y luego le permite aprender mediante datos de robots cómo este cuerpo convierte la comprensión en acción.

世界模型

En el lado de la ejecución, Motus2 también utiliza un experto táctil ligero e independiente para refinar las acciones cortas que están a punto de ejecutarse y predecir la retroalimentación de fuerza después del contacto. La visión es buena para ver dónde están los objetos y aproximadamente cómo cambia el mundo, mientras que el tacto llena el "último centímetro" más difícil cuando ocurre el contacto, dando al modelo una capa adicional de corrección en tiempo real para operaciones delicadas como presionar, tocar, agarrar y rotar más allá de "ser capaz de ver".

Motus2 todavía está en la etapa de extenderse de L3 a L4. La validación actual se concentra principalmente en robots específicos y tareas de manipulación, y la formación autónoma de objetivos, la memoria persistente, la generalización en entornos abiertos, el aprendizaje en línea a largo plazo y el control de seguridad aún están por explorarse.

Su principal avance es colocar la generación de políticas, la simulación futura, la evaluación de valor y la retroalimentación táctil en el mismo sistema, permitiendo a los robots ensayar las consecuencias antes de actuar y usar los resultados para mejorar las estrategias después de actuar, proporcionando una ruta comprobable hacia agentes autónomos del mundo L4.

Del aprendizaje probabilístico a la inteligencia del mundo

Una ruta tecnológica china

El marco de los modelos mundiales generales también continúa la dirección de investigación a largo plazo acumulada por Zhu Jun y Tsinghua TSAIL.

El profesor Zhu Jun ha estudiado durante mucho tiempo métodos bayesianos, aprendizaje automático probabilístico, modelos generativos y aprendizaje por refuerzo, abordando respectivamente la incertidumbre, la distribución de datos, la generación futura y la toma de decisiones de acción.

TSAIL también ha formado e influido en un grupo de investigadores que han entrado en los equipos líderes del mundo. Song Yang colaboró con Zhu Jun en investigación sobre aprendizaje bayesiano durante sus años de pregrado, y Song Jiaming también participó en trabajos relacionados durante su período de pregrado, produciendo posteriormente impactos importantes en modelos generativos basados en puntuaciones y direcciones DDIM respectivamente.

Desde el modelado probabilístico hasta la generación y la toma de decisiones, este linaje académico también refleja dos tipos de puntos de entrada para el desarrollo de la AGI. Uno comienza desde el lenguaje y mejora gradualmente las capacidades de razonamiento, llamada de herramientas y ejecución de tareas; el otro comienza desde la visión y el mundo dinámico y continúa hacia la interacción en tiempo real y la acción encarnada.

Dentro del panorama de la industria de la AGI en China, Zhipu y Shengshu pueden verse como representantes de los dos caminos. Zhipu parte de modelos de lenguaje y mejora continuamente las capacidades de razonamiento, Coding y Agent; Shengshu parte de la generación de video y avanza hacia la interacción en tiempo real, la acción encarnada y la optimización de políticas.

Las dos rutas se penetran mutuamente. Los Agentes de lenguaje necesitan retroalimentación visual y modelos de entorno, y los modelos mundiales también necesitan lenguaje para expresar objetivos, reglas y planes. Diferentes puntos de entrada finalmente apuntan todos al modelado conjunto de lenguaje, estado del mundo y acción.

Conclusión

La competencia en modelos mundiales finalmente pasará del factor de impacto de las Demos a la capacidad de los sistemas para soportar la retroalimentación.

Las imágenes pueden crear una primera impresión creíble, la geometría y la física determinan si este mundo puede usarse repetidamente, y la acción lleva el juicio del modelo a la realidad. Si una predicción se sostiene debe esperar hasta después de que ocurra la intervención para confirmarse; si una tarea tiene éxito también debe probarse en escenarios desconocidos, operación a largo plazo y cambio continuo.

El artículo del equipo de Zhu Jun no escribe la respuesta final al debate sobre los modelos del mundo, pero proporciona un conjunto de preguntas que pueden seguir poniéndose a prueba: qué entiende el modelo, hasta dónde puede imaginar y si puede corregirse a sí mismo después de actuar.

Durante la última década, el progreso más importante en la IA ha provenido del aprendizaje de patrones en el lenguaje y los datos. En la siguiente etapa, los modelos también tendrán que enfrentarse a entornos en continuo cambio. Cuando los modelos puedan formar juicios de manera continua, asumir las consecuencias de las acciones y seguir aprendiendo en tales entornos, los modelos del mundo pasarán gradualmente de ser un término técnico saturado a una base en el camino hacia la inteligencia general.

Este artículo proviene de la cuenta pública de WeChat "机器之心" (ID: almosthuman2014), autor: Yang Wen