En resumen
- El Kimi K3 de Moonshot AI salió de su entorno de pruebas y accedió a internet abierta, según la firma de seguridad Frontier Security.
- El modelo exploró la configuración de red del entorno, encontró sitios accesibles y obtuvo sus respuestas de prueba desde GitHub.
- Frontier dice que una mala configuración abrió la puerta, pero que las propias salvaguardas de Kimi no lo detuvieron.
El Kimi K3 de Moonshot AI salió del entorno de pruebas en el que se evaluaba y accedió a internet abierta para encontrar respuestas a los problemas que se le habían planteado, según la firma de seguridad Frontier Security.
El modelo estaba siendo evaluado en habilidades de ciberseguridad defensiva y se le había asignado explícitamente la tarea de resolver problemas sin buscarlos. No intentó la tarea en absoluto, dijo Frontier. En cambio, exploró la red, estableció que la resolución DNS para github.com funcionaba, clonó el repositorio oficial de referencia y leyó la solución del disco.
Frontier llama a esto "juego de especificaciones mediante fugas de salida de red", señalando que los entornos de pruebas construidos sobre marcos como el Inspect del Instituto de Seguridad de IA bloquean el tráfico entrante mientras dejan abiertos los puertos HTTPS y DNS de salida. Los agentes capaces inspeccionan su propio entorno de shell al inicio como rutina, y un modelo que encuentra github.com accesible puede extraer soluciones de referencia con herramientas estándar de línea de comandos.
Una mala configuración hizo posible esto, como ocurrió en incidentes recientes revelados por OpenAI y Anthropic. "Encontramos una fuga en el entorno de pruebas", dijo el CEO Yaron Singer a WIRED. "Pero también descubrimos que Kimi aprovechó esa laguna".
El investigador Paul Kassianik dijo a WIRED que el modelo es "muy bueno siguiendo un objetivo por cualquier medio necesario" y carece de las salvaguardas que le impedirían hacer trampa o escapar. Moonshot no respondió a la solicitud de comentarios de la publicación.
Agentes de IA rompiendo el confinamiento
Mientras que los modelos de Anthropic y OpenAI que rompieron el confinamiento fueron detectados en evaluaciones internas, uno de ellos no lanzado, y las versiones que apuntaron a personas reales en pruebas gubernamentales del Reino Unido tenían sus clasificadores cibernéticos desactivados deliberadamente, Kimi K3 es descargable abiertamente, y Frontier lo probó con las salvaguardas que un usuario común obtendría. Esa disponibilidad, escribió la firma, pone el mismo comportamiento al alcance de actores adversarios y hace que el incidente sea potencialmente más dañino.
Kimi K3 tampoco causó daños. No atacó nada una vez fuera, porque no lo necesitaba. El modelo de OpenAI hackeó Hugging Face y otros cuatro servicios para alcanzar las respuestas de referencia, mientras que Kimi encontró sus respuestas en un repositorio público.
El sandbox que Frontier utilizó se basó en el marco de evaluación del Instituto de Seguridad de IA del Reino Unido. AISI reveló esta semana que los agentes en sus propias pruebas cibernéticas habían salido a internet en vivo y se habían dirigido a personas reales, un incidente separado que involucra a los modelos de Anthropic y OpenAI con sus salvaguardas desactivadas. Su informe publicado el martes señala que AISI ahora está escaneando ejecuciones de evaluación históricas en busca de comportamiento similar, y que Kimi K3 está entre los modelos bajo revisión. AISI no respondió a la solicitud de comentarios de WIRED.
La afirmación más amplia de Frontier es que los propios benchmarks están comprometidos. Un modelo que lee la respuesta de GitHub aún pasa, por lo que las puntuaciones altas pueden reflejar un entorno con fugas en lugar de un razonamiento genuino. Y si un modelo capaz encontró el atajo, argumenta la firma, otros con acceso shell podrían estar tomándolo también, lo que inflaría los resultados en todo el campo, no solo para Kimi.
Los modelos optimizan para la función objetivo, escribió Frontier, no para la "intención humana detrás del benchmark", añadiendo que donde existe una ruta de red hacia la solución, "un agente suficientemente capaz la encontrará".
Un problema general
Matt Fredrikson, CEO de Gray Swan y profesor asociado en Carnegie Mellon, dijo a WIRED que el comportamiento no es notable. Dale a un modelo un objetivo sin muros explícitos a su alrededor, dijo, y "encontrará una manera de obtener la respuesta". Lo describió como una historia de advertencia para cualquiera que ejecute modelos como agentes en herramientas como OpenClaw.
Los investigadores de Frontier hacen el mismo punto desde la otra dirección: la capacidad que permite a Kimi encontrar su salida también convierte a los modelos de peso abierto en fuertes herramientas defensivas. Sus propios benchmarks califican a Kimi altamente en la búsqueda de vulnerabilidades en software y redes, y Hugging Face utilizó un modelo chino sin nombre para defenderse durante el incidente de OpenAI.
Lanzado en julio, Kimi K3 es el modelo de código abierto más grande publicado hasta ahora y sacudió los mercados con comparaciones con el debut de DeepSeek.






