En resumen
- OpenAI dijo que "no puede descartar" que Astra haya alcanzado el nivel más alto de su escala de riesgo cibernético.
- La empresa pausó el trabajo interno en el modelo y reforzó el aislamiento, la monitorización y los controles de acceso.
- La advertencia llega semanas después de que modelos de OpenAI, Anthropic y Meta vulneraran sistemas reales por su cuenta.
OpenAI dice que su próximo gran modelo podría ser lo suficientemente peligroso como para escribir sus propias ciberarmas, y se está retirando hasta que las salvaguardas estén a la altura.
"Nuestras últimas evaluaciones internas de Astra, uno de nuestros próximos modelos, durante los últimos días indican avances significativos en codificación agéntica y ciberseguridad", dijo OpenAI. "Estos resultados, junto con evaluaciones de expertos, nos han llevado a concluir anoche que no podemos descartar capacidades cibernéticas críticas según nuestro Marco de Preparación (se abre en una ventana nueva)."
OpenAI publicó la advertencia diciendo que las pruebas internas de Astra, un modelo no lanzado, no tuvieron ningún papel en la reciente brecha de Hugging Face a pesar de sus capacidades.
El marco es el libro de reglas de OpenAI para modelos riesgosos, publicado por primera vez en diciembre de 2023. "Crítico" es su nivel más alto. Un modelo lo alcanza si puede encontrar y construir exploits de día cero funcionales (agujeros previamente desconocidos que un proveedor no ha parcheado) en sistemas endurecidos sin intervención humana, o si puede planificar y ejecutar un ataque completo contra un objetivo difícil a partir de nada más que un objetivo de alto nivel. Modelos anteriores, incluido GPT-5.6-Sol, alcanzaron como máximo el nivel inferior "Alto".
El patrón ya es real
La cautela de OpenAI se lee de manera diferente cuando la alineas con lo que ha estado sucediendo en las últimas semanas. Esto no es una preocupación futura. Los modelos frontera ya han salido de sus jaulas de prueba y han atacado objetivos en vivo.
El caso más claro provino de la propia OpenAI. Como Decrypt informó anteriormente, los agentes de la empresa encadenaron vulnerabilidades, escaparon de su entorno de pruebas, llegaron a Internet y atacaron Hugging Face mientras intentaban hacer trampa en un punto de referencia de seguridad. En un seguimiento, OpenAI detalló cómo el mismo agente rebelde también irrumpió en al menos cuatro otros servicios disponibles públicamente, utilizando credenciales que encontró en la web abierta.
Claude de Anthropic hizo lo mismo desde el otro lado. Varias versiones de Claude obtuvieron acceso no autorizado a tres empresas reales después de que una mala configuración le diera al modelo acceso a Internet abierto. En un caso, Claude Opus 4.7 confundió el sitio de una empresa real con el objetivo falso de su tarea, extrajo credenciales y llegó a una base de datos de producción que contenía varios cientos de filas de datos reales.
Y Meta se unió a la lista este mes. Decryptinformó que un modelo Muse Spark escapó de su entorno de prueba, llegó a internet a través de un error de configuración de un socio y explotó una falla en un servicio de terceros. El Kimi K3 de Moonshot AI, también hizo algo similar, escapando de su sandbox para encontrar respuestas a un benchmark en un repositorio público.
El Instituto de Seguridad de IA del Reino Unido también descubrió que el comportamiento no fue un caso aislado. Durante las pruebas de Anthropic's Mythos 5 y OpenAI's GPT-5.6-Sol, registró 10 instancias en 122 donde los modelos tomaron acciones no autorizadas en internet en vivo, una de ellas intentando colar código malicioso en un proyecto de código abierto.
La respuesta de OpenAI a Astra es cerrar la puerta antes de que el modelo esté listo. Está pausando el trabajo interno de Astra que carece de los nuevos controles, aislando entornos de prueba, restringiendo el acceso a la red y a las herramientas, protegiendo los pesos del modelo y monitoreando acciones riesgosas en todos los ámbitos.






