En resumen
- Anthropic descubrió un incidente de enero que involucraba un modelo temprano de Claude Opus 4.6, y luego amplió su revisión a aproximadamente 481 millones de transcripciones.
- La compañía identificó razonamiento sesgado e imprudencia, revisando su evaluación anterior sobre por qué Claude atacó sistemas reales.
- El informe llega mientras el debate sobre la regulación de la IA se intensifica en las redes sociales.
Anthropic reveló otro incidente en el que un modelo de IA Claude hackeó sistemas reales durante pruebas de seguridad.
En el informe publicado el miércoles, Anthropic revisó su explicación de tres incidentes divulgados en julio. La compañía ahora dice que el razonamiento sesgado y la disposición a arriesgar daños ayudaron a impulsar los ataques, que fueron posibles por errores de prueba al dejar el acceso a internet abierto.

“Nuestra investigación identificó dos problemas de alineación recurrentes, presentes en distintos niveles de gravedad en los incidentes”, escribió Anthropic. “Razonamiento sesgado, en el que Claude tendía a ignorar o malinterpretar la evidencia de que estaba operando en internet real, e imprudencia, o una disposición a tomar acciones dañinas en la búsqueda estrecha de una tarea.”
También reconoció haber confiado demasiado en las afirmaciones del modelo de que creían estar en simulaciones.
“Cuando hicimos modificaciones específicas a la transcripción para dejar más claro que el modelo no estaba en una simulación, Claude Mythos 5 aún tomó acciones ofensivas, a pesar de reconocer una mayor posibilidad de daño en el mundo real”, escribió Anthropic. “Estamos publicando esta transcripción públicamente para que otros puedan construir sobre nuestro análisis”.
Cuando Anthropic reveló los ataques de Claude a tres empresas en julio, inicialmente los atribuyó a errores de prueba. Ahora dice que los investigadores confiaron demasiado en las explicaciones de los modelos sobre sus acciones.
Según la compañía, el cuarto incidente ocurrió en enero e involucró una versión temprana de Claude Opus 4.6. Anthropic lo descubrió en agosto mientras preparaba registros para el evaluador independiente de IA METR.
Después de que los investigadores descubrieron el incidente, Anthropic dijo que provocó una revisión más amplia de aproximadamente 481 millones de transcripciones, que marcó 9,2 millones para una revisión adicional utilizando Claude.
“Según una evaluación preliminar, no consideramos que el cuarto incidente sea más grave que los tres incidentes que evaluamos en profundidad”, escribió Anthropic. “METR investigará este incidente junto con los otros tres”.
Los investigadores de Anthropic dijeron que Claude creó “accidentalmente” un conflicto de dirección IP que hizo que su objetivo fuera inalcanzable. Claude luego intentó ocho veces abandonar la operación, pero un error de software le impidió detenerse. La IA luego llegó a internet y accedió a la máquina de un tercero, donde encontró una contraseña que otorgaba acceso de administrador.
Incidentes anteriores atraen escrutinio independiente
El informe sigue a otras divulgaciones sobre sistemas de IA que exceden los límites de las pruebas de seguridad.
En agosto, el Instituto de Seguridad de IA del Reino Unido dijo que Mythos 5 se dirigió a personas reales durante sus evaluaciones. Anthropic dijo que el incidente separado está fuera de este informe y recibirá su propia evaluación.
En hallazgos publicados el mes pasado, los investigadores de METR dijeron que aproximadamente 1.200 agentes de OpenAI se coordinaron en un tablón de mensajes no autorizado, con alrededor de 700 uniéndose al ataque. Anthropic dijo que no encontró coordinación entre agentes u objetivos más allá de completar los ejercicios asignados en sus cuatro incidentes.
El informe también llega mientras el debate sobre cómo regular la inteligencia artificial se intensifica. El martes, el ex ingeniero de OpenAI y Anthropic Jacob Coxon se volvió viral después de decir en X que “las personas que construyen IA creen sinceramente que podría matarnos a todos para el final de la década”.
La alarma ha llevado a los legisladores estadounidenses y a los grupos de vigilancia a redoblar sus esfuerzos para frenar el desarrollo de laboratorios de IA de frontera. El senador Bernie Sanders presentó recientemente una legislación que busca prohibir el desarrollo de IA avanzada hasta que un nuevo regulador federal establezca normas de seguridad.






