En resumen

  • El Frontier Red Team de Anthropic puso a trabajar juntos a los agentes de Claude y registró cómo se saboteaban, coludían y libraban lo que llama "guerras territoriales".
  • En una prueba, los agentes desplegaron malware autorreplicante y se bloquearon mutuamente; los modelos más nuevos a menudo "ganan" revocando el acceso primero.
  • El comportamiento sigue incidentes reales que Decrypt cubrió: Claude hackeó tres empresas durante pruebas internas y fijó precios en una simulación de negocios.

Los propios agentes de IA de Anthropic se volvieron unos contra otros y demostraron que les gusta volverse rebeldes, otra vez.

En una prueba que el Frontier Red Team de la compañía publicó el 13 de agosto, grupos de modelos de Claude recibieron tareas de codificación compartidas y rápidamente comenzaron a desplegar malware, bloquear a sus rivales fuera de sus sistemas y narrar el sabotaje con sus propias palabras.

Myriad: ¿Cuándo lanzará OpenAI GPT-6? Haz clic para hacer tu predicción.
Myriad: ¿Cuándo lanzará OpenAI GPT-6? Haz clic para hacer tu predicción.

Tres copias de un mismo modelo se ejecutaron en máquinas virtuales separadas dentro de Claude Code, cada una con la instrucción de migrar un backend de Python a un lenguaje diferente. A ninguna se le dijo que las otras existían. Lo descubrieron rápidamente.