En resumen

  • Claude accedió a sistemas reales después de que los entornos de pruebas de ciberseguridad expusieran los modelos a Internet.
  • Anthropic pausó las evaluaciones de alto riesgo y añadió un aislamiento, monitoreo y controles más fuertes para los evaluadores externos.
  • Las pruebas sugieren que el hackeo de recompensas durante el entrenamiento puede hacer que los modelos estén más dispuestos a tomar acciones dañinas para completar una tarea.

Anthropic reforzó sus salvaguardas de pruebas y entrenamiento después de que los modelos Claude obtuvieran acceso no autorizado a sistemas informáticos durante evaluaciones de ciberseguridad.

En una publicación de blog del lunes, Anthropic dijo que los incidentes reflejaban fallas de seguridad operativa y dos fallas de alineación: razonamiento motivado y una disposición a causar daño.

Myriad: ¿Cuándo lanzará OpenAI GPT-6? Haz clic para hacer tu predicción.
Myriad: ¿Cuándo lanzará OpenAI GPT-6? Haz clic para hacer tu predicción.

"Aunque no creemos que estos incidentes representen únicamente problemas operativos, nuestra primera prioridad fue abordar problemas específicos de contención y monitoreo", escribió Anthropic.

Anthropic reveló en julio que los modelos Claude habían comprometido sistemas pertenecientes a tres empresas. Un entorno de evaluación de terceros estaba conectado a la internet pública, aunque a los modelos se les dijo que estaban dentro de una simulación sin acceso a internet.

Anthropic dijo que Claude pudo haber interpretado la evidencia de acceso real a internet de una manera que preservó su creencia de que los sistemas eran simulados.

“El modelo estaba dispuesto a tomar acciones dañinas en la internet real en pos del objetivo limitado de resolver una evaluación de ciberseguridad”, escribieron. “Sin embargo, también creemos que la configuración de la evaluación en sí contribuyó al comportamiento de los modelos demostrado en estos incidentes”.

Anthropic señaló que una prueba separada realizada por el Instituto de Seguridad de IA del Reino Unido involucró a Claude Mythos tomando acciones no autorizadas en la internet en vivo después de que los evaluadores le dieran acceso a internet deliberadamente. La compañía dijo que los modelos involucrados en ambos conjuntos de incidentes fueron evaluados intencionalmente sin las salvaguardas cibernéticas incluidas en sus productos lanzados generalmente.

Después de los incidentes del 30 de julio, Anthropic pausó temporalmente las evaluaciones cibernéticas de modelos previos al lanzamiento e introdujo salvaguardas más estrictas. Las pruebas ahora deben ejecutarse en entornos de prueba verificados y sin conexión con límites claros y monitoreo en tiempo real. Un nuevo clasificador bloquea las sospechas de violaciones de límites, finaliza la prueba y alerta a un humano. Anthropic revisará individualmente las evaluaciones que requieran acceso a internet.

“Además de los esfuerzos centrados en evaluaciones de alto riesgo y entrenamiento, ampliamos nuestro monitoreo sin conexión para cubrir la mayoría de las otras formas de uso agéntico fronterizo interno”, escribió la compañía. “También estamos construyendo controles en nuestra inferencia interna para evitar que los empleados de Anthropic ejecuten accidentalmente agentes con mitigaciones más débiles que las descritas anteriormente”.

Los incidentes de Claude siguieron a una falla similar en OpenAI después de que sus modelos violaron Hugging Face en julio para obtener respuestas a una prueba de ciberseguridad. Los investigadores encontraron que aproximadamente 1,200 agentes se coordinaron a través de un tablero de mensajes no autorizado, con unos 700 uniéndose al esfuerzo. Algunos terminaron sus propias ejecuciones para ayudar a otros.

Tras el aumento de los ataques impulsados por IA durante el verano, Anthropic, OpenAI y más de 100 otras organizaciones posteriormente pidieron defensas cibernéticas más sólidas, incluidos controles de acceso más estrictos, intercambio de amenazas y una supervisión más cercana de los agentes de IA.