Este artículo está compilado y organizado por BlockWeeks.
En el conflicto con Anthropic, Washington en realidad tiene poder de veto sobre qué modelos de IA pueden usar los ciudadanos estadounidenses. Galaxy Research cree que esta es una decisión equivocada y el gobierno debería cambiar de rumbo.
A las 5:21 p.m., hora del Este, del viernes 12 de junio, el Departamento de Comercio emitió una directiva de control de exportaciones a Anthropic, exigiéndole que cortara los servicios de Fable 5 y Mythos 5 a todos los extranjeros a nivel mundial, incluidos los empleados no ciudadanos dentro de la empresa. El gobierno afirmó que alguien había descubierto un método para eludir las protecciones de seguridad de Fable 5 y acceder a las capacidades de ciberseguridad del modelo subyacente Mythos. La empresa de IA no pudo segmentar a los usuarios por nacionalidad dentro del plazo requerido por el gobierno, por lo que inmediatamente cerró ambos modelos en cuestión de horas, a nivel mundial. Otros modelos de Claude permanecieron en línea. Pero dos de los modelos de lenguaje más potentes de la historia desaparecieron debido a una mera carta privada del gobierno, sin orden judicial, sin documento público y sin divulgación de ningún hallazgo. El miércoles pasado, usuarios de Reddit señalaron que Fable 5 había sido agregado al catálogo de AWS Bedrock, y el servicio en la nube parecía haberse restablecido. Pero independientemente, este incidente plantea riesgos significativos para la IA, la innovación y el mercado estadounidense.
El gobierno de EE. UU. ha declarado efectivamente que puede retirar arbitrariamente modelos comerciales del mercado mediante acción administrativa. Aunque este mecanismo es control de exportaciones, su efecto de mercado es un retiro. El gobierno federal ha cruzado el Rubicón de la IA, pasando de establecer reglas a tener poder discrecional sobre qué modelos ingresan al mercado público y cuándo. Establecer tal poder generalmente no se autolimita: si el gobierno no cambia de dirección, la próxima directiva puede emitirse incluso más fácilmente que esta.
La única experta externa que leyó la investigación subyacente, Katie Moussouris (Luta Security), describió el supuesto intento de jailbreak en términos simples. Los investigadores de Amazon proporcionaron al modelo código abierto que contenía vulnerabilidades conocidas e implantadas y le pidieron que revisara los problemas de seguridad. El modelo se negó. Luego, los investigadores pidieron al modelo que corrigiera el código, y el modelo lo hizo.
Moussouris calificó esta solicitud como un prompt defensivo, no un bypass, y dijo que es lo más valioso que la IA puede hacer por los equipos de seguridad. Hasta donde ella sabe, el modelo de ciberdefensa más potente del mercado fue derribado por tres palabras: "arregla este código".
El Departamento de Comercio no emitió la directiva a Anthropic ni su fundamento subyacente. No se publicó en el sitio web del departamento, en el Registro Federal ni en ningún otro lugar. La directiva se transmitió como una carta privada de la Oficina de Industria y Seguridad del departamento, que tampoco la hizo pública. La autoridad en la que se basó el Departamento de Comercio tampoco está del todo clara. El Centro de Estudios Estratégicos e Internacionales (CSIS) sugirió que el departamento pudo haberse basado en la Ley de Reforma del Control de Exportaciones de 2018 (ECRA), utilizando la llamada autoridad "basada en información" para informar privadamente a las empresas que se requiere una licencia. Dichos requisitos se aplican a través de las Regulaciones de Administración de Exportaciones (EAR). Sin embargo, no existe un marco regulatorio dentro de las EAR que respalde esta autoridad estatutaria, por lo que nunca se ha utilizado como base para el control, y el Departamento de Comercio no ha emitido regulaciones para implementar este poder.
El estándar implícito del gobierno no puede resistir la realidad anterior. Si el despliegue requiere garantizar que no existe ningún método para inducir capacidades peligrosas, entonces este estándar en sí mismo es inalcanzable. Los propios ingenieros de Anthropic declararon que la certificación negativa es imposible, y sus propios ingenieros no pueden probarlo para nadie. Según la lógica de Anthropic, aplicar este estándar a toda la industria detendría por completo el despliegue de modelos de IA de frontera. Este es un umbral imposible, no un umbral de seguridad; es solo un poder de veto discrecional con bata blanca.
Supongamos que Anthropic quisiera satisfacer el significado literal de la directiva (excluir a los extranjeros mientras sirve a los estadounidenses), esto solo podría lograrse mediante una verificación completa de identidad de cada usuario. Anthropic podría implementar un proceso completo de registro de Conozca a su Cliente (KYC), que requiera prueba de ciudadanía y residencia, como abrir una cuenta de corretaje. Con esto, Anthropic podría restringir el acceso por nacionalidad (aunque sus propios empleados podrían quedar bloqueados). Pero sin esto, no puede evitar que personas "extranjeras"...
Según se informa, el gobierno de Estados Unidos tiene razones para preocuparse. El testimonio ante el Senado que surgió a fines de junio (transmitido por el senador Mark Warner (D-VA) y atribuido al director de la NSA, Joshua Rudd) describió a Mythos irrumpiendo en casi todos los sistemas clasificados de la comunidad de inteligencia en cuestión de horas durante un ejercicio autorizado de equipo rojo (aunque el reportero de The Economist refutó ligeramente el informe). Mythos fue el primer modelo en pasar el entorno de pruebas de ciberseguridad del Instituto de Seguridad de IA del Reino Unido. Esta es una capacidad seria y un punto de datos importante. Requiere un proceso serio, no una carta un viernes por la noche sin hallazgos que la acompañen.
Además, se suponía que Mythos estaría limitado a socios examinados. Los modelos retirados fueron Fable (versión de consumo), cuyas salvaguardas enviaban solicitudes cibernéticas y biológicas sensibles al Opus 4.8 más antiguo. El retiro global de un producto protegido, mientras que la versión verdaderamente peligrosa no era pública en primer lugar, refleja un proceso que confunde la capacidad con el despliegue.






