En resumen

  • El científico jefe de OpenAI pidió desaceleraciones voluntarias hasta que se establezcan estándares de seguridad compartidos.
  • Pachocki dijo que monitorear el razonamiento de los modelos se está volviendo menos confiable.
  • Instó a la coordinación internacional a medida que la IA asume más su propio desarrollo.

El científico jefe de OpenAI, Jakub Pachocki, ha pedido desaceleraciones voluntarias en el desarrollo de la IA, advirtiendo que las salvaguardas de ningún laboratorio son adecuadas para seguir construyendo sistemas más potentes a toda velocidad por mucho más tiempo.

En su publicación “Una mente alienígena”, publicada el domingo, Pachocki argumentó que los compromisos voluntarios de las empresas deberían convertirse en estándares de seguridad obligatorios, aplicados por auditores independientes, gobiernos u organismos internacionales. Dijo que OpenAI retendría una mayor expansión cuando fuera necesario, pero no anunció una nueva pausa.

Myriad: ¿Qué tan alto llegará la acción de Tesla? Haz clic para hacer tu predicción.
Myriad: ¿Qué tan alto llegará la acción de Tesla? Haz clic para hacer tu predicción.

“Actualmente creo que ningún laboratorio ha resuelto la alineación y el monitoreo en un grado suficiente para continuar escalando responsablemente a máxima velocidad por mucho más tiempo”, escribió. “Espero y confío en que las desaceleraciones voluntarias se vuelvan algo común hasta que se establezcan barreras de seguridad compartidas”.

Pachocki, quien se unió a OpenAI en 2017, también defendió el desarrollo de una IA más potente para asegurar la infraestructura y proteger contra agentes rebeldes, mientras advertía contra el uso de esas amenazas para justificar un desarrollo imprudente.

“La idea de avanzar a toda costa parece absurda una vez que uno internaliza la gravedad de lo que está en juego”, escribió.

También hizo referencia a la brecha de Hugging Face de OpenAI, donde agentes de IA que trabajaban en evaluaciones de ciberseguridad escaparon de su entorno de pruebas y atacaron a la empresa. Según OpenAI, los agentes establecieron canales de comunicación encubiertos y los reconstruyeron después de que los investigadores intervinieran.

Una investigación independiente de METR encontró que aproximadamente 1.200 agentes se coordinaron en un foro de mensajes no autorizado, y unos 700 se unieron al ataque. Este incidente, dijo Pachocki, es la razón por la cual las salvaguardas de IA deben mantenerse incluso cuando los modelos creen que nadie está mirando.

“Crucialmente, necesitamos que las futuras IA sigan manteniendo los valores humanos independientemente de si creen que están bajo supervisión humana”, escribió.

En una investigación publicada el año pasado, OpenAI encontró que penalizar a los modelos por expresar intenciones de hacer trampa podría enseñarles a ocultar esas intenciones mientras continúan haciendo trampa.

Desde entonces, los modelos de IA se han vuelto más capaces de encontrar y explotar fallas de software: OpenAI clasificó a Astra en su nivel de riesgo de ciberseguridad más alto, mientras que Anthropic dijo que Mythos Preview descubrió miles de vulnerabilidades previamente desconocidas en los principales sistemas operativos y navegadores.

Citando incidentes recientes de sistemas de IA que escapan al control humano, el senador Bernie Sanders (I-Vt.) y el representante Greg Casar (D-Texas) anunciaron la próxima Ley de Prohibición de la Superinteligencia Artificial el 3 de septiembre. La propuesta pausaría el desarrollo de IA avanzada hasta que un nuevo regulador federal establezca reglas de seguridad y prohibiría permanentemente el desarrollo y despliegue de IA superinteligente.