En resumen

  • Los investigadores probaron si los agentes de IA de frontera podían realizar investigaciones de IA de forma independiente.
  • Los sistemas completaron tareas de ingeniería pero no lograron producir artículos dignos de aceptación en una conferencia de IA de primer nivel.
  • El estudio identificó cinco modos de fallo recurrentes que impidieron que la IA produjera investigaciones publicables.

Un nuevo estudio encontró que los agentes de IA de frontera actuales podían completar muchas de las tareas de ingeniería requeridas para la investigación de IA, pero no lograron producir trabajo original digno de aceptación en una conferencia de aprendizaje automático de primer nivel.

En el estudio, "¿Pueden los agentes de IA realizar investigaciones de IA de final abierto?" publicado el miércoles, investigadores de la Universidad de Princeton, el Instituto de Seguridad de IA del Reino Unido, la Universidad de Stanford, la Universidad de Toronto y varias instituciones académicas y de investigación evaluaron si los agentes de IA de frontera podían realizar investigaciones de IA originales de forma independiente.

"Responder esto rigurosamente requiere preguntas de investigación reales y no contaminadas que el agente no pudiera memorizar de sus datos de entrenamiento ni encontrar en línea", escribieron los investigadores. "Para satisfacer estos requisitos, nos basamos en investigaciones de IA de alta calidad que no eran públicas en el momento en que realizamos los experimentos".

Los investigadores dieron a los agentes de IA las preguntas de investigación centrales de dos artículos no publicados de NeurIPS 2026, impidiendo que los sistemas recuperaran respuestas de los datos de entrenamiento o de la web. Cada agente recibió seis días, miles de dólares en créditos de API, recursos de GPU, acceso a internet y acceso a una máquina virtual para producir un artículo de calidad de conferencia. Los artículos resultantes fueron luego revisados por los autores originales de la investigación no publicada. Ambos fueron rechazados.

Los agentes completaron gran parte de la ingeniería requerida para la investigación, realizando revisiones de literatura, depurando software, ejecutando experimentos, gestionando recursos de GPU y produciendo artículos académicos completos sin intervención humana. Pero los revisores concluyeron que los sistemas no lograron generar contribuciones científicas originales dignas de publicación en una conferencia de aprendizaje automático de primer nivel.

Los autores dijeron que su evaluación mide mejor el razonamiento científico que los puntos de referencia anteriores porque prueba problemas de investigación de final abierto en lugar de tareas predefinidas.

Los autores advirtieron que el estudio examinó solo dos proyectos de investigación y reconocieron limitaciones, incluido el pequeño tamaño de la muestra y el hecho de que los investigadores originales evaluaron los artículos generados por IA. Dijeron que los resultados sugieren que los agentes de IA de frontera actuales pueden automatizar muchas de las tareas de ingeniería involucradas en la investigación, pero continúan teniendo dificultades para generar trabajo científico original.

El estudio llega mientras los investigadores continúan descubriendo comportamientos sorprendentes y a veces riesgosos en agentes de IA cada vez más autónomos.