Claude Fable 5 acaba de alcanzar el primer puesto

MirrorCodeClaudeDelegación a nivel de proyectoprogramación IAgeneración de códigoGPT
2026-08-05Fuente: blockweeks.com
Claude Fable 5 acaba de alcanzar el primer puesto

¡Esta vez, Claude realmente ha dejado boquiabierto al ranking de programación de IA!

En el ranking MirrorCode recién actualizado, Claude Fable 5 ha vuelto a encabezar las listas con una tasa de éxito absoluta del 64%.

¡Muy de cerca, la puntuación de GPT-5.6 Sol es solo un tercio de eso!

GPT-5.5, clasificado en cuarto lugar, está aún peor. No solo obtuvo solo el 10%, sino que también fue aplastado por su propio predecesor, GPT-5.4.

AI programming

Aún más sorprendente, al usar lenguajes de recursos altos como Go, la tasa de resolución de Fable 5 es del 64%; al cambiar al lenguaje de nicho Ada, la puntuación sigue siendo tan alta como el 61%.

Vale la pena señalar que en el mundo de código abierto, los corpus de Python son aproximadamente 230 veces más grandes que los de Ada.

Pero con Fable 5, la puntuación solo bajó 3 puntos porcentuales.

AI programming

Esto es interesante.

Si el modelo se basara principalmente en memorizar la sintaxis y los patrones comunes de los lenguajes populares, entonces cambiar a Ada debería haber causado una caída en el rendimiento.

Pero los resultados actuales apuntan a otra posibilidad—

Los modelos más fuertes han superado la atracción de los corpus específicos y han comenzado a aprender cómo construir un proyecto de software completo desde cero.

Atascado en la línea de finalización del 100%, una prueba extrema de 10 mil millones de tokens

Específicamente, el MirrorCode completo incluye 25 programas objetivo, que cubren áreas como herramientas Unix, intérpretes, consulta de datos, bioinformática, criptografía y herramientas de compresión.

Aquí, el modelo se coloca en un entorno aislado, sin internet, sin acceso al código fuente del proyecto original y sin capacidad para descargar dependencias de terceros. Solo obtiene documentación de alto nivel, una parte de las pruebas visibles y un programa original que puede llamar repetidamente.

A continuación, debe alimentar continuamente datos al programa original, observar las salidas para adivinar la lógica interna y luego escribir un nuevo programa que se comporte de manera idéntica.

El último ranking selecciona 15 objetivos Medianos y Grandes de estos. Cada objetivo utiliza dos lenguajes de implementación, y cada lenguaje se ejecuta tres veces.

Además, la tasa de finalización tanto para las pruebas visibles como para las ocultas debe alcanzar el 100% para pasar; el 99.9% no es aceptable.

Si se pierde incluso un caso límite, toda la ejecución se cuenta como un fracaso.

AI programming

Para obligar al modelo a llenar los últimos vacíos, MirrorCode empuja el presupuesto de una sola ejecución a 10 mil millones de tokens, permitiendo un máximo de ejecución continua de 7 días.

La tarea individual más cara del documento es aún más extrema: el modelo se ejecutó continuamente durante 19 días, con un costo de $2,600 por ejecución.

Durante estos 19 días, el modelo ejecuta repetidamente el programa original, compara resultados, completa las funcionalidades faltantes y luego vuelve a ejecutar las pruebas. Si ocurren errores, investiga la causa; si las salidas no coinciden, cambia las hipótesis; una vez que logra aprobaciones parciales, pasa a perseguir la siguiente brecha.

Todo el proceso se asemeja a una sesión de depuración que dura varios días, más que a una generación única.

AI programming

El ejemplo de gotree es el más ilustrativo.

Esta herramienta de bioinformática originalmente tenía aproximadamente 16,000 líneas de código Go y más de 40 comandos.

Claude Opus 4.7 tardó 14 horas y $251, superando 2,000 de 2,001 pruebas, logrando una tasa de finalización del 99.95%.

Aunque omitió un caso límite de nicho que involucra anotaciones de fechas y fue detenido por la línea de finalización del 100% de MirrorCode, ya había comprimido lo que originalmente era un esfuerzo de ingeniería de semanas en poco más de una docena de horas—

Epoch estima que sin IA, un ingeniero humano necesitaría al menos de 2 a 17 semanas para completar la misma tarea.

En el desierto de corpus, Fable 5 solo bajó 3 puntos

El artículo de MirrorCode utilizó la mezcla de entrenamiento pública de StarCoder como referencia.

Entre ella, Python representa aproximadamente el 8%, mientras que Ada es solo el 0.034%, siendo el primero aproximadamente 230 veces más grande que el segundo.

AI编程

Por supuesto, no podemos saber cuánto código Ada han visto realmente los modelos de código cerrado. Pero usando el ecosistema público como referencia, la escasez de Ada ya es lo suficientemente intuitiva.

Este lenguaje aparece principalmente en sistemas aeroespaciales, de defensa y otros sistemas críticos de seguridad. Ya sea el tamaño de la comunidad, el número de tutoriales o los proyectos de código abierto, está lejos de ser comparable con Python, JavaScript o Go.

Y Fable 5 claramente no está traduciendo código Go línea por línea a Ada.

Es más como primero entender cómo funciona realmente el programa original, luego cambiar a otro lenguaje y recrear el mismo comportamiento.

AI编程

En contraste, otros modelos no son tan estables.

GPT-5.6 Sol cayó del 24% al 19%, GPT-5.4 del 21% al 12%, y GPT-5.5 incluso cayó del 17% al 5%. Una vez que el lenguaje cambia, la brecha se amplifica inmediatamente.

Entregando el Proyecto Completo a la IA

Hoy en día, Cursor ha permitido que cientos de agentes colaboren durante casi una semana, escribiendo desde cero más de 1 millón de líneas de código de navegador distribuidas en 1,000 archivos.

Anthropic, por otro lado, hizo que 16 agentes de Claude ejecutaran casi 2,000 sesiones en paralelo, construyendo finalmente un compilador de C con 100,000 líneas que puede compilar el kernel de Linux 6.9.

En la muestra de usuarios personales de Codex divulgada por OpenAI hasta mayo, el 70.2% envió al menos una tarea que se estima supera una hora de trabajo humano; el 25.6% envió tareas que superan las ocho horas.

La unidad que las personas entregan a la IA se está desplazando de un fragmento de código o un error a una tarde, una semana, o incluso el proyecto completo.

El 64% de MirrorCode es precisamente una cuantificación de esta "delegación a nivel de proyecto".

Esto demuestra que, siempre que el objetivo sea lo suficientemente claro y los resultados puedan verificarse automáticamente, los modelos de vanguardia ya pueden completar de forma independiente una parte de software de mediana a gran escala.

Para todos los que están delegando trabajo a la IA, el cambio ya es inminente—

Antes, tenías que observar cómo escribía cada línea de código; a continuación, es más probable que solo verifiques en los nodos clave si se ha desviado del camino.

El código será cada vez más barato.

Y aquellos que puedan articular problemas con claridad y verificar resultados con precisión serán cada vez más valiosos.

Referencia: https://epoch.ai/MirrorCode

Este artículo proviene de la cuenta pública de WeChat "新智元", autor: ASI启示录; editor: 摩西