Claude Fable 5 vient de prendre la première place

MirrorCodeClaudeDélégation au niveau du projetprogrammation IAgénération de codeGPT
2026-08-05Source: blockweeks.com
Claude Fable 5 vient de prendre la première place

Cette fois, Claude a vraiment fait exploser le classement de la programmation IA !

Sur le classement MirrorCode tout juste actualisé, Claude Fable 5 a de nouveau dominé les charts avec un taux de réussite absolu de 64 %.

Juste derrière, le score de GPT-5.6 Sol ne représente qu'un tiers de celui-ci !

GPT-5.5, classé quatrième, est encore plus mal loti. Non seulement il n'a obtenu que 10 %, mais il a aussi été écrasé par son propre prédécesseur, GPT-5.4.

Programmation IA

Encore plus surprenant, lorsqu'on utilise des langages à hautes ressources comme Go, le taux de résolution de Fable 5 est de 64 % ; lorsqu'on passe au langage de niche Ada, le score reste aussi élevé que 61 %.

Il convient de noter que dans le monde open source, les corpus Python sont environ 230 fois plus volumineux que ceux d'Ada.

Mais avec Fable 5, le score n'a baissé que de 3 points de pourcentage.

Programmation IA

C'est intéressant.

Si le modèle s'appuyait principalement sur la mémorisation de la syntaxe et des schémas courants des langages populaires, le passage à Ada aurait dû entraîner une baisse des performances.

Mais les résultats actuels pointent vers une autre possibilité—

Les modèles les plus forts ont dépassé l'attrait des corpus spécifiques et ont commencé à apprendre comment construire un projet logiciel complet à partir de zéro.

Bloqué à la ligne d'achèvement de 100 %, un test extrême de 10 milliards de jetons

Plus précisément, le MirrorCode complet comprend 25 programmes cibles, couvrant des domaines tels que les outils Unix, les interpréteurs, l'interrogation de données, la bioinformatique, la cryptographie et les outils de compression.

Ici, le modèle est placé dans un environnement isolé, sans accès à Internet, sans accès au code source du projet original, et sans possibilité de télécharger des dépendances tierces. Il ne reçoit que de la documentation de haut niveau, une partie des tests visibles, et un programme original qu'il peut appeler à plusieurs reprises.

Ensuite, il doit continuellement fournir des données au programme original, observer les sorties pour deviner la logique interne, puis écrire un nouveau programme qui se comporte de manière identique.

Le dernier classement sélectionne 15 cibles Medium et Large parmi celles-ci. Chaque cible utilise deux langages d'implémentation, et chaque langage est exécuté trois fois.

De plus, le taux de réussite pour les tests visibles et cachés doit atteindre 100 % pour réussir ; 99,9 % n'est pas acceptable.

Si un seul cas limite est manqué, l'ensemble de l'exécution est toujours compté comme un échec.

Programmation IA

Pour forcer le modèle à combler les dernières lacunes, MirrorCode pousse le budget d'exécution unique à 10 milliards de jetons, permettant une exécution continue maximale de 7 jours.

La tâche unique la plus coûteuse du document est encore plus extrême : le modèle a fonctionné en continu pendant 19 jours, avec un coût d'exécution unique de 2 600 $.

Pendant ces 19 jours, le modèle exécute à plusieurs reprises le programme original, compare les résultats, comble les fonctionnalités manquantes, puis relance les tests. Si des erreurs se produisent, il en recherche la cause ; si les sorties ne correspondent pas, il modifie ses hypothèses ; une fois des réussites partielles obtenues, il passe à la recherche de la prochaine lacune.

Le processus entier ressemble à une session de débogage durant plusieurs jours, plutôt qu'à une génération unique.

Programmation IA

L'exemple de gotree est le plus illustratif.

Cet outil de bioinformatique comptait à l'origine environ 16 000 lignes de code Go et plus de 40 commandes.

Claude Opus 4.7 a pris 14 heures et 251 $, réussissant 2 000 tests sur 2 001, atteignant un taux de réussite de 99,95 %.

Bien qu'il ait manqué un cas limite de niche impliquant des annotations de date et ait été arrêté par la ligne d'achèvement de 100 % de MirrorCode, il avait déjà compressé ce qui était à l'origine un effort d'ingénierie de plusieurs semaines en un peu plus d'une douzaine d'heures—

Epoch estime que sans IA, un ingénieur humain aurait besoin d'au moins 2 à 17 semaines pour accomplir la même tâche.

Dans le désert de corpus, Fable 5 n'a perdu que 3 points

L'article de MirrorCode a utilisé le mélange d'entraînement public de StarCoder comme référence.

Parmi celui-ci, Python représente environ 8 %, tandis qu'Ada n'est que de 0,034 %, le premier étant environ 230 fois plus grand que le second.

Programmation IA

Bien sûr, nous ne pouvons pas savoir combien de code Ada les modèles propriétaires ont réellement vu. Mais en utilisant l'écosystème public comme référence, la rareté d'Ada est déjà assez intuitive.

Ce langage apparaît principalement dans l'aérospatiale, la défense et d'autres systèmes critiques pour la sécurité. Que ce soit la taille de la communauté, le nombre de tutoriels ou les projets open source, il est loin d'être comparable à Python, JavaScript ou Go.

Et Fable 5 ne traduit clairement pas le code Go ligne par ligne en Ada.

C'est plus comme s'il comprenait d'abord comment le programme original fonctionne réellement, puis passait à un autre langage et recréait le même comportement.

Programmation IA

En revanche, d'autres modèles ne sont pas aussi stables.

GPT-5.6 Sol est passé de 24 % à 19 %, GPT-5.4 de 21 % à 12 %, et GPT-5.5 est même tombé de 17 % à 5 %. Une fois le langage changé, l'écart est immédiatement amplifié.

Confier l'ensemble du projet à l'IA

De nos jours, Cursor a permis à des centaines d'agents de collaborer pendant près d'une semaine, écrivant à partir de zéro plus d'un million de lignes de code de navigateur réparties sur 1 000 fichiers.

Anthropic, de son côté, a fait exécuter à 16 agents Claude près de 2 000 sessions en parallèle, construisant finalement un compilateur C de 100 000 lignes capable de compiler le noyau Linux 6.9.

Dans l'échantillon d'utilisateurs personnels de Codex divulgué par OpenAI en mai, 70,2 % ont soumis au moins une tâche estimée à plus d'une heure de travail humain ; 25,6 % ont soumis des tâches dépassant huit heures.

L'unité que les gens confient à l'IA passe d'un morceau de code ou d'un bug à un après-midi, une semaine, voire l'ensemble du projet.

Les 64 % de MirrorCode sont précisément une quantification de cette « délégation au niveau du projet ».

Cela montre que tant que l'objectif est suffisamment clair et que les résultats peuvent être vérifiés automatiquement, les modèles de pointe peuvent déjà accomplir de manière indépendante une partie des logiciels de taille moyenne à grande.

Pour tous ceux qui confient du travail à l'IA, le changement est déjà imminent—

Auparavant, vous deviez surveiller chaque ligne de code qu'il écrivait ; ensuite, vous serez plus susceptible de vérifier uniquement aux nœuds clés s'il a dévié de la trajectoire.

Le code deviendra de moins en moins cher.

Et ceux qui savent articuler clairement les problèmes et vérifier précisément les résultats deviendront de plus en plus précieux.

Référence : https://epoch.ai/MirrorCode

Cet article provient du compte public WeChat "新智元", auteur : ASI启示录 ; éditeur : 摩西