Щойно: Claude Fable 5 знову на вершині

MirrorCodeClaudeделегування на рівні проєктуAI програмуваннягенерація кодуGPT
2026-08-05Джерело: blockweeks.com
Щойно: Claude Fable 5 знову на вершині

Цього разу Claude справді підірвав лідерську таблицю з програмування ШІ!

На щойно оновленій таблиці лідерів MirrorCode, Claude Fable 5 знову очолив чарти з абсолютним рівнем успіху 64%.

Не відстаючи, результат GPT-5.6 Sol становить лише одну третину від цього!

GPT-5.5, який посідає четверте місце, ще гірший. Він не тільки набрав лише 10%, але й був розчавлений своїм попередником, GPT-5.4.

AI програмування

Ще більш дивно, що при використанні мов з високими ресурсами, таких як Go, рівень розв'язання Fable 5 становить 64%; при переході на нішеву мову Ada, результат все одно залишається високим — 61%.

Варто зазначити, що у відкритому світі корпуси Python приблизно в 230 разів більші, ніж у Ada.

Але з Fable 5 результат впав лише на 3 відсоткові пункти.

AI програмування

Це цікаво.

Якби модель в основному покладалася на запам'ятовування синтаксису та загальних шаблонів популярних мов, то перехід на Ada мав би спричинити падіння продуктивності.

Але поточні результати вказують на іншу можливість—

Найсильніші моделі вийшли за межі впливу конкретних корпусів і почали вчитися будувати повний програмний проєкт з нуля.

Застрягли на лінії 100% завершення, екстремальний тест на 10 мільярдів токенів

Зокрема, повний MirrorCode включає 25 цільових програм, що охоплюють такі сфери, як інструменти Unix, інтерпретатори, запити даних, біоінформатика, криптографія та інструменти стиснення.

Тут модель розміщується в ізольованому середовищі, без інтернету, без доступу до вихідного коду оригінального проєкту та без можливості завантажувати сторонні залежності. Вона отримує лише високорівневу документацію, частину видимих тестів та оригінальну програму, яку можна багаторазово викликати.

Далі вона повинна постійно подавати дані в оригінальну програму, спостерігати за виводами, щоб вгадати внутрішню логіку, а потім написати нову програму, яка поводиться ідентично.

Остання таблиця лідерів вибирає з них 15 цілей Medium і Large. Кожна ціль використовує дві мови реалізації, і кожна мова запускається тричі.

Більше того, рівень завершення як видимих, так і прихованих тестів має досягати 100%, щоб пройти; 99,9% не приймається.

Якщо пропущено хоча б один крайовий випадок, весь запуск все одно вважається невдалим.

AI програмування

Щоб змусити модель заповнити останні кілька прогалин, MirrorCode збільшує бюджет одного запуску до 10 мільярдів токенів, дозволяючи максимальний безперервний запуск протягом 7 днів.

Найдорожче окреме завдання в статті є ще більш екстремальним: модель працювала безперервно 19 днів, а один запуск коштував 2600 доларів.

Протягом цих 19 днів модель багаторазово запускає оригінальну програму, порівнює результати, заповнює відсутні функції, а потім повторно запускає тести. Якщо виникають помилки, вона досліджує причину; якщо результати не збігаються, вона змінює гіпотези; після часткового проходження вона переходить до наступного розриву.

Весь процес нагадує сеанс налагодження, що триває кілька днів, а не одноразову генерацію.

AI programming

Приклад gotree є найбільш показовим.

Цей біоінформатичний інструмент спочатку мав приблизно 16 000 рядків коду на Go та понад 40 команд.

Claude Opus 4.7 знадобилося 14 годин і 251 долар, щоб пройти 2000 з 2001 тестів, досягнувши рівня завершення 99,95%.

Хоча він пропустив специфічний крайовий випадок, пов'язаний з анотаціями дат, і був зупинений лінією 100% завершення MirrorCode, він уже стиснув те, що спочатку було тижневою інженерною роботою, до трохи більше ніж десятка годин —

Epoch оцінює, що без ШІ людині-інженеру знадобилося б щонайменше від 2 до 17 тижнів, щоб виконати те саме завдання.

У пустелі корпусу Fable 5 втратив лише 3 бали

У статті MirrorCode використовувався публічний навчальний набір StarCoder як орієнтир.

Серед нього Python становить близько 8%, тоді як Ada — лише 0,034%, причому перший приблизно в 230 разів більший за другий.

AI编程

Звичайно, ми не можемо знати, скільки коду Ada насправді бачили закриті моделі. Але використовуючи публічну екосистему як орієнтир, дефіцит Ada вже є достатньо інтуїтивним.

Ця мова в основному з'являється в аерокосмічній, оборонній та інших системах, критичних для безпеки. Чи то розмір спільноти, кількість підручників чи проєктів з відкритим кодом, вона далека від порівняння з Python, JavaScript або Go.

І Fable 5 явно не перекладає код Go рядок за рядком на Ada.

Це більше схоже на те, що спочатку розуміє, як насправді працює оригінальна програма, а потім перемикається на іншу мову та відтворює ту саму поведінку.

AI编程

На відміну від цього, інші моделі не такі стабільні.

GPT-5.6 Sol впав з 24% до 19%, GPT-5.4 з 21% до 12%, а GPT-5.5 навіть впав з 17% до 5%. Як тільки мова змінюється, розрив одразу збільшується.

Передача всього проєкту ШІ

Сьогодні Cursor дозволив сотням агентів співпрацювати майже тиждень, написавши з нуля понад 1 мільйон рядків коду браузера, розподілених по 1000 файлах.

Anthropic, з іншого боку, мав 16 агентів Claude, які паралельно виконали майже 2000 сеансів, зрештою створивши компілятор C зі 100 000 рядків, який може компілювати ядро Linux 6.9.

У вибірці особистих користувачів Codex, оприлюдненій OpenAI станом на травень, 70,2% подали принаймні одне завдання, оцінене як таке, що перевищує одну годину людської роботи; 25,6% подали завдання, що перевищують вісім годин.

Одиниця, яку люди передають ШІ, зміщується від фрагмента коду чи помилки до післяобіднього часу, тижня або навіть всього проєкту.

64% MirrorCode — це саме кількісне вираження цього «делегування на рівні проєкту».

Це показує, що якщо мета достатньо чітка, а результати можуть бути автоматично перевірені, передові моделі вже можуть самостійно виконувати частину середніх та великих програмних проєктів.

Для всіх, хто передає роботу ШІ, зміни вже неминучі—

Раніше вам доводилося стежити за кожним написаним рядком коду; тепер ви, швидше за все, будете перевіряти лише на ключових етапах, чи не збилася вона з правильного шляху.

Код ставатиме все дешевшим і дешевшим.

А ті, хто вміє чітко формулювати проблеми та точно перевіряти результати, ставатимуть все ціннішими.

Посилання: https://epoch.ai/MirrorCode

Ця стаття з публічного акаунту WeChat "新智元", автор: ASI启示录; редактор: 摩西