Коротко

  • Meta випустила Muse Code (бета), термінального кодинг-агента на основі Muse Spark 1.2, своєї оновленої моделі для кодування. Він доступний через Meta Model API та curl-скрипт для встановлення.
  • Агент координує постійні фонові субагенти та веде точний журнал подій, тому після збою він відновлюється саме з того місця, де зупинився.
  • За власними графіками Meta, Muse Spark 1.2 поступається Anthropic Opus 5 на всіх наведених бенчмарках кодування, але випереджає OpenAI Codex та Google Antigravity на більшості з них.

Meta — останній технологічний гігант, який випустив кодинг-агента, змагаючись із провідними ШІ-бегемотами Anthropic та OpenAI.

«Ми раді випустити Muse Code (бета), термінального кодинг-агента на основі Muse Spark 1.2, нашої найновішої моделі», — написала компанія в офіційному оголошенні. «Це наш наступний крок до передового краю, з більшими та значно потужнішими моделями на підході».

Як агентний інструмент для кодування, Muse Code створений для програмної інженерії у великих репозиторіях. За словами Meta, він «бере на себе складні завдання програмної інженерії у великих репозиторіях: планування змін, написання коду та перевірку результатів. Він може координувати кілька постійних субагентів для кожного завдання, вирішуючи складні проблеми швидше, точніше та з меншим втручанням».

Деталь, яка виділяється, — це середовище виконання. Muse Code записує кожен виклик моделі, запуск інструмента, підтвердження та редагування в локальний журнал подій, який слугує єдиним джерелом істини. «Це єдине джерело істини робить середовище виконання точно відтворюваним і безпечним для перезапуску: після збою агент може відновитися саме там, де зупинився», — сказали в Meta. Для довготривалих завдань ця функція важливіша за швидкість — і саме її конкуренти не зробили своєю перевагою.

Він також постачається зі стандартними навичками. Команда "/plan" перетворює завдання на план із затвердженням, тоді як "/grill" перевіряє цей план, поки він не витримає, а "/goal" працює над успішним досягненням мети, подібно до того, що робить Hermes. Meta заявила, що спільно навчала Muse Spark 1.2 з Muse Code, щоб основна LLM та агент працювали в синергії.

Бенчмарки та підступ

Muse Spark 1.2 — це оновлення Muse Spark 1.1, орієнтоване на кодування. Meta заявила, що «значно збільшила обчислювальні потужності для навчання на завданнях кодування, розширюючи різноманітність навчального середовища, що дало покращення в генерації коду, складному налагодженні та наскрізних робочих процесах розробника». Графіки розповідають зрозумілу історію.

На Terminal-Bench 2.1 Muse Spark 1.2 з Muse Code набрав 82,9%, поступаючись Claude Code на Opus 5 (86,7%), але випереджаючи GPT-5.6 Terra на Codex (81,8%) та Grok Build (81,6%).

DeepSWE 1.1, який вимірює агентні можливості кодування, був ближчим: 59,3% для Muse проти 65,0% для Opus 5 і 64,8% для Codex. На внутрішньому бенчмарку кодування Meta, Muse досяг 70,6% проти 79,4% у Opus 5.

Графіки прискорення змінюють порядок. Понад 1000 викликів інструментів Opus 5 показав найбільший приріст порівняно з базовим рівнем (близько 74–75%), а Muse Spark 1.2 опинився в середині з приблизно 61–69% залежно від запуску. Meta зазначає, що агент продовжує вдосконалюватися в міру накопичення викликів інструментів — це поведінка, яку ви очікуєте від кодера з довгим горизонтом планування.

Найцікавіші демонстрації — це довготривалі та мультимодальні. У стрес-тестуванні Meta заявила, що Muse Code «ітеративно оптимізував GPU-ядра протягом понад 1000 викликів інструментів (до 24 годин) на GPU Nvidia Hopper». Це означає, що він міг покращуватися з часом.

Також є аспект візуального кодування. В одній демонстрації користувач вставляє відео обльоту будинку в термінал як файл mp4, і Muse Code «інтерпретує відео та створює візуально насичений веб-сайт з можливостями бронювання». Зчитування сирого відео в робочий веб-додаток — це мультимодальна пропозиція, яку Meta просуває в усій лінійці Muse.

Дивіться тему запуску:

Це поле вже переповнене

Тим не менш, Meta запізнилася до боротьби. Codex від OpenAI вже запускає паралельні хмарні агенти; DeepSeek створив власного конкурента Claude Code, а агентні інструменти, як-от Hermes або OpenClaw, вже є хорошими замінниками з більшими можливостями. Перевага Muse Code — це безпечне від збоїв середовище виконання та дизайн субагентів, а не перевага в бенчмарках.

Ризик є звичайним для агентного кодування: агент, який відновлюється після збою та продовжує викликати інструменти протягом 24 годин, є потужним і непередбачуваним. Meta робить ставку на те, що розробники хочуть такої автономії, і це вже доступно.

Muse Code доступний для тестування після встановлення, ввівши цю команду:
curl -fsSL https://dev.meta.ai/install.sh | bash