W skrócie
- Anthropic wydało Claude Fable 5.1 i Claude Mythos 5.1 1 września, osiągając 52,6% w Terminal-Bench-Science 0.1 wobec 24,7% Fable 5, oraz 55,8% w Terminal-Bench 4.0 wobec 42,0%.
- Odczyty z pamięci podręcznej kosztują teraz o 75% mniej, obniżając typowe koszty obciążeń o około 25%, a wysoce agentowe obciążenia nawet o 45%, przy niezmienionej cenie bazowej wynoszącej 10/50 dolarów za milion tokenów.
- Fable 5.1 nie jest zawarte w planach Pro ani standardowych miejscach Team, które korzystają z niego na podstawie kredytów; miejsca Max i premium Team lub Enterprise obejmują go do 50% tygodniowych limitów.
Anthropic wydało Claude Fable 5.1 i Claude Mythos 5.1 we wtorek, co jest pierwszą aktualizacją linii modeli Mythos od czasu premiery Fable 5 9 czerwca.
Firma twierdzi, że nowe modele AI są „najbardziej zaawansowane na świecie do kodowania i pracy intelektualnej” i pojawiają się trzy miesiące po cyklu premier, który obejmował już 18-dniowe wstrzymanie kontroli eksportu, letnią walkę cenową o dostęp subskrypcyjny oraz lipcowe wydanie Claude Opus 5, które podcięło Fable 5 ceną.

Fable 5.1 i Mythos 5.1 to, według Anthropic, ten sam model bazowy z różnymi filtrami bezpieczeństwa. Fable 5.1 jest ogólnie dostępny dla każdego, kto ma konto Claude. Mythos 5.1 pozostaje ograniczony do zweryfikowanych specjalistów ds. cyberbezpieczeństwa i nauk przyrodniczych poprzez Program Weryfikacji Cyberbezpieczeństwa i Program Weryfikacji Nauk Przyrodniczych Anthropic, będący następcą ścieżki dostępu Project Glasswing, która ograniczała Mythos 5.
Co faktycznie mierzą benchmarki
Główna liczba Anthropic pochodzi z Terminal-Bench-Science 0.1, benchmarku, który testuje, czy agent AI może wykonywać zadania z zakresu badań naukowych w środowisku wiersza poleceń, oceniane jako wskaźnik zaliczenia.
Fable 5.1 osiągnął 52,6% w porównaniu z 24,7% dla Fable 5 i 29,0% dla Opus 5, ponad dwukrotnie więcej niż jego poprzednik.
Terminal-Bench 4.0 testuje agentowe kodowanie wykonywane przez terminal — pisanie, uruchamianie i debugowanie kodu w wieloetapowych sesjach wiersza poleceń, oceniane jako procent poprawnie wykonanych zadań. Fable 5.1 uzyskał 55,8%, w porównaniu z 42,0% dla Fable 5 i wyprzedzając Opus 5 z 52,3%.
Mythos 5.1, działający z lżejszymi filtrami cyberbezpieczeństwa, uzyskał 60,9% w tym samym teście; Anthropic twierdzi, że różnica odzwierciedla zadania, które jego zabezpieczenia przechwyciły i przekierowały do Opus 4.8.

W teście Humanity's Last Exam, multidyscyplinarnym teście rozumowania zbudowanym z pytań na poziomie eksperckim z kilkudziesięciu dziedzin akademickich i ocenianym jako wskaźnik zdawalności, Fable 5.1 osiągnął 60,9% bez narzędzi zewnętrznych i 65,0% z nimi, wyprzedzając Opus 5, co pokazuje, że jest to najbardziej zaawansowany model Anthropica do celów akademickich.

Gdzie przewyższa Opus 5 i gdzie matematyka staje się bardziej mętna
Opus 5 zadebiutował w lipcu, kosztując połowę ceny za token w porównaniu z Fable 5, jednocześnie pokonując Fable 5 w większości głównych benchmarków, co skutecznie uczyniło flagowy model zbędnym dla większości płacących użytkowników.
Fable 5.1 odwraca tę sytuację: teraz przewyższa Opus 5 we wszystkich benchmarkach opublikowanych przez Anthropic, w tym tych, w których wcześniej Opus 5 pokonywał Fable 5.
Jednak Fable 5.1 nadal kosztuje dwa razy więcej za token niż Opus 5 – 10 dolarów za wejście i 50 dolarów za wyjście, w porównaniu z 5 i 25 dolarów w przypadku Opus 5. Tokeny to podstawowa ilość informacji, którą model może przetworzyć (zwykle około dwóch trzecich przeciętnego angielskiego słowa), a firmy płacą za użycie, ponieważ intensywne przepływy pracy zwykle bardzo szybko wyczerpują limity ustalone w planach subskrypcyjnych.
Własna propozycja Anthropic dla tego modelu opiera się na poziomach wysiłku, a nie surowych wynikach: twierdzi, że uruchomienie Fable 5.1 przy niskim lub średnim wysiłku rozumowania dorównuje lub przewyższa dawne wyniki Fable 5 przy znacznie niższych kosztach, rezerwując najwyższe poziomy wysiłku dla problemów, które pokonują wszystko inne.
W przypadku rutynowej pracy ten argument za całkowitym pominięciem Opus 5 słabnie wraz z obniżaniem poziomu wysiłku.
Dostęp podlega temu samemu podziałowi, który obowiązywał w przypadku Fable 5 po miesiącach dostosowywania warunków przez Anthropic. W planach Pro oraz standardowych miejscach Team lub Enterprise, Fable 5.1 korzysta wyłącznie z kredytów typu pay-as-you-go rozliczanych według stawek API, ponieważ nie jest częścią tygodniowych limitów tych planów. W planach Max oraz premium miejscach Team lub Enterprise jest uwzględniony jako standardowa część subskrypcji do 50% tygodniowego użycia.
Claude Fable 5.1 jest teraz dostępny w Claude API, Amazon Bedrock, Google Cloud i Microsoft Foundry pod identyfikatorem modelu "claude-fable-5-1".






