Claude Fable 5 acaba de conquistar o primeiro lugar novamente

MirrorCodeClaudeDelegação em nível de projetoProgramação de IAGeração de CódigoGPT
2026-08-05Fonte: blockweeks.com
Claude Fable 5 acaba de conquistar o primeiro lugar novamente

Desta vez, o Claude realmente arrasou no ranking de programação de IA!

No ranking MirrorCode recém-atualizado, o Claude Fable 5 mais uma vez liderou as paradas com uma taxa de sucesso absoluta de 64%.

Logo atrás, a pontuação do GPT-5.6 Sol é apenas um terço disso!

O GPT-5.5, em quarto lugar, está ainda pior. Não só obteve apenas 10%, mas também foi esmagado pelo seu próprio antecessor, o GPT-5.4.

Programação de IA

Ainda mais surpreendente, ao usar linguagens de alto recurso como Go, a taxa de resolução do Fable 5 é de 64%; ao mudar para a linguagem de nicho Ada, a pontuação ainda permanece alta, em 61%.

Vale notar que no mundo de código aberto, os corpora de Python são aproximadamente 230 vezes maiores que os de Ada.

Mas com o Fable 5, a pontuação caiu apenas 3 pontos percentuais.

Programação de IA

Isso é interessante.

Se o modelo dependesse principalmente de memorizar sintaxe e padrões comuns de linguagens populares, então mudar para Ada deveria ter causado uma queda no desempenho.

Mas os resultados atuais apontam para outra possibilidade—

Os modelos mais fortes superaram a atração de corpora específicos e começaram a aprender como construir um projeto de software completo do zero.

Preso na linha de 100% de conclusão, um teste extremo de 10 bilhões de tokens

Especificamente, o MirrorCode completo inclui 25 programas-alvo, cobrindo áreas como ferramentas Unix, interpretadores, consulta de dados, bioinformática, criptografia e ferramentas de compressão.

Aqui, o modelo é colocado em um ambiente isolado, sem internet, sem acesso ao código-fonte do projeto original e sem capacidade de baixar dependências de terceiros. Ele recebe apenas documentação de alto nível, uma parte dos testes visíveis e um programa original que pode ser chamado repetidamente.

Em seguida, ele deve alimentar continuamente dados ao programa original, observar as saídas para adivinhar a lógica interna e, então, escrever um novo programa que se comporte de forma idêntica.

O ranking mais recente seleciona 15 alvos de Médio e Grande porte entre eles. Cada alvo usa duas linguagens de implementação, e cada linguagem é executada três vezes.

Além disso, a taxa de conclusão tanto para testes visíveis quanto ocultos deve chegar a 100% para passar; 99,9% não é aceitável.

Se um único caso extremo for perdido, toda a execução ainda é contada como falha.

Programação de IA

Para forçar o modelo a preencher as últimas lacunas, o MirrorCode aumenta o orçamento de execução única para 10 bilhões de tokens, permitindo uma execução contínua máxima de 7 dias.

A tarefa única mais cara no artigo é ainda mais extrema: o modelo rodou continuamente por 19 dias, com um custo de US$ 2.600 por execução.

Durante esses 19 dias, o modelo executa repetidamente o programa original, compara resultados, preenche funcionalidades ausentes e então reexecuta os testes. Se ocorrerem erros, ele investiga a causa; se as saídas não corresponderem, ele muda as hipóteses; uma vez que passes parciais são alcançados, ele avança para perseguir a próxima lacuna.

Todo o processo se assemelha a uma sessão de depuração que dura vários dias, em vez de uma única geração.

Programação com IA

O exemplo do gotree é o mais ilustrativo.

Esta ferramenta de bioinformática originalmente tinha aproximadamente 16.000 linhas de código Go e mais de 40 comandos.

O Claude Opus 4.7 levou 14 horas e US$ 251, passando em 2.000 de 2.001 testes, alcançando uma taxa de conclusão de 99,95%.

Embora tenha perdido um caso extremo de nicho envolvendo anotações de data e tenha sido interrompido pela linha de conclusão de 100% do MirrorCode, ele já havia comprimido o que originalmente era um esforço de engenharia de semanas em pouco mais de uma dúzia de horas—

A Epoch estima que, sem IA, um engenheiro humano precisaria de pelo menos 2 a 17 semanas para concluir a mesma tarefa.

No deserto de corpus, Fable 5 caiu apenas 3 pontos

O artigo do MirrorCode usou a mistura de treinamento pública do StarCoder como referência.

Entre ela, Python representa cerca de 8%, enquanto Ada é apenas 0,034%, sendo o primeiro aproximadamente 230 vezes maior que o último.

Programação com IA

Claro, não podemos saber quantos códigos Ada os modelos de código fechado realmente viram. Mas usando o ecossistema público como referência, a escassez de Ada já é intuitiva o suficiente.

Essa linguagem aparece principalmente em sistemas aeroespaciais, de defesa e outros sistemas críticos de segurança. Seja no tamanho da comunidade, no número de tutoriais ou em projetos de código aberto, está longe de ser comparável a Python, JavaScript ou Go.

E o Fable 5 claramente não está traduzindo código Go linha por linha para Ada.

É mais como primeiro entender como o programa original realmente funciona, depois mudar para outra linguagem e recriar o mesmo comportamento.

Programação com IA

Em contraste, outros modelos não são tão estáveis.

O GPT-5.6 Sol caiu de 24% para 19%, o GPT-5.4 de 21% para 12%, e o GPT-5.5 até caiu de 17% para 5%. Uma vez que a linguagem muda, a lacuna é imediatamente amplificada.

Entregando o Projeto Inteiro à IA

Hoje em dia, o Cursor permitiu que centenas de agentes colaborassem por quase uma semana, escrevendo do zero mais de 1 milhão de linhas de código de navegador distribuídas em 1.000 arquivos.

A Anthropic, por outro lado, teve 16 agentes Claude executando quase 2.000 sessões em paralelo, construindo no final um compilador C com 100.000 linhas que pode compilar o kernel Linux 6.9.

Na amostra de usuários pessoais do Codex divulgada pela OpenAI até maio, 70,2% enviaram pelo menos uma tarefa estimada em mais de uma hora de trabalho humano; 25,6% enviaram tarefas que excedem oito horas.

A unidade que as pessoas entregam à IA está mudando de um pedaço de código ou um bug para uma tarde, uma semana, ou até mesmo o projeto inteiro.

Os 64% do MirrorCode são precisamente uma quantificação dessa "delegação em nível de projeto".

Isso mostra que, desde que o objetivo seja claro o suficiente e os resultados possam ser verificados automaticamente, os modelos de fronteira já podem concluir de forma independente uma parte de softwares de médio a grande porte.

Para todos que estão entregando trabalho à IA, a mudança já é iminente—

Antes, você tinha que observar cada linha de código que ela escrevia; em seguida, é mais provável que você apenas verifique nos pontos-chave se ela saiu do caminho.

O código se tornará cada vez mais barato.

E aqueles que conseguem articular problemas com clareza e verificar resultados com precisão se tornarão cada vez mais valiosos.

Referência: https://epoch.ai/MirrorCode

Este artigo é da conta pública do WeChat "新智元", autor: ASI启示录; editor: 摩西