Desta vez, o Claude realmente arrasou no ranking de programação de IA!
No ranking MirrorCode recém-atualizado, o Claude Fable 5 mais uma vez liderou as paradas com uma taxa de sucesso absoluta de 64%.
Logo atrás, a pontuação do GPT-5.6 Sol é apenas um terço disso!
O GPT-5.5, em quarto lugar, está ainda pior. Não só obteve apenas 10%, mas também foi esmagado pelo seu próprio antecessor, o GPT-5.4.
Ainda mais surpreendente, ao usar linguagens de alto recurso como Go, a taxa de resolução do Fable 5 é de 64%; ao mudar para a linguagem de nicho Ada, a pontuação ainda permanece alta, em 61%.
Vale notar que no mundo de código aberto, os corpora de Python são aproximadamente 230 vezes maiores que os de Ada.
Mas com o Fable 5, a pontuação caiu apenas 3 pontos percentuais.
Isso é interessante.
Se o modelo dependesse principalmente de memorizar sintaxe e padrões comuns de linguagens populares, então mudar para Ada deveria ter causado uma queda no desempenho.
Mas os resultados atuais apontam para outra possibilidade—
Os modelos mais fortes superaram a atração de corpora específicos e começaram a aprender como construir um projeto de software completo do zero.
Preso na linha de 100% de conclusão, um teste extremo de 10 bilhões de tokens
Especificamente, o MirrorCode completo inclui 25 programas-alvo, cobrindo áreas como ferramentas Unix, interpretadores, consulta de dados, bioinformática, criptografia e ferramentas de compressão.
Aqui, o modelo é colocado em um ambiente isolado, sem internet, sem acesso ao código-fonte do projeto original e sem capacidade de baixar dependências de terceiros. Ele recebe apenas documentação de alto nível, uma parte dos testes visíveis e um programa original que pode ser chamado repetidamente.
Em seguida, ele deve alimentar continuamente dados ao programa original, observar as saídas para adivinhar a lógica interna e, então, escrever um novo programa que se comporte de forma idêntica.
O ranking mais recente seleciona 15 alvos de Médio e Grande porte entre eles. Cada alvo usa duas linguagens de implementação, e cada linguagem é executada três vezes.
Além disso, a taxa de conclusão tanto para testes visíveis quanto ocultos deve chegar a 100% para passar; 99,9% não é aceitável.
Se um único caso extremo for perdido, toda a execução ainda é contada como falha.
Para forçar o modelo a preencher as últimas lacunas, o MirrorCode aumenta o orçamento de execução única para 10 bilhões de tokens, permitindo uma execução contínua máxima de 7 dias.
A tarefa única mais cara no artigo é ainda mais extrema: o modelo rodou continuamente por 19 dias, com um custo de US$ 2.600 por execução.
Durante esses 19 dias, o modelo executa repetidamente o programa original, compara resultados, preenche funcionalidades ausentes e então reexecuta os testes. Se ocorrerem erros, ele investiga a causa; se as saídas não corresponderem, ele muda as hipóteses; uma vez que passes parciais são alcançados, ele avança para perseguir a próxima lacuna.
Todo o processo se assemelha a uma sessão de depuração que dura vários dias, em vez de uma única geração.
O exemplo do gotree é o mais ilustrativo.
Esta ferramenta de bioinformática originalmente tinha aproximadamente 16.000 linhas de código Go e mais de 40 comandos.
O Claude Opus 4.7 levou 14 horas e US$ 251, passando em 2.000 de 2.001 testes, alcançando uma taxa de conclusão de 99,95%.
Embora tenha perdido um caso extremo de nicho envolvendo anotações de data e tenha sido interrompido pela linha de conclusão de 100% do MirrorCode, ele já havia comprimido o que originalmente era um esforço de engenharia de semanas em pouco mais de uma dúzia de horas—
A Epoch estima que, sem IA, um engenheiro humano precisaria de pelo menos 2 a 17 semanas para concluir a mesma tarefa.
No deserto de corpus, Fable 5 caiu apenas 3 pontos
O artigo do MirrorCode usou a mistura de treinamento pública do StarCoder como referência.
Entre ela, Python representa cerca de 8%, enquanto Ada é apenas 0,034%, sendo o primeiro aproximadamente 230 vezes maior que o último.
Claro, não podemos saber quantos códigos Ada os modelos de código fechado realmente viram. Mas usando o ecossistema público como referência, a escassez de Ada já é intuitiva o suficiente.
Essa linguagem aparece principalmente em sistemas aeroespaciais, de defesa e outros sistemas críticos de segurança. Seja no tamanho da comunidade, no número de tutoriais ou em projetos de código aberto, está longe de ser comparável a Python, JavaScript ou Go.
E o Fable 5 claramente não está traduzindo código Go linha por linha para Ada.
É mais como primeiro entender como o programa original realmente funciona, depois mudar para outra linguagem e recriar o mesmo comportamento.
Em contraste, outros modelos não são tão estáveis.
O GPT-5.6 Sol caiu de 24% para 19%, o GPT-5.4 de 21% para 12%, e o GPT-5.5 até caiu de 17% para 5%. Uma vez que a linguagem muda, a lacuna é imediatamente amplificada.
Entregando o Projeto Inteiro à IA
Hoje em dia, o Cursor permitiu que centenas de agentes colaborassem por quase uma semana, escrevendo do zero mais de 1 milhão de linhas de código de navegador distribuídas em 1.000 arquivos.
A Anthropic, por outro lado, teve 16 agentes Claude executando quase 2.000 sessões em paralelo, construindo no final um compilador C com 100.000 linhas que pode compilar o kernel Linux 6.9.
Na amostra de usuários pessoais do Codex divulgada pela OpenAI até maio, 70,2% enviaram pelo menos uma tarefa estimada em mais de uma hora de trabalho humano; 25,6% enviaram tarefas que excedem oito horas.
A unidade que as pessoas entregam à IA está mudando de um pedaço de código ou um bug para uma tarde, uma semana, ou até mesmo o projeto inteiro.
Os 64% do MirrorCode são precisamente uma quantificação dessa "delegação em nível de projeto".
Isso mostra que, desde que o objetivo seja claro o suficiente e os resultados possam ser verificados automaticamente, os modelos de fronteira já podem concluir de forma independente uma parte de softwares de médio a grande porte.
Para todos que estão entregando trabalho à IA, a mudança já é iminente—
Antes, você tinha que observar cada linha de código que ela escrevia; em seguida, é mais provável que você apenas verifique nos pontos-chave se ela saiu do caminho.
O código se tornará cada vez mais barato.
E aqueles que conseguem articular problemas com clareza e verificar resultados com precisão se tornarão cada vez mais valiosos.
Referência: https://epoch.ai/MirrorCode
Este artigo é da conta pública do WeChat "新智元", autor: ASI启示录; editor: 摩西












