O Google lançou o Gemini 3.7 Flash na quinta-feira, um modelo de codificação e agentes de baixo custo agora disponível de forma geral.
A OpenAI apresentou o GPT-5.6 Sol Ultrafast, um nível alimentado por Cerebras que executa seu modelo mais capaz até 14 vezes mais rápido.
A corrida pela velocidade mudou de inteligência bruta para agentes em tempo real, mas apenas o modelo do Google chega a todos os desenvolvedores hoje.
O Google e a OpenAI transmitiram a mesma mensagem hoje: a IA agora é rápida o suficiente para impressionar aqueles que usam agentes de IA, com cada empresa anunciando modelos ultrarrápidos.
Os dois lançamentos são construídos de forma diferente, e apenas um está realmente em suas mãos hoje.
O Google lançou o Gemini 3.7 Flash, seu modelo mais recente ajustado para codificação de software e fluxos de trabalho empresariais autônomos. A OpenAI abriu uma prévia limitada do GPT-5.6 Sol Ultrafast, um novo nível de serviço que executa seu modelo mais capaz a até 750 tokens de saída por segundo.
Hoje estamos apresentando o Gemini 3.7 Flash, nosso modelo de trabalho mais inteligente até agora para codificação e agentes.
Este modelo traz ganhos substanciais em engenharia de software, desenvolvimento web e trabalho de conhecimento complexo.
O Gemini 3.7 Flash é um modelo de disponibilidade geral. Ele aceita até um milhão de tokens de entrada (aproximadamente 750.000 palavras) e retorna 64.000, lidando com texto, imagens, vídeo, áudio e PDFs, e pode chamar ferramentas e controlar um computador. O Google o apresenta como o cérebro barato para sistemas autônomos que planejam tarefas e concluem trabalhos de várias etapas com menos ajuda humana.
O modelo não está sacrificando qualidade por velocidade. Ele é ao mesmo tempo mais capaz e mais eficiente, sendo capaz de concluir nossa tarefa de codificação de teste em 2 minutos e 13 segundos, enquanto o modelo Flash mais recente levou mais de 5 minutos. A diferença de qualidade entre os dois também é perceptível.
O Ultrafast da OpenAI não é um modelo novo. É o GPT-5.6 Sol—o mesmo modelo que a OpenAI usou uma equipe vermelha de IA para fortalecer contra ataques de injeção de prompt antes do lançamento—em um caminho mais rápido, alimentado pelo fabricante de chips Cerebras. É cerca de 14 vezes mais rápido que a velocidade padrão do próprio GPT-5.6 Sol.
Visualizando o modo Ultrafast: GPT-5.6 Sol a até 14x a velocidade.
Lançando primeiro na API da OpenAI para um grupo seleto de clientes com acesso expandido a mais empresas à medida que a capacidade cresce. pic.twitter.com/a5dleofiDJ
Os chips em escala de wafer da Cerebras geram até 750 tokens por segundo, cerca de 560 palavras, rápido o suficiente para que um agente de voz possa pensar durante uma chamada.
Os números que importam
A própria planilha de benchmarks do Google coloca o Gemini 3.7 Flash à frente do Claude Sonnet 5, GPT-5.6 Terra e outros em 11 das 18 categorias testadas, incluindo uma pontuação máxima de 1.588 Elo no Code Arena para desenvolvimento web e 30,4% no AutomationBench para fluxos de trabalho empresariais. Isso é tudo baseado na metodologia do Google, então trate a liderança como uma afirmação da empresa.
Como qualquer Gemini Flash, o modelo também é barato. A 75 centavos por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída até o final do ano, é metade da taxa original do Gemini 3.6 Flash. Esse preço introdutório expira em 31 de dezembro e depois dobra para US$ 1,50 e US$ 7,50, o que ainda é barato para um modelo do Google.
A OpenAI não publicou pontuações comparativas para o Ultrafast além de citações de clientes. O engenheiro de IA da Jane Street, John Crepezzi, disse no anúncio da OpenAI que a velocidade da Cerebras "permite diferentes maneiras de usar os modelos". O líder de produto da Podium, Courtland Lykins, chamou isso de "inestimável em nossa pilha de voz", dizendo que a velocidade "muda completamente a experiência da chamada". O nível é somente para convidados por enquanto.
O impulso pela velocidade chega enquanto os laboratórios mudam de "quem é mais inteligente" para "quem é rápido o suficiente para agentes". O timing do Google é pontual. Seu principal Gemini 3.5 Pro ainda está ausente, sem data de lançamento definida, três semanas após o 3.6 Flash e dias após uma reformulação da liderança da DeepMind que afastou Demis Hassabis para dar lugar ao vice Koray Kavukcuoglu. A OpenAI, enquanto isso, está alugando a velocidade da Cerebras em vez de esperar por sua própria pilha.
O Gemini 3.7 Flash já está disponível em mais de 160 países; o GPT-5.6 Sol Ultrafast ainda é somente para convidados.