Batalha de Geração de Vídeo por IA em Julho: Mais de 20 Bilhões em Investimentos, Quem Está na Final?

geração de vídeo por IAmodelo mundialSeedanceKling AIPixVersefinanciamentounicórnioFlovaAIVidu
2026-07-29Fonte: blockweeks.com
Batalha de Geração de Vídeo por IA em Julho: Mais de 20 Bilhões em Investimentos, Quem Está na Final?

Aishi Technology

Julho ainda não acabou, e o setor de geração de vídeo por IA já está pegando fogo.

De 3 a 23 de julho, em apenas 20 dias, cinco empresas anunciaram financiamentos em grande escala em sequência.

Kling AI
levantou US$ 3 bilhões, a Shengshu Technology levantou US$ 500 milhões, a Aishi Technology levantou várias centenas de milhões de dólares na Série C+, a Zhixiang Future levantou 1,5 bilhão de RMB na Série C, e até mesmo a FlovaAI, uma nova empresa estabelecida há menos de um ano, levantou US$ 80 milhões em rodada anjo.

O financiamento total das quatro primeiras empresas de nível unicórnio excede 26,2 bilhões de RMB. Ou seja, o dinheiro investido apenas em julho de 2026 é mais do que todo o setor levantou nos últimos dois anos (2024-2025) combinados.

Por que todos se concentraram em financiamento em julho? O que exatamente aconteceu? Isso não deveria ser uma coincidência.

Kling AI: co-investimento histórico da BAT, ARR quadruplicou em um ano

Em 3 de julho,

Kling AI
anunciou um teto de financiamento da Série A de US$ 3 bilhões, liderado pela CPE Yuanfeng e pela Guofang Innovation, com 34 instituições participantes — na lista de investidores, Tencent, Alibaba Cloud e Baidu apareceram juntos pela primeira vez. A FountainBridge Capital atuou como consultora financeira.

O teto de financiamento da Série A de US$ 3 bilhões corresponde a uma avaliação pós-investimento de aproximadamente US$ 18 bilhões; a parte atualmente assinada é de cerca de 19 bilhões de RMB.

Por que o capital ousou dar esse número? Tem que ser que o relatório do 1º trimestre de 2026 da Kuaishou deu confiança ao mercado.

O relatório financeiro do 1º trimestre de 2026 da Kuaishou divulgou que

Kling AI
alcançou receita de mais de 650 milhões de RMB em um único trimestre, um aumento anual de mais de 300%. A taxa de receita anualizada (ARR) disparou de US$ 100 milhões em março de 2025 para quase US$ 500 milhões em março de 2026, quadruplicando ano a ano.

Esse número é incomparável no setor de vídeo por IA — exceto pelo Seedance da ByteDance, nenhuma outra empresa doméstica alcançou essa escala.

A receita da Kling é impulsionada por duas rodas: chamadas de API de clientes empresariais do lado B + assinaturas de membros pagos do lado P. Até junho de 2026,

Kling AI
tem mais de 100 milhões de usuários globais e quase 50.000 clientes empresariais. Por exemplo, a Kling participou profundamente da produção de cenas virtuais e efeitos especiais do popular drama histórico chinês "O Ano Pacífico", e apoiou a geração de centenas de tomadas de alta qualidade na série de Hollywood "A Dinastia David".

Em termos de produtos, em fevereiro deste ano, a Kling lançou o modelo da série 3.0, alcançando geração de vídeo de até 15 segundos, controle de storyboard, consistência de assunto e saída simultânea de áudio e vídeo.

Dois detalhes merecem atenção. Primeiro, a avaliação é menor do que o alvo de US$ 20 bilhões rumores em maio, com preços mais pragmáticos, e o negócio realmente fechou mais rápido; segundo, uma cláusula de desempenho foi embutida no anúncio — se a Beijing Kling não concluir um IPO antes de outubro de 2031, os investidores têm o direito de exigir recompra ao principal mais 8% de juros simples anuais.

A combinação de spin-off, financiamento, incentivos de capital e cláusulas de recompra aponta para uma direção clara: a Kling está pavimentando o caminho para uma listagem independente.

Tecnologia Shengshu: financiamento de US$ 500 milhões às vésperas do IPO, de modelo de vídeo a "modelo mundial"

Em 6 de julho, a Tecnologia Shengshu anunciou um financiamento de US$ 500 milhões na Série B+.

Mas se você olhar a linha do tempo, a empresa fez três rodadas em 5 meses: mais de 600 milhões de RMB na Série A+ em fevereiro (liderada pela Zhongguancun Science City e Xinglian Capital), 2 bilhões de RMB na Série B em abril (liderada pela Alibaba Cloud), além desta rodada de US$ 500 milhões em julho, totalizando mais de 5 bilhões de RMB.

Três rodadas em 5 meses, esse ritmo indica uma coisa: o capital está correndo para embarcar. Por que a urgência?

No final de março deste ano, a Tecnologia Shengshu concluiu uma reforma societária — um movimento padrão antes da listagem. Fontes do mercado dizem que ela pode iniciar o processo de IPO em Hong Kong já no primeiro semestre do ano. Portanto, o capital está correndo para embarcar às vésperas do IPO.

O produto principal da Tecnologia Shengshu é

Vidu
, lançado globalmente em julho de 2024, e já iterou para a versão

Vidu
S1 em três anos — um modelo interativo em tempo real que suporta quadros controlados por voz e geração de duração ilimitada (de 1 minuto a 2 horas).

Em 2025, a Tecnologia Shengshu alcançou mais de 10x de crescimento em usuários e receita, com mais de 400 milhões de vídeos gerados acumulados; especialmente, sua linha de clientes B-end é bastante impressionante: no campo de publicidade e e-commerce, tem JD.com, Alibaba 1688, Amazon, Meituan, Focus Media, BlueFocus, L'Oréal, Anta; no campo de filmes e animação, cobre Tencent Animation, Yuewen Group, CCTV Animation, iQiyi, Mango TV; no campo de jogos, atende Lilith Games e 37 Interactive Entertainment.

A Tecnologia Shengshu não está satisfeita apenas com a geração de vídeo; este ano começou a se estender em direção à inteligência incorporada.

Em abril de 2026, a Tecnologia Shengshu lançou oficialmente o modelo geral de ação mundial Motubrain, adotando a rota técnica World Action Model (WAM), unificando modelagem de percepção, previsão e ação, permitindo que robôs tenham "um cérebro para prever" e "um cérebro para multitarefa", enquanto a versão comercial MotuBrain entrou em verificação em nível industrial.

Esta empresa afiliada à Tsinghua, fundada há apenas três anos, está evoluindo rapidamente de uma "empresa de modelo de vídeo" para uma "plataforma geral de modelo mundial". Após a chegada dos US$ 500 milhões, os fundos serão usados principalmente para pesquisa e desenvolvimento do "modelo mundial geral".

Esta é a história que o capital realmente valoriza.

Tecnologia Aishi: Unicórnio de três anos, 150 milhões de usuários globais

Em 14 de julho, a rodada Série C+ da Tecnologia Aishi foi liderada pela Alibaba. Juntamente com a rodada Série C de US$ 300 milhões concluída em março (liderada pela CDH Investments, com quase 20 participantes, incluindo China Ruyi e 37 Interactive Entertainment), o financiamento total da Série C atingiu 2,98 bilhões de RMB, com uma avaliação pós-investimento superior a US$ 2 bilhões.

A Alibaba havia liderado anteriormente a rodada Série B de US$ 60 milhões da Aishi em setembro de 2025, e desta vez continuou a aumentar sua participação na Série C+. A Ant Group também liderou a rodada A2 de mais de 100 milhões de RMB já em abril de 2024.

O investimento contínuo da Alibaba na Aishi mostra que ela considera a Aishi como um ponto de layout estratégico no setor de vídeo de IA.

Até março de 2026, a Tecnologia Aishi tem mais de 150 milhões de usuários globais, 15 milhões de usuários ativos mensais e uma receita recorrente anual (ARR) de US$ 40 milhões.

Curiosamente, o cofundador Xie Xuzhang revelou que o custo de treinamento do modelo de mesmo nível da Aishi é apenas cerca de 10% do de seus pares. O caminho chave para essa vantagem de custo está na triagem de dados de alta qualidade, reduzindo iterações de treinamento ineficazes e utilizando uma arquitetura otimizada de Transformer de Difusão para melhorar a utilização de recursos, reduzir o custo de treinamento único e alcançar reutilização de experiência de engenharia.

Em janeiro deste ano, a Aishi lançou

PixVerse
R1, afirmando ser o primeiro modelo mundial universal em tempo real do mundo com suporte a 1080P. Diferente da geração de vídeo tradicional "pré-gravada", o R1 alcança "geração dinâmica em tempo real" — os usuários podem inserir novos comandos a qualquer momento durante a reprodução do vídeo, e a cena pode alcançar transições naturais e suaves de iluminação e câmera em cerca de 0,5 segundos.

爱诗科技

A abordagem da Aishi difere de outros players: enquanto outros competem na qualidade de geração, ela compete na capacidade de interação. Apenas uma semana após o lançamento do R1, a China Ruyi anunciou uma cooperação estratégica com a Aishi e investiu US$ 14,2 milhões.

A rodada de financiamento da Série C+ mais recente declara claramente seu uso: para modelos de fundação de geração de vídeo, modelos mundiais em tempo real e crescimento global.

ZhiXiang Future: Novo Unicórnio, Abordagem Alternativa de "Modelo + Agente + Hardware"

A ZhiXiang Future é um "novo unicórnio" nesta lista — após uma rodada da Série C de 1,5 bilhão de yuans, sua avaliação pós-investimento ultrapassa US$ 1 bilhão. O fundador Mei Tao é acadêmico estrangeiro da Academia Canadense de Engenharia e ex-vice-presidente da JD.com.

A empresa concluiu três rodadas de financiamento nos últimos três meses, totalizando mais de 2,1 bilhões de yuans.

Em 23 de julho, a ZhiXiang Future anunciou uma rodada da Série C de 1,5 bilhão de yuans, liderada pelo Fundo Nacional de Previdência Social, Fundo de Revitalização Industrial de Sichuan e ICBC Investment, com participação do Shanghai Film New Vision Fund, Huace Film & TV e outras 18 instituições — uma combinação de fundos nacionais de longo prazo, capital estatal local e capital industrial, rara no setor de vídeo de IA.

A ZhiXiang lançou o primeiro modelo de arquitetura DiT de geração de vídeo de uso aberto do mundo já em maio de 2024, e na WAIC 2026, que acabou de terminar, lançou o agente de criação multimodal vivago R1, focado em geração e edição de vídeo de comprimento ilimitado.

Atualmente, seus produtos cobrem mais de 100 países, atendendo mais de 50 milhões de usuários e 40.000 clientes empresariais. Sua receita anual em 2025 ultrapassou 100 milhões de yuans, e a receita do primeiro trimestre de 2026 já superou o total do ano passado. Mei Tao afirmou durante a Chain Expo 2026 que, devido ao alto custo do pré-treinamento de modelos grandes, a empresa espera atingir o ponto de equilíbrio mensal até 2029.

Mei Tao também foi direto: "Não competimos com a ByteDance em capacidades subjacentes; focamos em marketing comercial e colaboração profissional de cinema e TV."

O caminho da ZhiXiang é claro: evitar confronto direto com grandes players e cultivar profundamente cenários verticais. Primeiro construiu uma base de usuários com modelos de imagem, depois evoluiu para vídeo e modelos mundiais.

FlovaAI: Rodada Anjo de US$ 80 Milhões, Terceira Saída de Guo Lie

O fundador da FlovaAI, Guo Lie, é um nome inevitável na história da internet móvel chinesa. Em 2013, Guo Lie criou o FaceQ, seguido pelo FaceU, e em 2018, a equipe foi adquirida pela ByteDance por US$ 300 milhões. Depois disso, ele participou da incubação do Qingyan Camera,

Xingtu
, e

CapCut
— isso mesmo,

CapCut
foi algo que ele ajudou a criar.

Em 2025, Guo Lie partiu novamente, fundando a Shenzhen Yuzhou Technology, e lançou o Flova.ai em outubro. Sequoia China, IDG e Sky9 Capital investiram um total de mais de US$ 80 milhões.

Ousar dar US$ 80 milhões em uma rodada anjo, os investidores estão apostando não no produto, mas no próprio Guo Lie. Cada produto de ferramenta de consumo que ele fez no passado se tornou um sucesso fenomenal.

爱诗科技

Flova é uma plataforma de agente de criação de vídeo nativa em IA. Os usuários expressam suas necessidades criativas por meio de conversa, e o agente completa todo o processo, desde roteiro, design de personagens, storyboard, até geração de imagem/vídeo/áudio e montagem de linha do tempo para edição.

Diferente do formato de canvas predominante no mercado, a Flova projeta um espaço de trabalho em "storyboard". O agente recebe instruções na caixa de diálogo, e o processo de trabalho é exibido no storyboard à esquerda. Os usuários visualizam os resultados diretamente na área de pré-visualização central e podem dar duplo clique para intervir e modificar se não estiverem satisfeitos.

Vários usuários iniciais relataram que a maior característica da Flova é sua "memória"—após criar mais de uma dúzia de episódios, ela ainda consegue lembrar de um storyboard específico do primeiro episódio. Essa capacidade de memória de contexto longo é muito proeminente entre produtos similares.

Nesta fase, a Flova adota uma estratégia de margem zero. Guo Lie disse: "Durante o período de desenvolvimento, tentaremos alcançar lucro bruto zero." A equipe não tem pressa em buscar receita de curto prazo, mas foca no índice de consumo efetivo: quanto do consumo de tokens os usuários consideram valioso, e quanto é desperdiçado devido a inadequações do produto.

Por que todos se aglomeraram em julho? Possíveis razões

Agora voltando à questão central: Por que essas cinco empresas coincidentemente realizaram financiamentos intensivos em julho? Juntando todas as informações, encontrei quatro razões que formam uma ressonância.

Primeiro, o "efeito sifão" do Seedance da ByteDance força todos a acelerar.

Desde o lançamento do Seedance 2.0 da ByteDance em fevereiro deste ano, sua receita mensal ultrapassou 1 bilhão de yuans, com uma taxa de penetração de cerca de 95% na indústria de minisséries, e ocupa mais de 80% da participação de mercado por consumo diário de tokens.

A Volcano Engine elevou sua meta de receita MaaS para 2026 de 1,5 bilhão do ano passado para 15 bilhões—um aumento de dez vezes, quase inteiramente dependente apenas do modelo Seedance. Além disso, o Seedance 2.1 está prestes a ser lançado, com melhoria de desempenho esperada de mais 20%, e o preço da versão de baixo custo está sendo reduzido para 0,5 yuan por segundo.

Quando a ByteDance está usando um ataque duplo de "lacuna de capacidade de modelo + guerra de preços" no mercado, os outros players, se não levantarem dinheiro rapidamente, acumularem poder computacional e acelerarem a iteração, podem nem ter a qualificação para permanecer na mesa.

Todos estão procurando um ponto de apoio para contra-atacar a ByteDance no longo prazo. Mas as abordagens são completamente diferentes: Kling adota uma rota multimodal de plataforma completa, Shengshu adota uma rota de entusiasta de tecnologia, Aishi adota uma rota de diferenciação de interação em tempo real, Zhixiang adota uma rota de cultivo profundo de cenários verticais, e FlovaAI adota uma rota de fluxo de trabalho de agente.

O capital não está investindo na mesma história, mas apostando em diferentes rotas técnicas e modelos de negócios.

Segundo, a comercialização foi comprovada, e o capital vê um caminho de saída.

No ano passado, todos ainda discutiam "A IA de vídeo pode ganhar dinheiro?" Este ano, os dados estão aí: o ARR da Kling é de quase US$ 500 milhões, a receita da Shengshu em 2025 cresceu mais de 10 vezes, o ARR da Aishi é de US$ 40 milhões, e o Seedance ultrapassou 1 bilhão em um único mês.

Publicidade, e-commerce, minisséries, jogos, cinema e TV—os cenários pagos para IA de vídeo estão sendo validados um a um. Esse estado de "fluxo de caixa visível" é o gatilho direto para a entrada concentrada de capital.

Terceiro, o setor evoluiu de "geração de vídeo" para "modelo de mundo", e a narrativa foi elevada.

No primeiro semestre deste ano, o cenário competitivo dos grandes modelos de base tornou-se mais concentrado. Os fundos do mercado primário estão começando a buscar a próxima direção, e a geração multimodal e os modelos de mundo tornaram-se a saída consensual.

Observe uma tendência: Nenhuma das quatro empresas que receberam financiamento massivo afirma estar fazendo apenas "geração de vídeo". A Kling fala sobre um fluxo de trabalho criativo multimodal All-in-One, a Shengshu fala sobre "modelos de mundo gerais" e inteligência incorporada, a Aishi fala sobre "modelos de mundo em tempo real" e entretenimento interativo, e a Zhixiang fala sobre "modelos de mundo multimodais nativos" e raciocínio causal.

A geração de vídeo é apenas o ponto de entrada; o verdadeiro objetivo final é o modelo de mundo—um sistema de IA que pode entender, raciocinar e construir o mundo físico. Os investidores não estão olhando para o mercado de geração de vídeo deste ano, mas para quem surgirá com um modelo de mundo daqui a três anos.

Quarto, a janela de IPO em Hong Kong está aberta, e o capital está disputando "ingressos".

Em janeiro deste ano, a Zhipu e a

MiniMax
tiveram seus preços de ações disparando após listagem na Bolsa de Valores de Hong Kong. No primeiro trimestre, a captação de recursos via IPO em Hong Kong ultrapassou HK$ 100 bilhões em 79 dias, estabelecendo um recorde de ritmo mais rápido, com mais de 350 empresas na fila.

A Shengshu concluiu sua reforma acionária, e os rumores de IPO estão em alta; o financiamento de spin-off da Kling com cláusulas de recompra é essencialmente um prelúdio para a listagem. O financiamento intensivo no mercado primário está em grande parte se preparando para os ingressos para o mercado secundário.

Finalmente, quero dizer que depois deste julho, a pista de vídeo com IA entrou nas finais. O cenário provavelmente ficará muito mais claro: empresas líderes estão segurando fundos pesados para correr para listagens, empresas de médio porte estão sendo reavaliadas pela narrativa do modelo de mundo, e novos players como a Flova estão tentando contornar a corrida armamentista de modelos com Agentes, conquistando uma fatia do bolo na camada de aplicação.

Mas o problema por trás da correria é que o dinheiro vem rápido, mas queimá-lo é ainda mais rápido. A geração de vídeo é a categoria de IA mais intensiva em computação. Mais de 26 bilhões parece impressionante, mas distribuído pela conta anual de computação de cada empresa, pode não ser suficiente.

Este artigo é do perfil público do WeChat "IT Juzi" (ID: itjuzi521), autora: Wu Meimei