Juillet n'est pas encore terminé, et le secteur de la génération vidéo par IA est déjà en ébullition.
Du 3 au 23 juillet, en seulement 20 jours, cinq entreprises ont annoncé successivement des levées de fonds à grande échelle.
Kling AI
a levé 3 milliards de dollars, Shengshu Technology a levé 500 millions de dollars, Aishi Technology a levé plusieurs centaines de millions de dollars en série C+, Zhixiang Future a levé 1,5 milliard de RMB en série C, et même FlovaAI, une nouvelle entreprise créée il y a moins d'un an, a levé 80 millions de dollars en amorçage.
Le financement total des quatre premières entreprises de type licorne dépasse 26,2 milliards de RMB. Autrement dit, l'argent injecté en juillet 2026 à lui seul est supérieur à celui levé par l'ensemble du secteur au cours des deux dernières années (2024-2025) combinées.
Pourquoi ont-ils tous concentré leurs levées de fonds en juillet ? Que s'est-il passé exactement ? Cela ne devrait pas être une coïncidence.
Kling AI : co-investissement historique de BAT, ARR quadruplé en un an
Le 3 juillet,
Kling AI
a annoncé un plafond de financement de série A de 3 milliards de dollars, mené par CPE Yuanfeng et Guofang Innovation, avec la participation de 34 institutions — dans la liste des investisseurs, Tencent, Alibaba Cloud et Baidu sont apparus ensemble pour la première fois. FountainBridge Capital a agi en tant que conseiller financier.
Le plafond de financement de série A de 3 milliards de dollars correspond à une valorisation post-investissement d'environ 18 milliards de dollars ; la partie actuellement signée est d'environ 19 milliards de RMB.
Pourquoi le capital a-t-il osé donner ce chiffre ? C'est que le rapport du premier trimestre 2026 de Kuaishou a donné confiance au marché.
Le rapport financier du premier trimestre 2026 de Kuaishou a révélé que
Kling AI
a réalisé un chiffre d'affaires trimestriel de plus de 650 millions de RMB, en hausse de plus de 300 % en glissement annuel. Le taux de revenus annualisé (ARR) est passé de 100 millions de dollars en mars 2025 à près de 500 millions de dollars en mars 2026, quadruplant en glissement annuel.
Ce chiffre est inégalé dans le secteur de la vidéo IA — à l'exception de Seedance de ByteDance, aucune autre entreprise nationale n'a atteint cette échelle.
Les revenus de Kling sont tirés par deux moteurs : les appels API des clients entreprises (B2B) + les abonnements payants des membres (B2C). En juin 2026,
Kling AI
compte plus de 100 millions d'utilisateurs dans le monde et près de 50 000 clients entreprises. Par exemple, Kling a participé activement à la production de scènes virtuelles et d'effets spéciaux de la série dramatique chinoise populaire « L'Année paisible », et a soutenu la génération de centaines de plans de haute qualité dans la série hollywoodienne « La Dynastie David ».
En termes de produits, en février de cette année, Kling a lancé le modèle de la série 3.0, permettant la génération de vidéos allant jusqu'à 15 secondes, le contrôle du storyboard, la cohérence du sujet et la sortie simultanée de l'audio et de la vidéo.
Deux détails méritent d'être notés. Premièrement, la valorisation est inférieure à l'objectif de 20 milliards de dollars évoqué en mai, avec un prix plus pragmatique, et la transaction s'est en fait conclue plus rapidement ; deuxièmement, une clause de performance a été intégrée dans l'annonce — si Beijing Kling ne parvient pas à réaliser une introduction en bourse avant octobre 2031, les investisseurs ont le droit d'exiger un rachat au principal plus 8 % d'intérêt simple annuel.
La combinaison de la scission, du financement, des incitations en actions et des clauses de rachat indique une direction claire : Kling prépare le terrain pour une cotation indépendante.
Shengshu Technology : 500 millions de dollars de financement à la veille de l'introduction en bourse, du modèle vidéo au « modèle mondial »
Le 6 juillet, Shengshu Technology a annoncé un financement de série B+ de 500 millions de dollars.
Mais si l'on regarde la chronologie, l'entreprise a réalisé trois tours en 5 mois : plus de 600 millions de RMB en série A+ en février (mené par Zhongguancun Science City et Xinglian Capital), 2 milliards de RMB en série B en avril (mené par Alibaba Cloud), plus ce tour de 500 millions de dollars en juillet, totalisant plus de 5 milliards de RMB.
Trois tours en 5 mois, ce rythme indique une chose : le capital se précipite pour monter à bord. Pourquoi cette urgence ?
Fin mars de cette année, Shengshu Technology a achevé une réforme en société par actions - une étape standard avant l'introduction en bourse. Les sources du marché indiquent qu'elle pourrait lancer le processus d'introduction en bourse à Hong Kong dès le premier semestre de l'année. Par conséquent, le capital se précipite pour monter à bord à la veille de l'introduction en bourse.
Le produit principal de Shengshu Technology est
Vidu
, lancé mondialement en juillet 2024, et a itéré jusqu'à la version
Vidu
S1 en trois ans - un modèle interactif en temps réel prenant en charge le contrôle vocal des images et la génération de durée illimitée (de 1 minute à 2 heures).
En 2025, Shengshu Technology a réalisé une croissance de plus de 10 fois du nombre d'utilisateurs et des revenus, avec plus de 400 millions de vidéos générées cumulées ; en particulier, sa clientèle B-end est assez impressionnante : dans le domaine de la publicité et du commerce électronique, elle compte JD.com, Alibaba 1688, Amazon, Meituan, Focus Media, BlueFocus, L'Oréal, Anta ; dans le domaine du film et de l'animation, elle couvre Tencent Animation, Yuewen Group, CCTV Animation, iQiyi, Mango TV ; dans le domaine du jeu, elle sert Lilith Games et 37 Interactive Entertainment.
Shengshu Technology ne se contente pas de la génération vidéo ; cette année, elle a commencé à s'étendre vers l'intelligence incarnée.
En avril 2026, Shengshu Technology a officiellement publié le modèle d'action mondial général Motubrain, adoptant la route technique World Action Model (WAM), unifiant la perception, la prédiction et la modélisation d'action, permettant aux robots d'avoir « un cerveau pour prévoir » et « un cerveau pour multitâches », tandis que la version commerciale MotuBrain est entrée en vérification au niveau industriel.
Cette entreprise affiliée à Tsinghua, créée il y a seulement trois ans, évolue rapidement d'une « entreprise de modèles vidéo » à une « plateforme de modèles mondiaux généraux ». Après l'arrivée des 500 millions de dollars, les fonds seront principalement utilisés pour la recherche et le développement du « modèle mondial général ».
C'est l'histoire que le capital valorise vraiment.
Aishi Technology : licorne en trois ans, 150 millions d'utilisateurs mondiaux
Le 14 juillet, le tour de série C+ d'Aishi Technology a été mené par Alibaba. Avec le tour de série C de 300 millions de dollars réalisé en mars (mené par CDH Investments, avec près de 20 participants dont China Ruyi et 37 Interactive Entertainment), le financement total de la série C a atteint 2,98 milliards de RMB, avec une valorisation post-investissement dépassant 2 milliards de dollars.
Alibaba avait précédemment mené le tour de série B de 60 millions de dollars d'Aishi en septembre 2025, et cette fois, il a continué à augmenter sa participation en série C+. Ant Group a également mené le tour A2 de plus de 100 millions de RMB dès avril 2024.
L'investissement continu d'Alibaba dans Aishi montre qu'il considère Aishi comme un point de placement stratégique dans le secteur de la vidéo IA.
En mars 2026, Aishi Technology compte plus de 150 millions d'utilisateurs mondiaux, 15 millions d'utilisateurs actifs mensuels et un revenu annuel récurrent (ARR) de 40 millions de dollars.
Fait intéressant, le cofondateur Xie Xuzhang a révélé que le coût d'entraînement du modèle de niveau équivalent d'Aishi ne représente qu'environ 10 % de celui de ses pairs. La voie clé de cet avantage de coût réside dans le filtrage de données de haute qualité, la réduction des itérations d'entraînement inefficaces et l'utilisation d'une architecture de transformateur à diffusion optimisée pour améliorer l'utilisation des ressources, réduire le coût d'entraînement unique et réaliser la réutilisation de l'expérience d'ingénierie.
En janvier de cette année, Aishi a publié
PixVerse
R1, affirmant qu'il s'agit du premier modèle mondial universel en temps réel prenant en charge la 1080P. Contrairement à la génération vidéo "pré-enregistrée" traditionnelle, R1 réalise une "génération dynamique en temps réel" : les utilisateurs peuvent saisir de nouvelles instructions à tout moment pendant la lecture vidéo, et la scène peut effectuer des transitions naturelles et fluides de l'éclairage et de la caméra en environ 0,5 seconde.
L'approche d'Aishi diffère des autres acteurs : pendant que d'autres se concentrent sur la qualité de génération, elle se concentre sur la capacité d'interaction. Une semaine seulement après la sortie de R1, China Ruyi a annoncé une coopération stratégique avec Aishi et a investi 14,2 millions de dollars.
Le dernier tour de financement de série C+ indique clairement son utilisation : pour les modèles de base de génération vidéo, les modèles mondiaux en temps réel et la croissance mondiale.
ZhiXiang Future : Nouvelle licorne, approche alternative de "Modèle + Agent + Matériel"
ZhiXiang Future est une "nouvelle licorne" sur cette liste : après un tour de série C de 1,5 milliard de yuans, sa valorisation post-investissement dépasse 1 milliard de dollars. Le fondateur Mei Tao est un académicien étranger de l'Académie canadienne du génie et ancien vice-président de JD.com.
L'entreprise a réalisé trois tours de financement au cours des trois derniers mois, totalisant plus de 2,1 milliards de yuans.
Le 23 juillet, ZhiXiang Future a annoncé un financement de série C de 1,5 milliard de yuans, mené par le Fonds national de sécurité sociale, le Fonds de revitalisation industrielle du Sichuan et ICBC Investment, avec la participation du Fonds Nouvelle Vision du cinéma de Shanghai, Huace Film & TV et 18 autres institutions – une combinaison de fonds nationaux à long terme, de capitaux d'État locaux et de capitaux industriels, rare dans le secteur de la vidéo IA.
ZhiXiang a lancé le premier modèle d'architecture DiT de génération vidéo à usage ouvert dès mai 2024, et lors du WAIC 2026 qui vient de se terminer, il a publié l'agent de création multimodale vivago R1, axé sur la génération et l'édition de vidéos de longueur illimitée.
Actuellement, ses produits couvrent plus de 100 pays, servant plus de 50 millions d'utilisateurs et 40 000 clients entreprises. Son chiffre d'affaires annuel en 2025 a dépassé 100 millions de yuans, et le chiffre d'affaires du premier trimestre 2026 a déjà dépassé le total de l'année dernière. Mei Tao a déclaré lors de l'Exposition de la chaîne d'approvisionnement 2026 qu'en raison du coût élevé du pré-entraînement des grands modèles, l'entreprise prévoit d'atteindre le seuil de rentabilité mensuel d'ici 2029.
Mei Tao a également été direct : "Nous ne rivalisons pas avec ByteDance sur les capacités sous-jacentes ; nous nous concentrons sur le marketing commercial et la collaboration professionnelle avec le cinéma et la télévision."
La voie de ZhiXiang est claire : éviter la confrontation directe avec les grands acteurs et cultiver en profondeur les scénarios verticaux. Il a d'abord construit une base d'utilisateurs avec des modèles d'images, puis a évolué vers la vidéo et les modèles mondiaux.
FlovaAI : Tour d'ange de 80 millions de dollars, troisième départ de Guo Lie
Le fondateur de FlovaAI, Guo Lie, est un nom incontournable dans l'histoire de l'Internet mobile chinois. En 2013, Guo Lie a créé FaceQ, suivi de FaceU, et en 2018, l'équipe a été acquise par ByteDance pour 300 millions de dollars. Après cela, il a participé à l'incubation de Qingyan Camera,
Xingtu
, et
CapCut
– c'est vrai,
CapCut
est quelque chose qu'il a aidé à créer.
En 2025, Guo Lie est reparti, fondant Shenzhen Yuzhou Technology, et a lancé Flova.ai en octobre. Sequoia China, IDG et Sky9 Capital ont investi au total plus de 80 millions de dollars.
Oser donner 80 millions de dollars lors d'un tour d'ange, les investisseurs parient non pas sur le produit mais sur Guo Lie lui-même. Chaque produit outil grand public qu'il a créé dans le passé est devenu un succès phénoménal.
Flova est une plateforme d'agent de création vidéo native IA. Les utilisateurs expriment leurs besoins créatifs par la conversation, et l'agent réalise tout le processus, de l'écriture du scénario, la conception des personnages, le storyboard, à la génération d'images/vidéos/audio, et l'assemblage de la timeline pour le montage.
Contrairement au format canvas dominant sur le marché, Flova conçoit un espace de travail "storyboard". L'agent reçoit les instructions dans la boîte de dialogue, et le processus de travail est affiché sur le storyboard de gauche. Les utilisateurs visualisent les résultats directement dans la zone d'aperçu au milieu et peuvent double-cliquer pour intervenir et modifier s'ils ne sont pas satisfaits.
Plusieurs premiers utilisateurs ont rapporté que la plus grande caractéristique de Flova est sa "mémoire"—après avoir créé plus d'une douzaine d'épisodes, il peut encore se souvenir d'un storyboard spécifique du premier épisode. Cette capacité de mémoire à long contexte est très prominente parmi les produits similaires.
À ce stade, Flova adopte une stratégie de marge zéro. Guo Lie a déclaré : "Pendant la période de développement, nous essaierons d'atteindre une marge brute nulle." L'équipe n'est pas pressée de poursuivre des revenus à court terme mais se concentre sur le ratio de consommation effective : combien de la consommation de jetons les utilisateurs trouvent-ils précieux, et combien est gaspillé en raison de lacunes du produit.
Pourquoi tout le monde se précipite en juillet ? Raisons possibles
Revenons maintenant à la question centrale : pourquoi ces cinq entreprises ont-elles coïncidé en réalisant des financements intensifs en juillet ? En rassemblant toutes les informations, j'ai trouvé quatre raisons qui forment une résonance.
Premièrement, l'effet de siphon de Seedance de ByteDance force tout le monde à accélérer.
Depuis la sortie de ByteDance Seedance 2.0 en février de cette année, son chiffre d'affaires mensuel a dépassé 1 milliard de yuans, avec un taux de pénétration d'environ 95% dans l'industrie des mini-dramas, et il occupe plus de 80% de la part de marché en consommation quotidienne de jetons.
Volcano Engine a relevé son objectif de revenus MaaS pour 2026 de 1,5 milliard l'année dernière à 15 milliards—une multiplication par dix, reposant presque entièrement sur le modèle Seedance seul. De plus, Seedance 2.1 est sur le point d'être publié, avec une amélioration de performance attendue de 20% supplémentaires, et le prix de la version bas de gamme est poussé à 0,5 yuan par seconde.
Quand ByteDance utilise une double attaque "écart de capacité du modèle + guerre des prix" sur le marché, les autres acteurs, s'ils ne lèvent pas rapidement des fonds, n'accumulent pas de puissance de calcul et n'accélèrent pas l'itération, pourraient ne même pas avoir la qualification pour rester à la table.
Tout le monde cherche un point d'appui pour contrer ByteDance à long terme. Mais les approches sont complètement différentes : Kling prend une route modale complète basée sur une plateforme, Shengshu prend une route de geek technologique, Aishi prend une route de différenciation par interaction en temps réel, Zhixiang prend une route de cultivation approfondie de scénarios verticaux, et FlovaAI prend une route de flux de travail d'agent.
Le capital n'investit pas dans la même histoire mais parie sur différentes routes techniques et modèles commerciaux.
Deuxièmement, la commercialisation a été prouvée, et le capital voit une voie de sortie.
L'année dernière, tout le monde discutait encore "La vidéo IA peut-elle gagner de l'argent ?" Cette année, les données sont là : l'ARR de Kling est de près de 500 millions de dollars, les revenus de Shengshu en 2025 ont augmenté de plus de 10 fois, l'ARR d'Aishi est de 40 millions de dollars, et Seedance a dépassé 1 milliard en un seul mois.
Publicité, e-commerce, mini-dramas, jeux, cinéma et télévision—les scénarios payants pour la vidéo IA sont validés un par un. Cet état de "flux de trésorerie visible" est le déclencheur direct de l'entrée concentrée du capital.
Troisièmement, la piste est passée de la "génération vidéo" au "modèle du monde", et le récit a été élevé.
Au premier semestre de cette année, le paysage concurrentiel des grands modèles fondamentaux est devenu plus concentré. Les fonds du marché primaire commencent à chercher la prochaine direction, et la génération multimodale et les modèles du monde sont devenus la sortie consensuelle.
Notez une tendance : aucune des quatre entreprises qui ont reçu des financements massifs ne prétend faire uniquement de la "génération vidéo". Kling parle d'un flux de travail créatif multimodal tout-en-un, Shengshu parle de "modèles du monde généraux" et d'intelligence incarnée, Aishi parle de "modèles du monde en temps réel" et de divertissement interactif, et Zhixiang parle de "modèles du monde multimodaux natifs" et de raisonnement causal.
La génération vidéo n'est que le point d'entrée ; le véritable objectif final est le modèle du monde—un système d'IA capable de comprendre, raisonner et construire le monde physique. Les investisseurs ne regardent pas le marché de la génération vidéo de cette année, mais qui émergera avec un modèle du monde dans trois ans.
Quatrièmement, la fenêtre d'introduction en bourse à Hong Kong est ouverte, et les capitaux se précipitent pour obtenir des "billets".
En janvier de cette année, Zhipu et
MiniMax
ont tous deux vu leurs cours de bourse monter en flèche après leur introduction à la Bourse de Hong Kong. Au premier trimestre, les levées de fonds lors des introductions en bourse à Hong Kong ont dépassé 100 milliards de dollars de Hong Kong en 79 jours, établissant un record de rapidité, avec plus de 350 entreprises en attente.
Shengshu a achevé sa réforme des actions, et les rumeurs d'introduction en bourse sont répandues ; le financement de la scission de Kling avec clauses de rachat est essentiellement un prélude à la cotation. Le financement intensif sur le marché primaire prépare en grande partie les billets pour le marché secondaire.
Enfin, je veux dire qu'après ce mois de juillet, le secteur de la vidéo IA est entré dans les finales. Le paysage deviendra probablement beaucoup plus clair : les entreprises leaders détiennent des fonds importants pour se précipiter vers les cotations, les entreprises de taille moyenne sont réévaluées par le récit du modèle du monde, et de nouveaux acteurs comme Flova tentent de contourner la course aux armements des modèles avec des Agents, taillant une part du gâteau dans la couche applicative.
Mais le problème derrière l'agitation est que l'argent arrive vite, mais le brûler est encore plus rapide. La génération vidéo est la catégorie d'IA la plus intensive en calcul. Plus de 26 milliards semblent impressionnants, mais répartis sur la facture de calcul annuelle de chaque entreprise, cela pourrait ne pas être suffisant.
Cet article provient du compte public WeChat "IT Juzi" (ID: itjuzi521), auteur : Wu Meimei









