Julio aún no ha terminado, y el sector de generación de video con IA ya está que arde.
Del 3 al 23 de julio, en solo 20 días, cinco empresas anunciaron financiaciones a gran escala en sucesión.
Kling AI
recaudó 3 mil millones de dólares, Shengshu Technology recaudó 500 millones de dólares, Aishi Technology recaudó varios cientos de millones de dólares en la Serie C+, Zhixiang Future recaudó 1.5 mil millones de RMB en la Serie C, e incluso FlovaAI, una nueva empresa establecida hace menos de un año, recaudó 80 millones de dólares en una ronda ángel.
La financiación total de las cuatro primeras empresas unicornio supera los 26.2 mil millones de RMB. Es decir, el dinero invertido solo en julio de 2026 es más que todo lo recaudado en el sector en los últimos dos años (2024-2025) combinado.
¿Por qué todas se concentraron en financiarse en julio? ¿Qué pasó exactamente? Esto no debería ser una coincidencia.
Kling AI: inversión conjunta histórica de BAT, ARR se cuadruplicó en un año
El 3 de julio,
Kling AI
anunció un tope de financiación de Serie A de 3 mil millones de dólares, liderado por CPE Yuanfeng y Guofang Innovation, con la participación de 34 instituciones; en la lista de inversores, Tencent, Alibaba Cloud y Baidu aparecieron juntos por primera vez. FountainBridge Capital actuó como asesor financiero.
El tope de financiación de Serie A de 3 mil millones de dólares corresponde a una valoración post-inversión de aproximadamente 18 mil millones de dólares; la parte actualmente firmada es de unos 19 mil millones de RMB.
¿Por qué el capital se atrevió a dar esta cifra? Tiene que ser que el informe del primer trimestre de 2026 de Kuaishou dio confianza al mercado.
El informe financiero del primer trimestre de 2026 de Kuaishou reveló que
Kling AI
logró ingresos de más de 650 millones de RMB en un solo trimestre, un aumento interanual de más del 300%. La tasa de ingresos anualizados (ARR) se disparó de 100 millones de dólares en marzo de 2025 a casi 500 millones de dólares en marzo de 2026, cuadruplicándose interanualmente.
Esta cifra no tiene igual en el sector de video con IA, excepto por Seedance de ByteDance, ninguna otra empresa nacional ha alcanzado esta escala.
Los ingresos de Kling están impulsados por dos ruedas: llamadas API de clientes empresariales B-end + suscripciones de miembros de pago P-end. Hasta junio de 2026,
Kling AI
tiene más de 100 millones de usuarios globales y casi 50,000 clientes empresariales. Por ejemplo, Kling participó profundamente en la producción de escenas virtuales y efectos especiales de la popular serie histórica china "El año pacífico", y apoyó la generación de cientos de tomas de alta calidad en la serie de Hollywood "La dinastía David".
En cuanto a productos, en febrero de este año, Kling lanzó el modelo de la serie 3.0, logrando generación de video de hasta 15 segundos, control de guion gráfico, consistencia de sujeto y salida simultánea de audio y video.
Dos detalles merecen atención. Primero, la valoración es más baja que el objetivo rumoreado de 20 mil millones de dólares en mayo, con un precio más pragmático, y el acuerdo se cerró más rápido; segundo, se incluyó una cláusula de rendimiento en el anuncio: si Beijing Kling no completa una OPI antes de octubre de 2031, los inversores tienen derecho a exigir la recompra al principal más un interés simple anual del 8%.
La combinación de escisión, financiación, incentivos de capital y cláusulas de recompra apunta a una dirección clara: Kling está allanando el camino para una cotización independiente.
Tecnología Shengshu: financiación de 500 millones de dólares en vísperas de la OPI, del modelo de video al "modelo mundial"
El 6 de julio, Tecnología Shengshu anunció una financiación de Serie B+ de 500 millones de dólares.
Pero si se observa la línea de tiempo, la empresa ha realizado tres rondas en 5 meses: más de 600 millones de RMB en la Serie A+ en febrero (liderada por la Ciudad de la Ciencia de Zhongguancun y el Capital Xinglian), 2 mil millones de RMB en la Serie B en abril (liderada por Alibaba Cloud), más esta ronda de 500 millones de dólares en julio, totalizando más de 5 mil millones de RMB.
Tres rondas en 5 meses, este ritmo indica una cosa: el capital se está apresurando a subir a bordo. ¿Por qué la urgencia?
A finales de marzo de este año, Tecnología Shengshu completó una reforma de sociedades anónimas, un movimiento estándar antes de la cotización. Fuentes del mercado dicen que podría iniciar el proceso de OPI en Hong Kong tan pronto como en la primera mitad del año. Por lo tanto, el capital se apresura a subir a bordo en vísperas de la OPI.
El producto principal de Tecnología Shengshu es
Vidu
, lanzado globalmente en julio de 2024, y ha iterado a la
Vidu
versión S1 en tres años: un modelo interactivo en tiempo real que admite control de fotogramas por voz y generación de duración ilimitada (de 1 minuto a 2 horas).
En 2025, Tecnología Shengshu logró un crecimiento de más de 10 veces en usuarios e ingresos, con más de 400 millones de videos generados acumulados; especialmente, su cartera de clientes B-end es bastante impresionante: en el campo de publicidad y comercio electrónico, tiene JD.com, Alibaba 1688, Amazon, Meituan, Focus Media, BlueFocus, L'Oréal, Anta; en el campo de cine y animación, cubre Tencent Animation, Yuewen Group, CCTV Animation, iQiyi, Mango TV; en el campo de juegos, sirve a Lilith Games y 37 Interactive Entertainment.
Tecnología Shengshu no se conforma con solo generación de video; este año comenzó a extenderse hacia la inteligencia encarnada.
En abril de 2026, Tecnología Shengshu lanzó oficialmente el modelo general de acción mundial Motubrain, adoptando la ruta técnica del Modelo de Acción Mundial (WAM), unificando percepción, predicción y modelado de acción, permitiendo que los robots tengan "un cerebro para prever" y "un cerebro para multitarea", mientras que la versión comercial MotuBrain entró en verificación a nivel industrial.
Esta empresa afiliada a Tsinghua, establecida hace solo tres años, está evolucionando rápidamente de una "empresa de modelos de video" a una "plataforma general de modelos mundiales". Después de que lleguen los 500 millones de dólares, los fondos se utilizarán principalmente para la investigación y el desarrollo del "modelo mundial general".
Esta es la historia que el capital realmente valora.
Tecnología Aishi: unicornio de tres años, 150 millones de usuarios globales
El 14 de julio, la ronda Serie C+ de Tecnología Aishi fue liderada por Alibaba. Junto con la ronda Serie C de 300 millones de dólares completada en marzo (liderada por CDH Investments, con casi 20 participantes incluyendo China Ruyi y 37 Interactive Entertainment), la financiación total de la Serie C alcanzó los 2.98 mil millones de RMB, con una valoración post-inversión que supera los 2 mil millones de dólares.
Alibaba había liderado previamente la ronda Serie B de 60 millones de dólares de Aishi en septiembre de 2025, y esta vez continuó aumentando su participación en la Serie C+. Ant Group también lideró la ronda A2 de más de 100 millones de RMB ya en abril de 2024.
La inversión continua de Alibaba en Aishi muestra que lo considera un punto de diseño estratégico en el sector de video con IA.
Hasta marzo de 2026, Tecnología Aishi tiene más de 150 millones de usuarios globales, 15 millones de usuarios activos mensuales y un ingreso recurrente anual (ARR) de 40 millones de dólares.
Curiosamente, el cofundador Xie Xuzhang reveló que el costo de entrenamiento del modelo de nivel similar de Aishi es solo alrededor del 10% del de sus pares. El camino clave para esta ventaja de costos radica en seleccionar datos de alta calidad, reducir iteraciones de entrenamiento ineficaces y utilizar una arquitectura de Transformer de Difusión optimizada para mejorar la utilización de recursos, reducir los costos de entrenamiento individuales y lograr la reutilización de la experiencia de ingeniería.
En enero de este año, Aishi lanzó
PixVerse
R1, afirmando que es el primer modelo mundial universal en tiempo real que admite 1080P. A diferencia de la generación de video tradicional "pregrabada", R1 logra "generación dinámica en tiempo real": los usuarios pueden ingresar nuevas instrucciones en cualquier momento durante la reproducción del video, y la escena puede lograr transiciones naturales y fluidas de iluminación y cámara en aproximadamente 0.5 segundos.
El enfoque de Aishi difiere de otros actores: mientras otros compiten en calidad de generación, Aishi compite en capacidad de interacción. Solo una semana después del lanzamiento de R1, China Ruyi anunció una cooperación estratégica con Aishi e invirtió 14.2 millones de dólares.
La última ronda de financiación C+ establece claramente su uso: para modelos fundacionales de generación de video, modelos mundiales en tiempo real y crecimiento global.
ZhiXiang Future: Nuevo unicornio, enfoque alternativo de "Modelo + Agente + Hardware"
ZhiXiang Future es un "nuevo unicornio" en esta lista: después de una ronda C de 1.5 mil millones de yuanes, su valoración post-inversión supera los mil millones de dólares. El fundador Mei Tao es académico extranjero de la Academia Canadiense de Ingeniería y ex vicepresidente de JD.com.
La empresa ha completado tres rondas de financiación en los últimos tres meses, totalizando más de 2.1 mil millones de yuanes.
El 23 de julio, ZhiXiang Future anunció una ronda C de 1.5 mil millones de yuanes, liderada por el Fondo Nacional de Seguridad Social, el Fondo de Revitalización Industrial de Sichuan y ICBC Investment, con participación de Shanghai Film New Vision Fund, Huace Film & TV y otras 18 instituciones, una combinación de fondos nacionales a largo plazo, capital estatal local y capital industrial, que es rara en el sector de video con IA.
ZhiXiang lanzó el primer modelo de arquitectura DiT de generación de video de uso abierto del mundo ya en mayo de 2024, y en la recién concluida WAIC 2026, lanzó el agente de creación multimodal vivago R1, centrado en la generación y edición de video de longitud ilimitada.
Actualmente, sus productos cubren más de 100 países, sirviendo a más de 50 millones de usuarios y 40,000 clientes empresariales. Sus ingresos anuales en 2025 superaron los 100 millones de yuanes, y los ingresos del primer trimestre de 2026 ya superaron el total del año pasado. Mei Tao declaró durante la Exposición de la Cadena de Suministro de 2026 que, debido al alto costo del preentrenamiento de modelos grandes, la empresa espera alcanzar el punto de equilibrio mensual para 2029.
Mei Tao también fue directo: "No competimos con ByteDance en capacidades subyacentes; nos enfocamos en marketing comercial y colaboración profesional en cine y televisión."
El camino de ZhiXiang es claro: evitar la confrontación directa con los grandes actores y cultivar profundamente escenarios verticales. Primero construyó una base de usuarios con modelos de imagen, luego evolucionó hacia video y modelos mundiales.
FlovaAI: Ronda ángel de 80 millones de dólares, tercera salida de Guo Lie
El fundador de FlovaAI, Guo Lie, es un nombre inevitable en la historia de Internet móvil de China. En 2013, Guo Lie creó FaceQ, seguido de FaceU, y en 2018, el equipo fue adquirido por ByteDance por 300 millones de dólares. Después de eso, participó en la incubación de Qingyan Camera,
Xingtu
, y
CapCut
—así es,
CapCut
fue algo que ayudó a crear.
En 2025, Guo Lie se embarcó de nuevo, fundando Shenzhen Yuzhou Technology, y lanzó Flova.ai en octubre. Sequoia China, IDG y Sky9 Capital han invertido un total de más de 80 millones de dólares.
Atreverse a dar 80 millones de dólares en una ronda ángel, los inversores apuestan no por el producto sino por el propio Guo Lie. Cada producto de herramienta de consumo que ha creado en el pasado se convirtió en un éxito fenomenal.
Flova es una plataforma de agente de creación de video nativa de IA. Los usuarios expresan sus necesidades creativas a través de la conversación, y el agente completa todo el proceso desde la escritura de guiones, el diseño de personajes, el storyboard, hasta la generación de imágenes/videos/audio y el ensamblaje de la línea de tiempo para la edición.
A diferencia del formato de lienzo convencional en el mercado, Flova diseña un espacio de trabajo de "storyboard". El agente recibe instrucciones en el cuadro de diálogo, y el proceso de trabajo se muestra en el storyboard izquierdo. Los usuarios ven los resultados directamente en el área de vista previa central y pueden hacer doble clic para intervenir y modificar si no están satisfechos.
Varios usuarios tempranos informaron que la mayor característica de Flova es su "memoria": después de crear más de una docena de episodios, aún puede recordar un storyboard específico del primer episodio. Esta capacidad de memoria de contexto largo es muy prominente entre productos similares.
En esta etapa, Flova adopta una estrategia de margen cero. Guo Lie dijo: "Durante el período de desarrollo, intentaremos lograr un margen bruto cero". El equipo no tiene prisa por buscar ingresos a corto plazo, sino que se centra en la relación de consumo efectivo: cuánto del consumo de tokens los usuarios encuentran valioso, y cuánto se desperdicia debido a deficiencias del producto.
¿Por qué todos se agolpan en julio? Posibles razones
Ahora volvamos a la pregunta central: ¿Por qué estas cinco empresas coincidieron en realizar financiamiento intensivo en julio? Uniendo toda la información, encontré cuatro razones que forman una resonancia.
Primero, el "efecto sifón" de Seedance de ByteDance obliga a todos a acelerar.
Desde el lanzamiento de ByteDance Seedance 2.0 en febrero de este año, sus ingresos mensuales han superado los 1.000 millones de yuanes, con una tasa de penetración de aproximadamente el 95% en la industria de dramas cortos, y ocupa más del 80% de la cuota de mercado por consumo diario de tokens.
Volcano Engine ha elevado su objetivo de ingresos MaaS para 2026 de los 1.500 millones del año pasado a 15.000 millones, un aumento de diez veces, que casi depende por completo del modelo Seedance. Además, Seedance 2.1 está a punto de lanzarse, con una mejora de rendimiento esperada de otro 20%, y el precio de la versión de gama baja se está reduciendo a 0,5 yuanes por segundo.
Cuando ByteDance está utilizando un ataque dual de "brecha de capacidad del modelo + guerra de precios" en el mercado, otros actores, si no recaudan dinero rápidamente, acumulan poder de cómputo y aceleran la iteración, pueden ni siquiera tener la calificación para permanecer en la mesa.
Todos buscan un punto de apoyo para contrarrestar a ByteDance a largo plazo. Pero los enfoques son completamente diferentes: Kling toma una ruta de modalidad completa basada en plataforma, Shengshu toma una ruta de geek tecnológico, Aishi toma una ruta de diferenciación de interacción en tiempo real, Zhixiang toma una ruta de cultivo profundo de escenarios verticales, y FlovaAI toma una ruta de flujo de trabajo de agente.
El capital no está invirtiendo en la misma historia, sino apostando por diferentes rutas técnicas y modelos de negocio.
Segundo, la comercialización ha sido probada, y el capital ve una vía de salida.
El año pasado, todos todavía discutían "¿Puede el video de IA ganar dinero?" Este año, los datos están disponibles: el ARR de Kling es de casi 500 millones de dólares, los ingresos de Shengshu en 2025 crecieron más de 10 veces, el ARR de Aishi es de 40 millones de dólares, y Seedance superó los 1.000 millones en un solo mes.
Publicidad, comercio electrónico, dramas cortos, juegos, cine y televisión: los escenarios de pago para el video de IA se están validando uno por uno. Este estado de "flujo de caja visible" es el desencadenante directo para la entrada concentrada de capital.
Tercero, la pista se ha actualizado de "generación de video" a "modelo mundial", y la narrativa se ha elevado.
En la primera mitad de este año, el panorama competitivo de los grandes modelos fundamentales se ha vuelto más concentrado. Los fondos del mercado primario están comenzando a buscar la próxima dirección, y la generación multimodal y los modelos mundiales se han convertido en la salida de consenso.
Note una tendencia: Ninguna de las cuatro empresas que recibieron financiamiento masivo afirma dedicarse únicamente a la "generación de video". Kling habla de un flujo de trabajo creativo multimodal todo en uno, Shengshu habla de "modelos mundiales generales" e inteligencia encarnada, Aishi habla de "modelos mundiales en tiempo real" y entretenimiento interactivo, y Zhixiang habla de "modelos mundiales multimodales nativos" y razonamiento causal.
La generación de video es solo el punto de entrada; el verdadero objetivo final es el modelo del mundo: un sistema de IA que pueda entender, razonar y construir el mundo físico. Los inversores no están mirando el mercado de generación de video de este año, sino quién surgirá con un modelo del mundo dentro de tres años.
Cuarto, la ventana de OPI en Hong Kong está abierta, y el capital se apresura por los "boletos".
En enero de este año, Zhipu y
MiniMax
vieron sus precios de acciones dispararse después de cotizar en la Bolsa de Valores de Hong Kong. En el primer trimestre, la recaudación de fondos de OPI en Hong Kong superó los 100 mil millones de dólares de Hong Kong en 79 días, estableciendo un récord de ritmo más rápido, con más de 350 empresas en la cola.
Shengshu ha completado su reforma de acciones, y los rumores de OPI están muy extendidos; la financiación de escisión de Kling con cláusulas de recompra es esencialmente un preludio para la cotización. La financiación intensiva en el mercado primario se está preparando en gran medida para los boletos al mercado secundario.
Finalmente, quiero decir que después de este julio, el sector de video con IA ha entrado en las finales. El panorama probablemente se aclarará mucho: las empresas líderes están reteniendo fondos pesados para apresurarse a las cotizaciones, las empresas de nivel medio están siendo revalorizadas por la narrativa del modelo del mundo, y nuevos actores como Flova están tratando de evitar la carrera armamentista de modelos con Agentes, abriéndose un hueco desde la capa de aplicaciones.
Pero el problema detrás del ajetreo es que el dinero llega rápido, pero quemarlo es aún más rápido. La generación de video es la categoría de IA que más cómputo requiere. Más de 26 mil millones suena impresionante, pero repartido en la factura de cómputo anual de cada empresa, puede no ser suficiente.
Este artículo proviene de la cuenta pública de WeChat "IT Juzi" (ID: itjuzi521), autora: Wu Meimei









