En resumen

  • Google lanzó hoy Gemini 3.6 Flash y 3.5 Flash-Lite, con mejor eficiencia y menores costos que 3.5 Flash—pero Gemini 3.5 Pro, prometido en I/O 2026 para entrega en junio, sigue en pruebas después de no alcanzar los estándares internos en codificación.
  • 3.6 Flash usa un 17% menos de tokens de salida que 3.5 Flash, reduciendo el precio de salida de $9 a $7.50 por millón de tokens, lo que hace más barato ejecutar agentes de IA a escala.
  • Google confirmó que ha comenzado el pre-entrenamiento para Gemini 4, al que llama "nuestra ejecución de pre-entrenamiento más ambiciosa hasta ahora".

Google lanzó tres nuevos modelos de IA hoy: Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber. Eso no era lo que la mayoría esperaba.

Después de presentar Gemini 3.5 Flash en Google I/O 2026 en mayo y prometer una versión Pro en un mes, Google incumplió silenciosamente su propio plazo. Gemini 3.5 Pro se retuvo porque no alcanzó los objetivos internos, según Bloomberg, particularmente en tareas de codificación. Un intento a finales de junio para solucionarlo actualizando los datos de entrenamiento—los conjuntos de datos masivos de los que aprende un modelo—produjo resultados decepcionantes. Las acciones de Alphabet cayeron aproximadamente un 4,4% tras el informe, borrando un estimado de $200 mil millones en capitalización de mercado en una sola sesión.

El último modelo de nivel Pro que Google envió fue el sucesor de Gemini 3, Gemini 3.1 Pro, en febrero.

La serie Flash es la línea de modelos optimizados para velocidad de Google: rápidos, rentables y diseñados para agentes de IA, que son programas que operan de forma semiautónoma para manejar tareas como gestionar documentos, procesar pipelines de datos o navegar por la web sin que un humano haga clic en cada paso. Los modelos Pro son los que realizan trabajos pesados: más lentos, más caros y diseñados para razonamiento complejo donde el poder bruto importa más que la velocidad.

Qué hace cada modelo de IA—y para quién es

Gemini 3.6 Flash es el lanzamiento principal. Usa un 17% menos de tokens de salida—siendo los tokens la unidad básica que procesa la IA, aproximadamente tres cuartos de una palabra—que 3.5 Flash, según el Índice de Análisis Artificial. También es más barato: $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida, frente a los $9 en el lado de salida para 3.5 Flash. Para empresas que ejecutan agentes a escala, esa diferencia se acumula rápidamente.

En benchmarks—pruebas estandarizadas que puntúan a la IA por el porcentaje de tareas completadas correctamente—3.6 Flash alcanzó el 49% en DeepSWE v1.1, que prueba ingeniería de software de horizonte largo como construir y depurar bases de código completas, frente al 37% de 3.5 Flash. En MLE-Bench, una prueba de ingeniería de aprendizaje automático, obtuvo un 63.9% frente al 49.7%. Encabezó la tabla en OSWorld-Verified—una prueba donde la IA toma el control de una pantalla de computadora para completar tareas reales—con un 83.0%, por delante de Claude Sonnet 5 (81.2%) y GPT-5.6 Luna (72.6%).

Los rivales en la misma categoría todavía lideran en otros aspectos: GPT-5.6 Luna obtiene un 67% en DeepSWE y un 84.7% en Terminal-Bench 2.1, que prueba la codificación de terminal agéntica. Claude Sonnet 5 lidera el trabajo de conocimiento en GDPval-AA v2—un punto de referencia puntuado en una escala de calificación Elo como el ajedrez, donde los números más altos significan un mejor rendimiento en tareas del mundo real—con 1607 frente a los 1421 de 3.6 Flash.

Probamos el modelo para codificar y los resultados fueron... decepcionantes, por decir lo menos.
Nuestra prueba de codificación simple terminó con un archivo inutilizable. El HTML no estaba formateado correctamente y los elementos no se renderizaban correctamente. Los intentos posteriores de codificar al estilo "vibe" para resolver los problemas no tuvieron éxito.

Le pedimos a Deepseek que convirtiera el primer modelo en algo jugable simplemente corrigiendo los errores. Identificó 11 errores e implementó 8 correcciones clave, lo que resultó en un juego decente.

Los pequeños ajustes de Deepseek arreglaron el juego, lo que significa que el pensamiento central de Gemini era correcto, pero los detalles e imprecisiones hicieron que el resultado no fuera útil. Prepárate para largas sesiones de codificación por vibración con un modelo barato pero de bajo rendimiento si pretendes usar el modelo para eso.

El segundo modelo lanzado por Google, Gemini 3.5 Flash-Lite, está construido puramente para volumen: 350 tokens de salida por segundo a $0.30/millón de entrada y $2.50/millón de salida. Está dirigido a pipelines de alto rendimiento—piensa en procesamiento de documentos a escala masiva o sistemas de búsqueda agénticos—y supera al antiguo 3 Flash en tareas clave de codificación, incluyendo Terminal-Bench 2.1 (54% vs. 31%), a pesar de ser significativamente más barato.

También podría ser un excelente compactador de sesiones (analizando sesiones largas y extrayendo los elementos clave para que tu agente no colapse con ruido) para aquellos que dependen de Hermes y Openclaw.

El tercer modelo, Gemini 3.5 Flash Cyber, no estará disponible públicamente. Google lo está restringiendo a gobiernos y socios autorizados que necesitan encontrar y corregir vulnerabilidades de software—una capacidad de doble uso que la compañía no se siente cómoda lanzando ampliamente.

Mientras tanto, el equipo de DeepMind de Google ya está avanzando. Google confirmó en el anuncio oficial que ha comenzado "nuestra ejecución de preentrenamiento más ambiciosa hasta ahora, para Gemini 4," y el equipo ya lo está promocionando.

El preentrenamiento es la fase fundamental donde un modelo aprende de conjuntos de datos masivos antes de que comience el ajuste fino específico de la tarea—lo que significa que Gemini 4 se está construyendo, no planeado.

Tanto 3.6 Flash como 3.5 Flash-Lite están disponibles hoy en la aplicación Gemini, en Google AI Studio y a través de la API. Gemini 3.5 Pro se lanzará, según Google, "en cuanto esté listo", cuando sea.