Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y un 3.5 Flash Cyber restringido: la familia Flash se rearma mientras Pro sigue ausente

Fuentes: Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y un 3.5 Flash Cyber restringido: la familia Flash se rearma mientras Pro sigue ausente

Google publicó este 21 de julio un triple lanzamiento en su familia Flash: el modelo de uso general Gemini 3.6 Flash, la versión de alta densidad y bajo coste 3.5 Flash-Lite y un 3.5 Flash Cyber afinado para encontrar y parchear vulnerabilidades. El anuncio llega en general availability (GA) y reorienta la estrategia de la compañía hacia el segmento donde compite de verdad: agentes de producción de bajo coste por tarea. También confirma, por omisión, que Gemini 3.5 Pro sigue sin fecha pública y que el preentrenamiento de Gemini 4 ya está en marcha.

Ficha rápida

Campo Gemini 3.6 Flash Gemini 3.5 Flash-Lite Gemini 3.5 Flash Cyber
Organización Google DeepMind Google DeepMind Google DeepMind
Release 21 jul 2026 (GA) 21 jul 2026 (GA) 21 jul 2026 (acceso restringido)
Estado GA en Gemini API, AI Studio, Gemini Enterprise, app Gemini, Google Antigravity GA en Gemini API, AI Studio, Gemini Enterprise, app Gemini y Google Search Pilot solo para gobiernos y socios de confianza, vía CodeMender
Tipo Denso (no MoE) Denso (no MoE) Denso, fine-tune de 3.5 Flash
Contexto 1 M tokens 1 M tokens (implícito por familia) 1 M tokens
Modalidades Texto, imagen, audio, vídeo, código Texto, imagen, audio, vídeo, código Texto y código
Idiomas Multilingüe (no detallado) Multilingüe (no detallado) n/a (uso interno)
Open weights No (API + Vertex) No (API + Vertex) No
Input / Output (USD/1M tok) 1,50 / 7,50 0,30 / 2,50 n/a (no comercial)
Velocidad declarada "Workhorse", menor latencia que 3.5 Flash 350 tok/s de salida (Artificial Analysis) n/a

Fuentes: blog oficial, changelog de la Gemini API, cobertura técnica de The Decoder y AI News.

El argumento de Google: agentes a escala

El mensaje del post —firmado por Tulsee Doshi, senior director de producto— gira en torno a una sola idea: el cuello de botella de los agentes en producción no es la inteligencia máxima, sino el coste por tarea completada. Cada iteración de un agente razonador se paga en tokens de salida y en tiempo de pared. Google dice haber atacado ambos frentes simultáneamente.

Tres métricas sostienen la tesis:

  • 17 % menos tokens de salida que 3.5 Flash en el índice compuesto de Artificial Analysis.
  • Hasta 65 % menos tokens en DeepSWE (Datacurve), un benchmark de ingeniería de software agéntica.
  • Bajada de precio del 3.5 Flash al 3.6 Flash: input de 1,50 USD/1M (antes 1,50 — Google no bajó el input, pero el output baja de 9 a 7,50 USD/1M, una reducción del ~17 % efectiva al sumar la eficiencia).

Es decir: a igualdad de tarea, el coste efectivo por agente baja cerca de un 30 % solo en output, sin contar la ventaja del menor número de pasos de razonamiento que Google reporta cualitativamente.

3.6 Flash: el caballo de batalla

Sobre el papel, 3.6 Flash es una subida incremental sobre 3.5 Flash, no un salto generacional. Pero los benchmarks agenticos son los que importan en este carril:

Benchmark 3.5 Flash 3.6 Flash Mejora
DeepSWE (Datacurve) 37 % 49 % +12 pp
MLE Bench 49,7 % 63,9 % +14,2 pp
OSWorld-Verified (computer use) 78,4 % 83,0 % +4,6 pp
GDPval-AA v2 (knowledge work) 1.349 1.421 +5,3 %

Dos detalles operativos que Google añade con 3.6 Flash:

  • Computer Use como herramienta cliente integrada en Gemini API y Gemini Enterprise. Antes hacía falta intermediario; ahora se invoca como tool nativa (similar al patrón de OpenAI con Operator o Anthropic con Claude Sonnet 4.5).
  • Safeguards Frontier Safety reforzadas en CBRN (químico, biológico, radiológico, nuclear) y ofensivas cibernéticas, con jailbreak resistance aumentada sin subir la tasa de refusals benignos. Es una concesión directa al ciclo regulatorio europeo (AI Act, entrada en vigor de las obligaciones de modelos de uso general en agosto 2026).

Clientes tempranos citados: Figma (iteración de prototipos), Hebbia y Harvey (parsing de documentos financieros y legales). Los tres son casos típicos de "agente de oficina", no chatbots conversacionales.

3.5 Flash-Lite: el fondo de la tabla de precios

Aquí está la jugada más agresiva comercialmente. 3.5 Flash-Lite cuesta 0,30 USD/1M input y 2,50 USD/1M output, situándose por debajo de Gemini 3.1 Flash-Lite y muy por debajo del segmento medio. A cambio:

  • 350 tokens/segundo de salida (el más rápido de la serie 3.x según Artificial Analysis).
  • Niveles de pensamiento configurables: los desarrolladores pueden elegir entre minimal/low (latencia y coste mínimos, tareas simples) o high (subagentes multi-paso). Es la primera vez que Google expone formalmente un dial de razonamiento en una API pública, alineándose con el patrón de OpenAI o3 / Anthropic adaptive thinking.
  • Ganancias notables frente a su predecesor 3.1 Flash-Lite, y sorpresivamente, también supera al Gemini 3 Flash (la generación anterior) en SWE-Bench Pro (54,2 % vs 49,6 %) y OSWorld-Verified (74,0 % vs 65,1 %). Google explota esto como argumento para migrar cargas que aún corren en 2.5 Flash y 3 Flash.
Benchmark 3.1 Flash-Lite 3.5 Flash-Lite 3 Flash (ref.)
Terminal-Bench 2.1 31 % 54 % n/d
GDM-MRCR v2 (largo contexto) 60,1 % 72,2 % n/d
GDPval-AA v2 642 1.140 n/d
SWE-Bench Pro n/d 54,2 % 49,6 %
OSWorld-Verified n/d 74,0 % 65,1 %

Caso de uso que Google exhibe: como subagente dentro de una orquestación Flash-Lite + 3.6 Flash, donde el modelo barato hace "trabajo de fondo" (extracción de features, traducción, resúmenes) y el caro decide. Es exactamente el patrón multi-agente que la propia Anthropic popularizó con Claude Sonnet + Haiku y que OpenAI sigue con o4-mini + GPT-5.

3.5 Flash Cyber: la pieza restringida

El tercer modelo es el más interesante desde el punto de vista de producto y el más opaco desde el punto de vista informativo. Google no publica una tabla de benchmarks al uso; sólo dos afirmaciones:

  • 83,2 % en CyberGym, a dos puntos del GPT-5.5-Cyber (85,6 %) según The Decoder. CyberGym es un benchmark de identificación de vulnerabilidades en código real, mantenido por la Universidad de Wisconsin.
  • 55 hallazgos únicos confirmados en commits del motor JavaScript V8 de Chrome, frente a 47 del 3.5 Flash estándar y 36 de Claude Opus 4.6 (Anthropic). Diez de los hallazgos de Flash Cyber no aparecieron en ningún otro modelo según Google.

El modelo se entrega sólo vía CodeMender, el agente de seguridad de DeepMind, que orquesta varios Flash Cyber en paralelo, hace cross-check entre sus hallazgos y produce un único informe que firma un revisor humano. Distribución: gobiernos y socios de confianza en un programa piloto. El agente CodeMender en sí sí estará disponible en preview en Gemini Enterprise Agent Platform, pero corriendo sobre los modelos Gemini estándar, no sobre Flash Cyber. Google soporta C/C++, Go, Java, Python, Ruby, Rust y TypeScript.

El framing de "acceso restringido por seguridad dual" es el mismo que Anthropic usó con Claude Cyber cuando lanzó Frontier Red Team en 2025. La pregunta abierta es si la restricción se quedará o se abrirá en 6-12 meses, como pasó con Claude Cyber.

Contexto competitivo

Google está publicando exactamente los modelos que puede entregar —y evitando el que no. La ausencia de Gemini 3.5 Pro es la noticia real detrás de la noticia:

  • OpenAI ya sirve GPT-5.6 Sol en el segmento frontera; Anthropic tiene Fable y Mythos; Meta publicó recientemente un modelo que supera a la línea actual de Google en coding.
  • En China, Moonshot (Kimi K3) y Zhipu (GLM-5.2) están cerrando la brecha frontera.
  • Bloomberg reportó que 3.5 Pro está "meses por detrás del calendario" mientras Google trabaja en mejorar su rendimiento en coding. Logan Kilpatrick, miembro del technical staff, respondió en X que el objetivo explícito de este lanzamiento era eficiencia y coste, no pico de capacidad —una respuesta que admite implícitamente la presión competitiva.

La jugada de Google es comprensible: si no puedes ganar la carrera por el absolute frontier, optimiza el coste por tarea en el segmento medio, donde el 80 % de las aplicaciones empresariales corren hoy. Es la misma lógica que llevó a Microsoft a Copilot for Sales sobre GPT-4o-mini en lugar de GPT-5. El problema es de percepción: cada semana sin un Pro público es una semana más en la que OpenAI, Anthropic y los labs chinos capturan el "top of mind" en cobertura.

Disponibilidad

  • 3.6 Flash y 3.5 Flash-Lite: GA hoy en Gemini API (Google AI Studio y Android Studio), Gemini Enterprise Agent Platform, la app Gemini y —en el caso de Lite— también Google Search. 3.6 Flash llega además a Google Antigravity, el IDE agéntico de Google presentado en I/O 2026.
  • 3.5 Flash Cyber: solo vía CodeMender, pilot cerrado con gobiernos y socios. Sin precio publicado.

Precios confirmados cruzando blog oficial, cobertura de The Decoder y el agregador BenchLM (que ya recoge los tiers actuales a 21 de julio). El changelog oficial de la API no lista precios en la página pública, práctica habitual de Google —el pricing vive en la consola de AI Studio.

Veredicto ojeo

Este lanzamiento es estratégicamente coherente pero narrativamente débil. Google ha construido la familia de modelos más completa del mercado para agentes de producción, con el dial de razonamiento configurable, computer use nativo, safeguards Frontier Safety alineadas con AI Act, y un pricing agresivo. Si tu problema es "tengo un agente que ejecuta 10.000 tareas/hora y la factura de tokens me mata", 3.5 Flash-Lite + 3.6 Flash es probablemente la mejor combinación que puedes comprar hoy en una sola casa.

Pero el elefante sigue en la sala. Sin 3.5 Pro, Google queda sin respuesta pública en el segmento frontier. Cada semana que pasa, OpenAI, Anthropic, Meta y los chinos acumulan cobertura y mindshare en el techo del mercado. El preentrenamiento de Gemini 4 está en marcha y Google lo dice explícitamente —un movimiento poco habitual para una compañía que normalmente controla su narrativa hasta el día del release. La lectura razonable: 3.5 Pro no está cerca, y la propia Google necesita que el mercado lo sepa para que el silencio no se interprete como debilidad.

Para uso europeo, el matiz regulatorio es relevante: las safeguards CBRN reforzadas y la posición de Google en el Frontier Safety Framework las hacen más cómodas de desplegar en sectores regulados (sanidad, energía, defensa civil). La pieza de seguridad (Flash Cyber) probablemente nunca llegará al mercado civil general, pero el patrón CodeMender —agente que valida y parchea con humano en el loop— sí se exportará vía Gemini Enterprise.

Quedan tres preguntas abiertas para próximas piezas:

  1. ¿Cuándo llega 3.5 Pro y con qué benchmarks de coding? Es el único dato que recolocaría a Google en la conversación frontier.
  2. ¿Google publicará un fine-tune de computer use open weights, como hizo con Gemma 4? 3.6 Flash tiene la capacidad pero el modelo es cerrado.
  3. ¿CyberGym es el nuevo estándar de facto para modelos de seguridad, o cada lab seguirá midiendo en su benchmark propietario?

Volveremos sobre las tres en cuanto haya señal pública.