Gemini 4 Argon de Google lidera benchmarks pero enfrenta escepticismo interno

Fuentes: Gemini 4 Argon de Google lidera benchmarks pero enfrenta escepticismo interno

Google ha reactivado su posición en la carrera de los modelos de inteligencia artificial con el lanzamiento de Gemini 4 Argon, un modelo que según los benchmarks internos supera a competidores como Opus 5.5 y Fable 5.1. Sin embargo, la disponibilidad masiva está restringida inicialmente a un programa de probadores de confianza y especialistas en ciberseguridad a través de la plataforma Fairwind, mientras que el Gobierno de Estados Unidos también analiza el modelo para evitar bloqueos regulatorios.

El rendimiento del modelo genera división interna en Google. Aunque Sundar Pichai afirma que los equipos lo utilizan extensivamente con buenos resultados, Bloomberg ha reportado escepticismo de algunos empleados, quienes señalan que el modelo no se comporta con la misma eficacia en tareas de programación complejas que en las pruebas estandarizadas. Google niega estas limitaciones prácticas.

En cuanto a la calidad de las respuestas, Artificial Analysis indica que Gemini 4 Argon presenta una tasa de alucinaciones del 15% en pruebas de omnisciencia, una cifra significativamente inferior al 50% de GPT-6 Astra. Esta diferencia se atribuye a la capacidad del modelo de reconocer su propia ignorancia, aunque los expertos advierten que los benchmarks no siempre reflejan la experiencia real en entornos de trabajo con dependencias complejas.

Por último, Google ha establecido un precio promocional inicial de 2/10 dólares por millón de tokens, lo que le otorga una ventaja competitiva en costes frente a GPT-6 Astra, aunque prevé duplicar los precios a 4/20 dólares posteriormente. Se espera que una variante Flash alivie esta carga económica para usos intensivos.