Moonshot AI presentó la semana pasada Kimi K3, un modelo de 2,8 billones de parámetros que alcanza 57 puntos en el Artificial Analysis Intelligence Index, en línea con Opus 4.8 y GPT-5.5. En el nuevo benchmark propietario AA-Briefcase, orientado a tareas agénticas de trabajo de conocimiento sobre conjuntos de datos privados, Kimi K3 logra un Elo de 1543, la segunda mejor marca registrada, únicamente superada por Claude Fable 5 (1574) y por delante de GPT-5.6 Sol (1501), Claude Sonnet 5 (1388) y Claude Opus 4.8 (1347). Supone una mejora de 727 puntos frente a Kimi K2.6 (816).
En rendimiento analítico, Kimi K3 obtiene una tasa de acierto del 51 % en la rúbrica, solo detrás del 56 % de Fable 5, y un Elo de calidad analítica de 1754, comparable al 1744 de Fable 5. La calidad de presentación es su punto débil: 1471 de Elo, por debajo de GPT-5.6 Sol (1660) y Opus 4.8 (1492).
El precio, sin embargo, es elevado. Kimi K3 cuesta 3 y 15 dólares por millón de tokens de entrada y salida, con un 90 % de descuento para tokens en caché, y promedia 10,57 dólares por tarea, frente a los 67 turnos de Fable 5 o los 50 de GPT-5.6 Sol, ya que consume 83 turnos y 120 000 tokens de salida por tarea. En tiempo, completa cada tarea en una media de 56,4 minutos, 2,5 veces más que Fable 5 y 3,8 veces más que Grok 4.5 (high).
