Kimi K3 se sitúa segundo en AA-Briefcase, solo por detrás de Fable 5, pero a un coste y tiempo elevados

Fuentes: Kimi K3: second only to Fable 5 on AA-Briefcase

Moonshot AI presentó la semana pasada Kimi K3, un modelo de 2,8 billones de parámetros que alcanza 57 puntos en el Artificial Analysis Intelligence Index, en línea con Opus 4.8 y GPT-5.5. En el nuevo benchmark propietario AA-Briefcase, orientado a tareas agénticas de trabajo de conocimiento sobre conjuntos de datos privados, Kimi K3 logra un Elo de 1543, la segunda mejor marca registrada, únicamente superada por Claude Fable 5 (1574) y por delante de GPT-5.6 Sol (1501), Claude Sonnet 5 (1388) y Claude Opus 4.8 (1347). Supone una mejora de 727 puntos frente a Kimi K2.6 (816).

En rendimiento analítico, Kimi K3 obtiene una tasa de acierto del 51 % en la rúbrica, solo detrás del 56 % de Fable 5, y un Elo de calidad analítica de 1754, comparable al 1744 de Fable 5. La calidad de presentación es su punto débil: 1471 de Elo, por debajo de GPT-5.6 Sol (1660) y Opus 4.8 (1492).

El precio, sin embargo, es elevado. Kimi K3 cuesta 3 y 15 dólares por millón de tokens de entrada y salida, con un 90 % de descuento para tokens en caché, y promedia 10,57 dólares por tarea, frente a los 67 turnos de Fable 5 o los 50 de GPT-5.6 Sol, ya que consume 83 turnos y 120 000 tokens de salida por tarea. En tiempo, completa cada tarea en una media de 56,4 minutos, 2,5 veces más que Fable 5 y 3,8 veces más que Grok 4.5 (high).