Artificial Analysis ha lanzado un sistema de benchmarking especializado en la inferencia de modelos de inteligencia artificial a escala de bolsillo, diseñados específicamente para ejecutarse en teléfonos móviles. Esta iniciativa técnica busca medir el rendimiento real de los modelos pequeños, definidos como aquellos que caben en 8 GB de memoria tras la cuantización y considerando la caché KV con un contexto de 8K tokens. El objetivo es proporcionar datos precisos sobre cómo funcionan estos sistemas en hardware limitado, un área crítica para el desarrollo de IA local.
La metodología combina pruebas de inteligencia del modelo con mediciones de rendimiento de inferencia obtenidas directamente en los dispositivos. Para garantizar la precisión de los datos de velocidad y latencia, Artificial Analysis colabora con Liquid AI, quien realiza las mediciones físicas en los teléfonos. El equipo de Artificial Analysis ha validado de forma independiente el proceso de medición de Liquid AI para asegurar la integridad de los resultados. Las pruebas se centran en un conjunto de benchmarks seleccionados para representar el uso real en dispositivos móviles, incluyendo capacidades como la llamada a herramientas (BFCL), el seguimiento de instrucciones (IFBench) y el razonamiento científico y cuantitativo.
Los usuarios pueden consultar métricas específicas como el tiempo de generación extremo a extremo en dispositivos como el iPhone 17 Pro, así como la eficiencia de tokens y los excedentes del presupuesto de contexto. Este enfoque permite a desarrolladores y empresas evaluar no solo la capacidad cognitiva del modelo, sino también su viabilidad técnica para aplicaciones móviles, donde la optimización de recursos es fundamental. La plataforma ofrece una visión detallada del equilibrio entre la inteligencia del modelo y su eficiencia computacional en entornos restringidos.
