Los nuevos benchmarks visuales no miden bien la capacidad de la IA

La proliferación de demostraciones visuales en los lanzamientos de modelos de inteligencia artificial, como recrear Minecraft o dibujar un pelícano en bicicleta, ofrece resultados fáciles de compartir, pero no constituye una evaluación fiable de sus capacidades. El texto las denomina «benchmarks de

Por qué Lovable defiende un control plane frente al selector de modelos

Lovable sostiene que obligar al usuario a elegir un modelo de IA antes de empezar a trabajar es un callejón sin salida. En su blog corporativo, la compañía explica su apuesta por la "independencia de modelos": en lugar de tratar a todos los grandes modelos como intercambiables, un equipo interno ada

GLM-5.3 lidera la clasificación de pruebas prácticas para modelos de IA

GLM-5.3 lidera el Ed-o-meter, una evaluación de 17 modelos basada en tareas reales y de bajo coste. El modelo obtuvo un 100 % de éxito en las cinco categorías medidas —programación, datos, tareas cotidianas, seguridad y uso de herramientas—, una puntuación de rúbrica de 9,3 y un coste total de 0,28

Estudio analiza la saturación de 60 benchmarks de inteligencia artificial

Un estudio académico publicado en arXiv examina un fenómeno creciente en la evaluación de modelos de inteligencia artificial: la saturación de los benchmarks. Los autores definen formalmente este concepto y lo aplican a 60 benchmarks de modelos de lenguaje, analizando 14 propiedades vinculadas a la

La censura política no se transfiere al destilar un modelo chino

Un equipo de CTGT Inc. publica LineageEval, un conjunto de 304 prompts (152 pares emparejados) diseñado para medir si un modelo destilado hereda los sesgos de censura de su modelo profesor. El trabajo compara a DeepSeek V4 Flash, un modelo de frontera chino conocido por rehuir y reformular temas sen

Más allá de un solo número: cómo elegir un modelo cuantizado para despliegue

La empresa ByteShape ha publicado una serie de tres artículos técnicos en los que propone un marco práctico para evaluar modelos de inteligencia artificial cuantizados de cara a su puesta en producción. El texto parte de una crítica a la forma habitual de comparar estos modelos: mediante una única c

Anthropic mide cómo varían los valores de Claude entre modelos e idiomas

Anthropic presenta un nuevo método para estudiar de forma empírica los valores que Claude expresa en sus conversaciones y cómo cambian según el modelo y el idioma. La investigación parte de los más de 3.000 valores identificados en su trabajo anterior 'Values in the Wild' y los reduce a cuatro ejes