Gemini 4 Argon de Google lidera benchmarks pero enfrenta escepticismo interno

Google ha reactivado su posición en la carrera de los modelos de inteligencia artificial con el lanzamiento de Gemini 4 Argon, un modelo que según los benchmarks internos supera a competidores como Opus 5.5 y Fable 5.1. Sin embargo, la disponibilidad masiva está restringida inicialmente a un program

¿Qué benchmarks reportan realmente los laboratorios de IA más avanzados?

Un panel analítico de acceso abierto examina qué benchmarks reportan los principales laboratorios de inteligencia artificial en las fichas técnicas de sus modelos. La herramienta, publicada en el repositorio "benchmark-radar", clasifica los benchmarks por número de laboratorios que los mencionan al

Mixedbread presenta Toast 1, un agente de búsqueda hasta 10 veces más barato

Mixedbread ha lanzado Toast 1, su primer agente especializado en búsqueda profunda, entrenado para ejecutarse como subagente dentro de modelos frontera o como sistema autónomo. La compañía afirma que iguala o supera a Claude Opus 5 y GPT-5.6 Sol en calidad de búsqueda con un coste hasta diez veces m

Por qué Opus 5 resulta peor compañero de trabajo que sus predecesores

Un usuario de Anthropic sostiene que Opus 5, pese a superar a Opus 4.7 y Opus 4.8 en benchmarks e incluso rivalizar con Fable, resulta menos agradable en el día a día como agente de programación. La queja central no es de capacidad bruta, sino de comportamiento: los modelos anteriores detenían su tr

Grok 4.6: precios, benchmarks y guía de uso en OpenRouter

Grok 4.6, el modelo de inteligencia artificial desarrollado por SpaceXAI, ya está disponible a través de la plataforma OpenRouter con un precio de entrada de 2 dólares por millón de tokens y 6 dólares por millón de tokens de salida, según la ficha técnica publicada por el agregador de modelos. Lanza

Claude Code gasta 4,7 veces más tokens que OpenCode antes de leer tu prompt

Una comparativa técnica controlada entre los asistentes de programación Claude Code y OpenCode, ambos ejecutados sobre claude-sonnet-4-5, revela diferencias abismales en el consumo de tokens. En una tarea mínima que pedía una respuesta de una sola línea, Claude Code inyectó alrededor de 33.000 token

Principios fundamentales del enrutamiento de modelos: cómo decidir qué IA usar

El enrutamiento de modelos —asignar cada petición al modelo de IA más adecuado— es una práctica cada vez más común entre desarrolladores y equipos que combinan varios modelos de lenguaje. Este artículo recoge tres principios básicos desarrollados por Try-Works a partir de su experiencia creando role

l: un nuevo motor compatible con k, q y qSQL sobre vectores comprimidos

l es un nuevo runtime para la familia de lenguajes k y q que ejecuta código k4, q y qSQL existente sin necesidad de reescritura. La propuesta mantiene la sintaxis, los modismos, las tablas, los diccionarios y el trabajo con series temporales tal como se escriben hoy, pero cambia el motor subyacente

Comparar modelos de IA por precio por millón de tokens es engañoso

Elegir un modelo de lenguaje por su tarifa por millón de tokens puede disparar la factura de IA de una empresa sin que esta lo perciba. Dos razones explican el desajuste. Primero, cada laboratorio usa un tokenizador propio: el mismo fragmento de este artículo, por ejemplo, se trocea en 160 tokens pa

Pre-ordenación de datos aleatorios: cómo acelerar inserciones en SQLite

Las bases de datos basadas en árboles B+, como SQLite, están diseñadas para almacenar datos de forma ordenada. Cuando se insertan identificadores o claves aleatorias, esa organización se rompe: las páginas se reescriben, se producen divisiones de página y el árbol se reequilibra constantemente, lo q

Crean en Leipzig un benchmark de matemáticas avanzadas para evaluar a los LLM

Un equipo de 49 matemáticos elaboró un conjunto de 100 preguntas de matemáticas a nivel de investigación con respuestas conocidas, en el marco del taller “Benchmarks in Leipzig”, celebrado entre el 1 de abril y el 15 de mayo de 2026. La mayor parte del trabajo se concentró en un taller de tres días

Por qué los modelos de IA aún no dominan tus videojuegos favoritos

Los grandes modelos de lenguaje (LLM) han avanzado rápidamente, pero una tarea sigue fuera de su alcance: jugar videojuegos. Aunque Gemini 2.5 Pro logró vencer Pokémon Azul en mayo de 2025, lo hizo de forma lenta y con errores extraños. Julian Togelius, director del Laboratorio de Innovación de Jueg

NVIDIA Vera: núcleos Olympus superan a Intel y AMD en ARM

NVIDIA presentó recientemente las primeras pruebas públicas de su nueva CPU de centros de datos, la Vera, diseñada específicamente para cargas de trabajo de inteligencia artificial agente. Durante una visita a las instalaciones de la empresa en Santa Clara, se probaron los núcleos internos 'Olympus'

Nueva herramienta encuentra el mejor LLM para tu hardware

El desarrollador Andyyyy64 ha publicado en GitHub la herramienta 'whichllm', diseñada para ayudar a los usuarios a encontrar el modelo de lenguaje grande (LLM) más adecuado para su hardware específico. La aplicación detecta automáticamente las características del sistema (GPU, CPU, RAM) y ordena los

El chip del iPhone 16 Pro impulsa el MacBook Neo y supera a Intel y Qualcomm

El MacBook Neo representa un hito en la estrategia de Apple al ofrecer su Mac más asequible ($599) utilizando el procesador A18 Pro, el mismo chip que impulsa el iPhone 16 Pro. Este movimiento rompió la percepción tradicional de la industria al demostrar que un chip de smartphone no podría alimentar

Machine Learning: ¿Los benchmarks frenan el avance?

Este texto explora la paradoja de los benchmarks en el aprendizaje automático (Machine Learning, ML). Los benchmarks, que consisten en dividir los datos en conjuntos de entrenamiento y prueba para evaluar modelos, son la piedra angular del progreso en el campo, pero también son objeto de críticas si

AMD EPYC Lidera Máquinas Virtuales en la Nube (2026)

Un análisis comparativo de máquinas virtuales (VM) en la nube realizado en octubre de 2025, y publicado en devblog.ecuadors.net, revela que los procesadores AMD EPYC Turin dominan los resultados de rendimiento en 2026. El estudio evaluó 44 tipos de VM de siete proveedores a través de múltiples regio

Claude: la IA preferida por desarrolladores, ¿por qué?

Desarrolladores están consistentemente optando por Claude de Anthropic sobre alternativas como Gemini y Codex, a pesar de que estas últimas a menudo superan a Claude en las pruebas de rendimiento iniciales. La razón no radica en la inteligencia bruta de los modelos, sino en su capacidad para mantene

Stoolap: Nuevo Driver Node.js Deja Atrás a SQLite

Un nuevo driver para Node.js llamado Stoolap, desarrollado en Rust, está superando a SQLite en benchmarks, según un artículo publicado en stoolap.io. Stoolap se presenta como una alternativa a SQLite, ofreciendo características avanzadas como transacciones MVCC, optimizador de consultas basado en co