Guía técnica para implementar y escalar sistemas de IA analítica

El manual 'The Analytical AI Handbook' define la IA analítica como el uso de modelos fundacionales para procesar datos no estructurados y tomar decisiones operativas a escala, diferenciándola de las aplicaciones generativas creativas. A diferencia de la generación de contenido, estas tareas son medi

Un usuario prescinde de Claude tras la llegada de Opus 5: “es grosero”

Un usuario habitual de Claude Code ha decidido abandonar el asistente de Anthropic tras la actualización a Opus 5, alegando un cambio brusco de tono y personalidad. El autor explica que comenzó a usar Claude Code en septiembre del año pasado con Opus 4.5, cuya calidad le pareció “mágica” al generar

Por qué los rankings de visibilidad en IA no son fiables

Las plataformas de seguimiento de visibilidad en inteligencia artificial —que miden qué tan presentes aparecen las marcas en ChatGPT, Claude, Gemini, Perplexity o las respuestas de Google— ofrecen cifras de precisión engañosa, según un análisis firmado en Canonry por un ingeniero de software con exp

Experimentos prácticos con asistentes de programación basados en IA

Un programador comparte su experiencia de varios meses usando suscripciones de pago a modelos de IA (Anthropic, OpenAI, Google, Moonshot, DeepSeek y Cerebras) en tareas reales de desarrollo. Tras probar múltiples herramientas, concluye que Claude Code y Codex resultan poco fiables en la práctica (co

Cómo Hex construyó un laboratorio para evaluar agentes de datos

Hex ha desarrollado una infraestructura propia, llamada The Shoebox, para entrenar y comparar agentes de datos en un entorno controlado. La plataforma funciona como un banco de pruebas dentro del entorno de desarrollo local de Hex, pero se conecta a un espacio de trabajo interno compartido donde se

Crean en Leipzig un benchmark de matemáticas avanzadas para evaluar a los LLM

Un equipo de 49 matemáticos elaboró un conjunto de 100 preguntas de matemáticas a nivel de investigación con respuestas conocidas, en el marco del taller “Benchmarks in Leipzig”, celebrado entre el 1 de abril y el 15 de mayo de 2026. La mayor parte del trabajo se concentró en un taller de tres días