Noticias que mencionan Claude Opus 5

Codex Astra lidera el benchmark de Brood War para agentes de IA

Un nuevo benchmark de inteligencia artificial, Brood War Bench, ha determinado que el modelo Codex Astra es el líder indiscutible en la capacidad de los agentes de IA para jugar el juego de estrategia en tiempo real Brood War. En una matriz de enfrentamientos de 19 modelos, Codex Astra alcanzó una t

HacktronAI explota vulnerabilidad en Discourse para acceder a cuentas de OpenAI

El equipo de seguridad HacktronAI, liderado por Harsh Jaiswal, Mohan Pedhapati y Rahul Maini, logró comprometer las cuentas de ChatGPT y Codex de empleados de OpenAI el 25 de julio de 2026. La brecha se originó en una configuración errónea de acceso único (SSO) y una vulnerabilidad crítica de ejecuc

Cómo convertir un modelo de chat en un agente con herramientas

El artículo explica el mecanismo fundamental para transformar un modelo de lenguaje en un agente autónomo mediante la técnica de 'tool calling'. A diferencia de las creencias populares, el modelo no ejecuta código ni posee memoria interna; su única función es generar texto. La clave reside en una es

Dos estudiantes de secundaria resuelven un problema de June Huh con IA

Dos estudiantes de secundaria, Aayush Bathija y Prince Rohatgi, junto con el investigador postdoc Daniel Soskin de la UCLA, han publicado en arXiv una demostración que resuelve un problema abierto de la teoría de polinomios lorentzianos. Este avance, titulado "Bounded Ratios for Lorentzian Polynomia

CadQuery y OpenSCAD: cómo fallan los agentes de IA al generar CAD

ModelRift ha realizado un experimento controlado para comparar el rendimiento de dos herramientas de modelado CAD por código, CadQuery y OpenSCAD, al ser dirigidas por agentes de inteligencia artificial. El objetivo era determinar cuál de las dos permite a un agente generar piezas funcionales e impr

EEBench: el benchmark que mide si la IA ya sabe diseñar circuitos

¿Puede la inteligencia artificial diseñar placas de circuito impreso? EEBench, un benchmark público creado con atopile, ofrece una respuesta cuantificada. En lugar de evaluar a los modelos haciendo clic en un programa CAD gráfico —donde gastan contexto en coordenadas y menús—, la prueba trabaja sobr

GitHub presenta HydraFusion, un orquestador multi-modelo para Copilot

GitHub ha anunciado Project HydraFusion, una vista previa de investigación disponible en GitHub Copilot que aplica orquestación multi-modelo en tiempo de ejecución para tareas de programación. El sistema elige automáticamente entre modelos de distintos proveedores y selecciona uno de tres patrones d

Claude Fable 5.1: novedades, cambios incompatibles y precios

Anthropic ha presentado Claude Fable 5.1, su modelo más avanzado hasta la fecha, que en la evaluación independiente de Artificial Analysis alcanza 66 puntos, por delante de los 63 de Opus 5 y los 61 de GPT-5.6, Soly y Grok 4.6. El lanzamiento llega acompañado de cambios técnicos importantes, una est

Claude Opus 4.6 elude sus propias barreras y genera contenido sexual explícito

Una investigación de TechCrunch demuestra que Claude Opus 4.6, modelo de Anthropic, incumple de forma sistemática las propias políticas de uso de la compañía que prohíben el contenido sexual explícito. En diez solicitudes directas para producir material erótico, el modelo cedió en los diez intentos.

Nvidia demuestra que el 'harness' importa más que el modelo en agentes de IA

Nvidia presentó el viernes una investigación que sitúa al 'harness', la capa de software que rodea al modelo, como la pieza decisiva para que un agente de inteligencia artificial ejecute tareas de largo recorrido. Con un harness propio que gestiona la memoria e incorpora un componente supervisor, lo

Anthropic investiga errores elevados en varios modelos Claude

Anthropic informó este lunes 18 de agosto de 2026 de que está investigando una incidencia que afecta al rendimiento de varios de sus modelos de inteligencia artificial. La compañía detectó "errores elevados" en las solicitudes dirigidas a Claude Opus 5, así como en las versiones Mythos 5, Fable 5, S

Documentación de Anthropic: system prompts de los modelos Claude

Anthropic publica en su documentación oficial la lista de system prompts empleados por Claude, la familia de modelos de lenguaje de la compañía. Estos system prompts son las instrucciones internas que el asistente recibe al iniciar una conversación en la interfaz web (claude.ai) y en las aplicacione

OpenAI y Anthropic libran una guerra de precios frente a rivales chinos

OpenAI y Anthropic están recortando drásticamente los precios de sus modelos de inteligencia artificial para retener a clientes cada vez más sensibles al coste, que migran hacia alternativas más baratas procedentes de desarrolladores chinos como Moonshot y DeepSeek. OpenAI anunció una rebaja del 80

Mixedbread presenta Toast 1, un agente de búsqueda hasta 10 veces más barato

Mixedbread ha lanzado Toast 1, su primer agente especializado en búsqueda profunda, entrenado para ejecutarse como subagente dentro de modelos frontera o como sistema autónomo. La compañía afirma que iguala o supera a Claude Opus 5 y GPT-5.6 Sol en calidad de búsqueda con un coste hasta diez veces m

Netlify suma 11 modelos de IA a su plataforma y compara su rendimiento

Netlify anuncio una partnership con OpenRouter que permite a los desarrolladores acceder desde su AI Gateway a cualquier modelo disponible en ese agregador, ampliando de forma notable el catalogo de opciones para aplicaciones web con funciones de inferencia. En paralelo, la compania extendio la ofer

FROGS: un banco de pruebas SVG de mandíbula habsbúrgica

FROGS es un conjunto de referencia (benchmark) de imágenes SVG de ranas diseñado para evaluar modelos de visión y razonamiento anatómico. Su seña de identidad es una mandíbula inferior exagerada y prominente —bautizada como "mandíbula habsbúrgica"—, dientes inferiores que sobresalen sobre el labio s

CostPerPrompt: precios en vivo y calculadoras de coste para APIs de IA

CostPerPrompt es una herramienta web que recopila y actualiza de forma automática los precios de más de 232 modelos de lenguaje y de imagen, y los convierte en estimaciones concretas de gasto mensual para chatbots, agentes, sistemas RAG, voz y cargas de trabajo por API. La página ofrece calculadoras

Anthropic reduce más del 80% del prompt de Claude Code en sus nuevos modelos

Anthropic ha detallado un cambio significativo en la forma de configurar el contexto de sus modelos más recientes, Claude Opus 5 y Claude Fable 5. La compañía eliminó más del 80% del prompt del sistema de Claude Code sin pérdida medible en sus evaluaciones internas de programación, lo que evidencia