Noticias que mencionan Claude Opus 4.8

El arnés Schema alcanza cerca del 99% en ARC-AGI-3 con modelos de frontera

Un equipo de Impossible Research, la Universidad de California en Berkeley y la Carnegie Mellon University presenta Schema, un arnés que logra que los modelos de frontera afronten los retos de ARC-AGI-3 como lo haría un físico: escribir el mecanismo de cada juego como un programa ejecutable, contras

El mismo TypeScript cuesta un 73 % más de tokens en Claude que en GPT

El precio por millón de tokens que muestran las tarifas de los modelos de IA oculta un segundo factor decisivo: cada tokenizador trocea el mismo texto en un número distinto de unidades, y la factura final depende de esa multiplicación. Un análisis de Playcode con 16 ficheros reales (inglés, HTML, Ja

Agent Draw: un agente que dibuja en el lienzo mientras hablas

Agent Draw es una herramienta experimental que permite a un agente de inteligencia artificial dibujar formas, diagramas y bocetos en un lienzo digital infinito mientras el usuario habla, sin interrumpir su presentación. Se trata de una extensión construida sobre tldraw, un SDK de lienzo infinito par

Google actualiza Android Bench con nuevos LLM, pero Gemini sigue por detrás

Google ha renovado Android Bench, su banco de pruebas para evaluar el rendimiento de los grandes modelos de lenguaje en el desarrollo de aplicaciones Android. La actualización incorpora ocho modelos adicionales, entre ellos Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, M

Cómo un paciente usó un proceso con IA para resolver una fatiga inexplicable

La autora, diagnosticada de un prolactinoma —tumor en la hipófisis— y sometida a dos cirugías cerebrales sin extirpación completa, empezó a sufrir episodios impreviscibles de fatiga, niebla mental, mareos y náuseas tras controlar el tumor con medicación. Tras fracasar en la consulta con varios médic

Qwen local frente a Opus: una herramienta distinta, no inferior

Un fundador y mantenedor de software comparte su experiencia de uso continuado con modelos Qwen locales (27B y 35-A3B) en su empresa, que mantiene proyectos como OpenFaaS, SlicerVM, Actuated e Inlets, todos escritos en Go y centrados en infraestructura. El autor matiza la afirmación de que Qwen loca

Kimi K2.7 Code: el nuevo modelo de Moonshot AI para programación

Moonshot AI ha lanzado Kimi K2.7 Code, un modelo lingüístico de gran tamaño especializado en tareas de programación. Basado en la arquitectura Mixture-of-Experts, cuenta con 1 billón de parámetros totales y activa 32 mil millones por inferencia. El modelo alcanza una longitud de contexto de 256.000

Anthropic amplía Project Glasswing a 150 nuevas organizaciones en 15 países

Anthropic amplía Project Glasswing a 150 nuevas organizaciones en 15 países La compañía de inteligencia artificial Anthropic anunció este martes la expansión de Project Glasswing, su iniciativa conjunta con la industria para identificar y corregir vulnerabilidades críticas de software mediante IA,

Expanse (YC P26) reduce el desperdicio de GPU en clústeres HPC

Expanse es una herramienta respaldada por Y Combinator en su promoción P26 que aborda un problema estructural de los centros de datos: la baja utilización efectiva de la capacidad de cómputo. Sus fundadores, Ismaeel, Eren, Yafet y Nikodem, con experiencia previa en fondos cuantitativos y grandes ins

CodeGraph reduce las llamadas a herramientas y los costes en asistentes IA

CodeGraph es una herramienta de código abierto que genera un grafo de conocimiento de código pre-indexado para potenciar asistentes de codificación basados en inteligencia artificial, como Claude Code, Cursor, Codex, OpenCode, Hermes Agent, Gemini, Antigravity y Kiro. Su objetivo principal es reduci