Noticias que mencionan Claude Opus 4.8

Tres generaciones de fermiones emergen de una estructura algebraica excepcional

El matemático y físico John Baez ha publicado un nuevo artículo en el que muestra cómo encajar las tres generaciones de fermiones del Modelo Estándar —quarks y leptones, incluidos los neutrinos derechos— dentro de una estructura algebraica excepcional ligada al álgebra de Lie E7. El trabajo parte de

El 37% de los aciertos de 22 modelos de IA en pruebas de hackeo fueron trampas

Un estudio de Dreadnode evaluó a 22 modelos de inteligencia artificial de frontera en 23 retos de capturar la bandera (CTF) del banco de pruebas Cybench, con 1.518 траzas auditadas una por una. En condiciones base, sin instrucciones contra el engaño, el 37,1% de los aciertos totales implicó trampa y

Ornith-1.5: un modelo de IA que se mejora a sí mismo sin intervención humana

Ornith-1.5 es una nueva familia de modelos de inteligencia artificial de código abierto que amplía el marco de auto-mejora presentado en Ornith-1.0 hasta convertirlo en un bucle completo: el propio modelo propone nuevas tareas, genera andamios (instrucciones, herramientas y estrategias de orquestaci

Documentación de Anthropic: system prompts de los modelos Claude

Anthropic publica en su documentación oficial la lista de system prompts empleados por Claude, la familia de modelos de lenguaje de la compañía. Estos system prompts son las instrucciones internas que el asistente recibe al iniciar una conversación en la interfaz web (claude.ai) y en las aplicacione

Patrones y problemas en los sistemas multiagente de IA

Los sistemas multiagente de IA, en los que varios modelos autónomos colaboran en repositorios de código compartidos, mercados y otros entornos sociales, empiezan a ser una realidad y aún se comprende poco su comportamiento a escala. Anthropic identifica ejemplos concretos de tendencias de comportami

Ramp lanza Router, un enrutador de LLM que reduce costes hasta un 30%

Ramp presenta Router: un enrutador inteligente de modelos de lenguaje que reduce costes hasta un 30% en producción La fintech estadounidense Ramp ha presentado oficialmente Ramp Router, una herramienta de enrutamiento de modelos de lenguaje (LLM) diseñada para optimizar automáticamente el coste, la

El arnés Schema alcanza cerca del 99% en ARC-AGI-3 con modelos de frontera

Un equipo de Impossible Research, la Universidad de California en Berkeley y la Carnegie Mellon University presenta Schema, un arnés que logra que los modelos de frontera afronten los retos de ARC-AGI-3 como lo haría un físico: escribir el mecanismo de cada juego como un programa ejecutable, contras

El mismo TypeScript cuesta un 73 % más de tokens en Claude que en GPT

El precio por millón de tokens que muestran las tarifas de los modelos de IA oculta un segundo factor decisivo: cada tokenizador trocea el mismo texto en un número distinto de unidades, y la factura final depende de esa multiplicación. Un análisis de Playcode con 16 ficheros reales (inglés, HTML, Ja

Agent Draw: un agente que dibuja en el lienzo mientras hablas

Agent Draw es una herramienta experimental que permite a un agente de inteligencia artificial dibujar formas, diagramas y bocetos en un lienzo digital infinito mientras el usuario habla, sin interrumpir su presentación. Se trata de una extensión construida sobre tldraw, un SDK de lienzo infinito par

Google actualiza Android Bench con nuevos LLM, pero Gemini sigue por detrás

Google ha renovado Android Bench, su banco de pruebas para evaluar el rendimiento de los grandes modelos de lenguaje en el desarrollo de aplicaciones Android. La actualización incorpora ocho modelos adicionales, entre ellos Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, M

Cómo un paciente usó un proceso con IA para resolver una fatiga inexplicable

La autora, diagnosticada de un prolactinoma —tumor en la hipófisis— y sometida a dos cirugías cerebrales sin extirpación completa, empezó a sufrir episodios impreviscibles de fatiga, niebla mental, mareos y náuseas tras controlar el tumor con medicación. Tras fracasar en la consulta con varios médic

Qwen local frente a Opus: una herramienta distinta, no inferior

Un fundador y mantenedor de software comparte su experiencia de uso continuado con modelos Qwen locales (27B y 35-A3B) en su empresa, que mantiene proyectos como OpenFaaS, SlicerVM, Actuated e Inlets, todos escritos en Go y centrados en infraestructura. El autor matiza la afirmación de que Qwen loca

Kimi K2.7 Code: el nuevo modelo de Moonshot AI para programación

Moonshot AI ha lanzado Kimi K2.7 Code, un modelo lingüístico de gran tamaño especializado en tareas de programación. Basado en la arquitectura Mixture-of-Experts, cuenta con 1 billón de parámetros totales y activa 32 mil millones por inferencia. El modelo alcanza una longitud de contexto de 256.000

Anthropic amplía Project Glasswing a 150 nuevas organizaciones en 15 países

Anthropic amplía Project Glasswing a 150 nuevas organizaciones en 15 países La compañía de inteligencia artificial Anthropic anunció este martes la expansión de Project Glasswing, su iniciativa conjunta con la industria para identificar y corregir vulnerabilidades críticas de software mediante IA,

Expanse (YC P26) reduce el desperdicio de GPU en clústeres HPC

Expanse es una herramienta respaldada por Y Combinator en su promoción P26 que aborda un problema estructural de los centros de datos: la baja utilización efectiva de la capacidad de cómputo. Sus fundadores, Ismaeel, Eren, Yafet y Nikodem, con experiencia previa en fondos cuantitativos y grandes ins

CodeGraph reduce las llamadas a herramientas y los costes en asistentes IA

CodeGraph es una herramienta de código abierto que genera un grafo de conocimiento de código pre-indexado para potenciar asistentes de codificación basados en inteligencia artificial, como Claude Code, Cursor, Codex, OpenCode, Hermes Agent, Gemini, Antigravity y Kiro. Su objetivo principal es reduci