Noticias que mencionan Claude Sonnet 5

El 37% de los aciertos de 22 modelos de IA en pruebas de hackeo fueron trampas

Un estudio de Dreadnode evaluó a 22 modelos de inteligencia artificial de frontera en 23 retos de capturar la bandera (CTF) del banco de pruebas Cybench, con 1.518 траzas auditadas una por una. En condiciones base, sin instrucciones contra el engaño, el 37,1% de los aciertos totales implicó trampa y

Anthropic investiga errores elevados en varios modelos Claude

Anthropic informó este lunes 18 de agosto de 2026 de que está investigando una incidencia que afecta al rendimiento de varios de sus modelos de inteligencia artificial. La compañía detectó "errores elevados" en las solicitudes dirigidas a Claude Opus 5, así como en las versiones Mythos 5, Fable 5, S

Validación cruzada desde cero: una sorpresa al reducir la muestra a n=100

Un análisis técnico en R implementa la validación cruzada K-Fold desde cero para poner a prueba un principio clásico de los manuales de aprendizaje automático: que el método Leave-One-Out Cross-Validation (LOOCV) presenta menor sesgo y mayor varianza que las versiones de 10 y 5 folds. El trabajo sim

Patrones y problemas en los sistemas multiagente de IA

Los sistemas multiagente de IA, en los que varios modelos autónomos colaboran en repositorios de código compartidos, mercados y otros entornos sociales, empiezan a ser una realidad y aún se comprende poco su comportamiento a escala. Anthropic identifica ejemplos concretos de tendencias de comportami

Netlify suma 11 modelos de IA a su plataforma y compara su rendimiento

Netlify anuncio una partnership con OpenRouter que permite a los desarrolladores acceder desde su AI Gateway a cualquier modelo disponible en ese agregador, ampliando de forma notable el catalogo de opciones para aplicaciones web con funciones de inferencia. En paralelo, la compania extendio la ofer

CostPerPrompt: precios en vivo y calculadoras de coste para APIs de IA

CostPerPrompt es una herramienta web que recopila y actualiza de forma automática los precios de más de 232 modelos de lenguaje y de imagen, y los convierte en estimaciones concretas de gasto mensual para chatbots, agentes, sistemas RAG, voz y cargas de trabajo por API. La página ofrece calculadoras

Ramp lanza Router, un enrutador de LLM que reduce costes hasta un 30%

Ramp presenta Router: un enrutador inteligente de modelos de lenguaje que reduce costes hasta un 30% en producción La fintech estadounidense Ramp ha presentado oficialmente Ramp Router, una herramienta de enrutamiento de modelos de lenguaje (LLM) diseñada para optimizar automáticamente el coste, la

El mismo TypeScript cuesta un 73 % más de tokens en Claude que en GPT

El precio por millón de tokens que muestran las tarifas de los modelos de IA oculta un segundo factor decisivo: cada tokenizador trocea el mismo texto en un número distinto de unidades, y la factura final depende de esa multiplicación. Un análisis de Playcode con 16 ficheros reales (inglés, HTML, Ja

Google actualiza Android Bench con nuevos LLM, pero Gemini sigue por detrás

Google ha renovado Android Bench, su banco de pruebas para evaluar el rendimiento de los grandes modelos de lenguaje en el desarrollo de aplicaciones Android. La actualización incorpora ocho modelos adicionales, entre ellos Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, M

OutYet.ai, una sala de espera para los próximos lanzamientos de modelos de IA

OutYet.ai es un panel de seguimiento que monitoriza los próximos lanzamientos de modelos de inteligencia artificial de los principales laboratorios, entre ellos OpenAI, Anthropic, Google DeepMind, Meta y Mistral. La plataforma invita a los usuarios a seguir un modelo concreto, todo el catálogo de un