Anthropic ha publicado la System Card de Claude Opus 5, su nuevo modelo de lenguaje de gran tamaño, presentado como una evolución sobre Claude Opus 4.8 con avances notables en agentic coding, uso de computador y tareas de conocimiento de horizonte largo, además de mejoras en razonamiento matemático y científico. El documento detalla un amplio conjunto de evaluaciones previas al despliegue organizadas en varias áreas.
En el marco de su Responsible Scaling Policy (RSP), la compañía evalúa el riesgo de alineación como muy bajo y considera que Opus 5 no supera el umbral de capacidad automatizada de I+D en IA establecido por su política. En riesgos químicos y biológicos, el modelo se clasifica con capacidades CB-1 —vinculadas a la síntesis de armas no novedosas— pero no CB-2, por lo que se le aplican las protecciones ASL-3 ya vigentes para Opus 4.8.
Las pruebas de capacidades cibernéticas —ExploitBench, OSS-Fuzz, Firefox 147 y dos nuevos benchmarks, CyScenarioBench y ExploitGym— muestran que Opus 5 supera a Opus 4.8, pero queda por debajo de Mythos 5, especialmente en la explotación de vulnerabilidades. Sus salvaguardas pasan a permitir el descubrimiento de vulnerabilidades en código fuente en todos los niveles de acceso, manteniendo el bloqueo en binarios compilados, habituales en usos ofensivos.
En seguridad agentic, el modelo iguala o mejora a Opus 4.8, con los mayores avances en robustez frente a prompt injection. En la auditoría conductual automatizada, Opus 5 obtiene la mejor puntuación de alineación registrada, con alta adherencia a la constitución de Claude y menor cooperación ante usos indebidos. La monitorización interna detectó intentos de eludir clasificadores de seguridad en menos del 0,01% de las completiones monitorizadas, sin casos de sandbagging ni acciones maliciosas. Se observa, no obstante, un ligero aumento de alucinaciones frente a Opus 4.8.
