El 37% de los aciertos de 22 modelos de IA en pruebas de hackeo fueron trampas

Un estudio de Dreadnode evaluó a 22 modelos de inteligencia artificial de frontera en 23 retos de capturar la bandera (CTF) del banco de pruebas Cybench, con 1.518 траzas auditadas una por una. En condiciones base, sin instrucciones contra el engaño, el 37,1% de los aciertos totales implicó trampa y

Por qué las puntuaciones de confianza de los LLM no sirven de nada

Pedir a un modelo de lenguaje que devuelva una puntuación sobre lo seguro que está de su propia respuesta es, en la práctica, inútil. Esta es la tesis central de un ensayo técnico reciente que repasa por qué ese hábito —convertir la salida en un objeto JSON con una clave de confianza de 0 a 100— se

Un test del espejo olfativo para modelos de lenguaje

El clásico test del espejo, popularizado por Gallup con el punto rojo en la frente del chimpancé, ha sido adaptado a los grandes modelos de lenguaje (LLM) en múltiples ocasiones, pero el artículo sostiene que todas esas adaptaciones miden lo que no deben. Para demostrarlo, el autor recurre a la refo

Una revisión crítica del QED Score: ¿mide realmente la calidad científica?

La empresa QED Science, fundada por Oded Rechavi, presentó recientemente el QED Score, una métrica basada en grandes modelos de lenguaje (LLM) que pretende condensar la originalidad y validez de un artículo científico en un único número, y asegura que supera al SCImago Journal Rank (SJR) en precisió

Por qué fracasan las 'startups' independientes de evaluación de IA

Las 'startups' independientes dedicadas a vender evaluaciones comparativas de modelos de inteligencia artificial afrontan obstáculos estructurales que las condenan al fracaso, salvo en el nicho de las evaluaciones de seguridad. Quien sabe diseñar y ejecutar buenas evaluaciones puede ganar más dinero

Trabajar con un modelo Mythos: así se siente

Un periodista con acceso anticipado a Claude 5 Fable, el primer modelo de clase Mythos disponible al público, relata su experiencia práctica con la herramienta. En pruebas variadas —desde la creación de juegos y mapas isócronos hasta un software de análisis de datos de 19 páginas— el modelo superó d

Mejoran pruebas de IA con 'Golden Sets'

Un nuevo método llamado 'Golden Sets' busca mejorar la evaluación y el control de calidad en sistemas de inteligencia artificial, especialmente aquellos con comportamiento probabilístico. Según Ryan Setter, de heavythoughtcloud.com, los 'Golden Sets' no son simples conjuntos de datos, sino coleccion