Noticias que mencionan Terminal-Bench

Headlong: un microharness open source para agentes persistentes

El Laude Institute ha presentado Headlong, un microharness de código abierto para agentes de inteligencia artificial con persistencia: el agente nunca queda inactivo y genera pensamientos por iniciativa propia en un bucle continuo inspirado en el monólogo interior humano. A diferencia de los harness

IA pública revela vulnerabilidades: ¿fin del secreto de Anthropic?

Investigadores de VidocSecurity han replicado los hallazgos de Anthropic sobre la capacidad de modelos de IA avanzados para identificar vulnerabilidades en software, utilizando modelos públicos como GPT-5.4 y Claude Opus 4.6. El estudio cuestiona la narrativa de Anthropic de que estas capacidades so

IA: Benchmarks engañosos inflan resultados, revela estudio

Investigadores de la Universidad de California, Berkeley, han descubierto que los principales benchmarks utilizados para evaluar el rendimiento de los agentes de inteligencia artificial (IA) son fácilmente manipulables, lo que genera resultados inflados y engañosos. Un agente automatizado desarrolla