La industria de la IA ignora sus propios riesgos de seguridad

La industria de la inteligencia artificial ha acelerado el desarrollo de modelos de frontera sin abordar adecuadamente los riesgos de seguridad revelados por investigaciones internas, según un análisis de Wired. El artículo señala que, aunque Anthropic y otras empresas han advertido sobre los peligr

Marco matemático para la interpretabilidad de circuitos en transformers

El estudio "A Mathematical Framework for Transformer Circuits" presenta un enfoque de interpretabilidad mecanicista para descomponer las operaciones internas de los modelos de lenguaje transformers. El objetivo es reverse-engineer los cálculos de estos modelos, similar a la descompilación de binario

Los cimientos frágiles del monitoreo de cadenas de razonamiento

Una investigadora en interpretabilidad de modelos de lenguaje repasa las conclusiones principales de un taller sobre monitorización de cadenas de pensamiento (CoT) en sistemas de IA. El texto argumenta que la posibilidad de vigilar el razonamiento de los modelos es una «oportunidad frágil»: el CoT s

El 'horizonte de programación latente' de los agentes de código

Cuando un agente de inteligencia artificial aborda una tarea de ingeniería de software, encadena decenas de pasos de razonamiento, edición y pruebas sin que se conozca bien qué representación interna del programa está manejando el modelo de lenguaje subyacente. Un nuevo estudio, depositado en arXiv,

¿Se puede descifrar cómo razona un modelo de lenguaje?

Los modelos de lenguaje grandes redactan ensayos, resuelven problemas matemáticos y generan código, pero su lógica interna sigue siendo en gran medida opaca. Investigadores como Thomas Icard, profesor de filosofía y ciencias de la computación en la Universidad de Stanford, trabajan en la disciplina

Los LLM ya no son la caja negra prometida

La interpretabilidad mecanicista ha dado pasos importantes para desentrañar el funcionamiento interno de los grandes modelos de lenguaje, según explica el investigador Jay Hack al resumir hallazgos recientes de Anthropic. Aunque durante años se presentó a los LLM como cajas negras opacas, técnicas c