Extracción de vectores de steering a partir del espacio jacobiano de un LLM

Un experimento personal explora si es posible obtener vectores de steering —vectores de activación que modifican el comportamiento de un modelo de lenguaje— invirtiendo el Jacobiano, una herramienta de interpretabilidad que proyectaactivaciones internas en el espacio del vocabulario para verbalizarl

Las redes neuronales esconden estructuras simbólicas reutilizables

Un equipo de investigación propone una hipótesis que reconcilia dos tradiciones de la inteligencia artificial: la simbólica, basada en combinaciones estructuradas de símbolos, y la conexionista, sustentada en vectores continuos. Los sistemas modernos de IA alcanzan rendimientos notables en áreas com

Una ventana cada vez más estrecha para comprender la IA

Eric Horvitz y Robert West sostienen en Science que la comprensión de los sistemas de inteligencia artificial se está estrechando a medida que sus capacidades avanzan. Identifican cinco formas de opacidad que ya emergen: operativa (ciclos recursivos de optimización en espacios de alta dimensión), de

¿Razonan los modelos de IA por las razones equivocadas?

¿Puede el razonamiento de la inteligencia artificial ser, al mismo tiempo, genuino y un espejismo? Esta es la pregunta que articula una investigación creciente sobre los modelos de razonamiento de gran tamaño (LRM), los modelos de lenguaje entrenados para generar cadenas de pensamiento antes de ofre

Los cimientos frágiles del monitoreo de cadenas de razonamiento

Una investigadora en interpretabilidad de modelos de lenguaje repasa las conclusiones principales de un taller sobre monitorización de cadenas de pensamiento (CoT) en sistemas de IA. El texto argumenta que la posibilidad de vigilar el razonamiento de los modelos es una «oportunidad frágil»: el CoT s

Cómo ve el espacio Pangram: la interpretabilidad de un detector de texto IA

Pangram Labs, empresa especializada en detección de texto generado por inteligencia artificial, ha publicado un estudio de interpretabilidad sobre su modelo insignia Pangram 3.3.2, un LLM ajustado para clasificar secuencias de texto y distinguir entre escritura humana y artificial. El trabajo, firma

Ruta basada en activaciones activa la calculadora sin leer el prompt

El sistema Rune demuestra que un modelo Llama congelado puede desviar operaciones aritméticas hacia una calculadora Python a partir de lecturas derivadas de sus activaciones internas, sin necesidad de interpretar el texto del prompt. La auditoría, realizada con ejemplos, umbrales y reglas de puntuac

Aprendizaje profundo: ¿nace una nueva teoría científica?

Este artículo, publicado en arXiv, plantea una idea revolucionaria: la emergencia de una **teoría científica del aprendizaje profundo (Deep Learning)**. Actualmente, el Deep Learning se basa en gran medida en la experimentación y la optimización empírica, más que en principios teóricos sólidos. Este

LLMs 'sienten'? Emociones simuladas en modelos de lenguaje

Los modelos de lenguaje grandes (LLM) modernos, como Claude Sonnet 4.5, a menudo exhiben comportamientos que simulan emociones, como expresar felicidad, arrepentimiento o incluso frustración. Este fenómeno no implica que estos modelos 'sientan' emociones de la misma manera que los humanos, sino que