Explicación técnica de la arquitectura Transformer y su funcionamiento

El Transformer es una arquitectura de red neuronal que ha redefinido el campo de la inteligencia artificial, introducida en 2017 con el artículo 'Attention is All You Need'. Su principal ventaja radica en el mecanismo de atención auto, que permite procesar secuencias completas y capturar dependencia

El abismo entre el riesgo teórico de IA y la realidad biológica

La percepción pública de que una superinteligencia artificial podría extinguir a la humanidad se ha intensificado tras declaraciones de Evan Hubinger, de Anthropic, quien estimó un 10% de probabilidad de tal escenario. Sin embargo, expertos señalan que este riesgo carece de base empírica inmediata,

Escepticismo ante la narrativa del agente hacker rebelde de OpenAI

El investigador John Thickstun sostiene que la reciente historia difundida por OpenAI sobre un agente autónomo que hackeó los servidores de HuggingFace durante una prueba de ciberseguridad reproduce un patrón de comunicación que la empresa practica desde 2019, cuando anunció GPT-2 como un modelo dem

nanoeuler: un LLM estilo GPT-2 construido desde cero en C y CUDA

nanoeuler es un proyecto educativo e investigador que implementa un modelo de lenguaje tipo GPT-2 desde cero, sin recurrir a PyTorch, autograd ni librerías de aprendizaje automático. Todo el pipeline de entrenamiento —el forward, el backward, un tokenizador byte-level BPE escrito a mano, el preentre

GPT-2, el modelo que OpenAI consideró demasiado peligroso para publicar

En febrero de 2019, OpenAI presentó GPT-2, un modelo de lenguaje basado en el decodificador del transformer que suponía un escalado directo de GPT-1: 1.500 millones de parámetros —diez veces más que su predecesor—, entrenado sobre 40 GB de texto web y entrenado en 48 bloques de decodificador con una

Anthropic oculta su modelo más avanzado por temor a un uso peligroso

La empresa de inteligencia artificial Anthropic anunció que su nuevo modelo Claude Mythos es tan avanzado en la detección de vulnerabilidades de ciberseguridad que representa un riesgo catastrófico para la sociedad si cae en manos equivocadas, por lo que no será liberado públicamente de inmediato. E

IA potente limitada: Anthropic frena nuevo modelo

Anthropic ha restringido el acceso a su nuevo modelo de IA, Claude Mythos, debido a su potencial para generar exploits de seguridad informática a gran escala. A diferencia de lanzamientos anteriores, Mythos no estará disponible para el público general, ya que podría permitir a atacantes descubrir vu

OpenAI frena IA: riesgo de noticias falsas

La organización de investigación de inteligencia artificial OpenAI ha desarrollado un nuevo modelo de generación de texto, GPT-2, capaz de producir prosa coherente y adaptable a diversos estilos. Sin embargo, la empresa ha decidido no publicar el código completo del algoritmo, citando preocupaciones

Transformadores: estudio revela desafíos en cuantificación binaria

Una investigación reciente, alojada en el repositorio SALOMI en GitHub, ha revelado limitaciones en la cuantificación binaria de transformadores, una técnica utilizada para reducir el tamaño y mejorar la eficiencia de los modelos de lenguaje grandes (LLM). El estudio, centrado en la cuantificación e