Embeddings al descubierto: aritmética de vectores explicada con Word2Vec

Este artículo es una crónica divulgativa del capítulo 2 de The Hundred-Page Language Models Book, centrada en los embeddings: la representación densa de palabras que usan los modelos de lenguaje. Frente a los vectores one-hot, que desperdician memoria y no capturan relaciones semánticas, los embeddi

Gigatoken: un tokenizador en Rust hasta 1000 veces más rápido que HuggingFace

Gigatoken es una biblioteca de tokenización para modelos de lenguaje escrita en Rust que alcanza velocidades de hasta 24,53 GB/s en CPU AMD EPYC 9565 de 144 núcleos, frente a las 24,8 MB/s que ofrece el tokenizador de HuggingFace para GPT-2. Esto representa una aceleración cercana a 989 veces respec

El mismo TypeScript cuesta un 73 % más de tokens en Claude que en GPT

El precio por millón de tokens que muestran las tarifas de los modelos de IA oculta un segundo factor decisivo: cada tokenizador trocea el mismo texto en un número distinto de unidades, y la factura final depende de esa multiplicación. Un análisis de Playcode con 16 ficheros reales (inglés, HTML, Ja

Cómo funcionan realmente los grandes modelos de lenguaje

Los grandes modelos de lenguaje (LLM) actuales comparten un esqueleto común basado en la arquitectura transformer. Comprender las piezas fundamentales de ese bloque permite leer papers y fichas técnicas con criterio. Este artículo recorre los mecanismos esenciales: tokenización, embeddings, codifica

Comparar modelos de IA por precio por millón de tokens es engañoso

Elegir un modelo de lenguaje por su tarifa por millón de tokens puede disparar la factura de IA de una empresa sin que esta lo perciba. Dos razones explican el desajuste. Primero, cada laboratorio usa un tokenizador propio: el mismo fragmento de este artículo, por ejemplo, se trocea en 160 tokens pa

Algoritmo de planos de corte optimiza tokenizadores de LLM

La tokenización es un paso fundamental en el entrenamiento de modelos de lenguaje de gran escala (LLM). Consiste en dividir el texto en unidades discretas llamadas tokens, cada una asociada a una secuencia de bytes. La elección del vocabulario de tokens, es decir, el mapeo entre tokens y bytes, impa

Tokens y tokenización: por qué los LLM no ven letras

Los modelos de lenguaje grandes (LLM) como GPT-4 no procesan texto directamente: lo fragmentan en unidades llamadas tokens, las únicas entidades que el modelo realmente percibe. Cada modelo dispone de un vocabulario fijo de tokens decidido durante su entrenamiento, por eso GPT-4 y Llama 3 descompone

Anatomía de un LLM moderno: de los tokens a la predicción

Los modelos de lenguaje de gran tamaño (LLM) se construyen apilando bloques transformer una y otra vez, por lo que entender la maquinaria del transformer es la base para comprender su funcionamiento. Esta guía recorre los componentes esenciales de un LLM moderno sin profundizar en las matemáticas, c

Cómo funcionan los modelos de lenguaje como ChatGPT

Los Modelos de Lenguaje Grandes (LLMs), como ChatGPT, han revolucionado la forma en que interactuamos con la tecnología. Pero, ¿cómo funcionan realmente? Este resumen explica el proceso, desde los datos brutos hasta la creación de un asistente conversacional. **¿Qué son y por qué son importantes?*

Claude: Nuevo tokenizador eleva costos de procesamiento

Simon Willison ha actualizado su herramienta 'Claude Token Counter' para permitir la comparación del conteo de tokens entre diferentes modelos de inteligencia artificial de Anthropic, incluyendo Opus 4.7, Opus 4.6, Sonnet 4.6 y Haiku 4.5. La actualización es relevante porque el modelo Opus 4.7 intro

LLMs generan mejor código con técnica de 'auto-enseñanza'

El artículo "Embarrassingly Simple Self-Distillation Improves Code Generation" presenta una técnica sorprendentemente sencilla para mejorar la capacidad de los grandes modelos de lenguaje (LLMs) para generar código. En esencia, la técnica, llamada Self-Distillation Simple (SSD), permite que un LLM s