Gigatoken es una biblioteca de tokenización para modelos de lenguaje escrita en Rust que alcanza velocidades de hasta 24,53 GB/s en CPU AMD EPYC 9565 de 144 núcleos, frente a las 24,8 MB/s que ofrece el tokenizador de HuggingFace para GPT-2. Esto representa una aceleración cercana a 989 veces respecto a HuggingFace y 681 veces frente a tiktoken en ese hardware. La herramienta funciona como reemplazo directo de las bibliotecas existentes mediante modos de compatibilidad: el usuario puede envolver un tokenizador de HuggingFace o tiktoken con gt.Tokenizer(...).as_hf() o .as_tiktoken() y obtener las mismas salidas manteniendo una API familiar. También ofrece una API nativa que minimiza la interacción con Python y permite la máxima paralelización. Entre las optimizaciones clave destacan el uso de instrucciones SIMD para la pretokenización, que normalmente se delega a un motor de expresiones regulares, y un sistema de caché de mapeos de pretokens que evita recalcular codificaciones ya vistas. La biblioteca es compatible con CPUs x86 y ARM modernas, soporta modelos como GPT-2, Qwen 3, Llama 3/4, Phi-4, DeepSeek V3, Gemma, Mistral, GLM 4/5, Kimi K2 y ModernBERT, y se distribuye como paquete pip. En el AMD EPYC, gigatoken podría tokenizar los 130 billones de tokens estimados de Common Crawl en aproximadamente 6,5 horas. Los autores piden a los usuarios que reporten posibles desajustes de salida mediante issues en GitHub.
