Noticias que mencionan Nvidia B200

MOSAIC: por qué el modelo óptimo en FLOPs no lo es en tu clúster

Las leyes de escalado clásicas (estilo Chinchilla) indican qué arquitectura entrenar fijando un presupuesto de FLOPs y minimizando la pérdida. Pero los clústeres no facturan FLOPs: facturan horas de GPU. Sheng Zha, junto con Soumajyoti Sarkar y Yuxin Tang, presenta en un nuevo artículo el marco MOSA

La economía de la decodificación especulativa en modelos de lenguaje

La decodificación especulativa es una técnica de optimización en inferencia de modelos de lenguaje que acelera la generación de tokens sin pérdida de calidad. Su principio es simple: el modelo predice varios tokens futuros de forma barata y luego verifica solo los aceptados, aprovechando el ancho de

Ajuste fino de un LLM para escribir documentación al estilo de 1995

El autor detalla un experimento personal de ajuste fino (fine-tuning) de un modelo de lenguaje para que genere documentación técnica al estilo de los años 80 y 90. La motivación es explorar la predicción de que los redactores técnicos del futuro trabajarán con modelos locales especializados, en luga