Petals: ejecuta modelos de lenguaje grandes en casa con una red colaborativa

Fuentes: Petals: run large language models at home, BitTorrent-style

Petals es un proyecto de código abierto que permite ejecutar y ajustar modelos de lenguaje de gran tamaño desde equipos domésticos mediante una arquitectura inspirada en BitTorrent. En lugar de cargar el modelo completo en una sola máquina, cada participante descarga solo una parte y se conecta a una red distribuida de usuarios que alojan el resto de los pesos.

Entre los modelos compatibles figuran Llama 3.1 (hasta 405.000 millones de parámetros), Mixtral (8x22B), Falcon (40B+) y BLOOM (176B). Para correr la parte local basta con una GPU de consumo o Google Colab. Las pruebas publicadas por el equipo indican velocidades de alrededor de 6 tokens por segundo en inferencia con Llama 2 (70B) y cerca de 4 tokens por segundo con Falcon (180B), suficientes para chatbots y aplicaciones interactivas.

A diferencia de las API comerciales, Petals ofrece acceso directo a los estados internos del modelo: se pueden aplicar métodos personalizados de ajuste fino y muestreo, ejecutar rutas arbitrarias a través de la red y trabajar con la flexibilidad de PyTorch y la librería Transformers de Hugging Face. El proyecto se enmarca en el taller de investigación BigScience y dispone de servidores de chat y monitorización de salud de la red como chat.petals.dev y health.petals.dev.