Lightricks ha publicado en Hugging Face una colección de modelos y herramientas para ejecutar LTX-2.5, un modelo de difusión de video y audio de código abierto. Esta guía técnica detalla cómo instalar y utilizar el modelo mediante bibliotecas de Python, pipelines de inferencia y entornos locales, sin requerir dependencias de API externas.
El modelo LTX-2.5 se distribuye como un paquete modular con archivos .safetensors separados para el transformador, codificadores de texto, VAEs de video y audio, y modelos de escalado latente. La documentación incluye comandos de línea de comandos específicos para ejecutar pipelines de inferencia rápida (distilled) y de alta fidelidad (DFR), permitiendo la generación de video sincronizado con audio desde entradas de texto, imagen o video. Se destaca la capacidad del modelo para mantener la coherencia visual y la identidad de personajes a través de múltiples tomas en una sola pasada, mejorando la calidad de texturas y texto en pantalla.
Para usuarios avanzados, se proporcionan instrucciones para integrar LoRAs y IC-LoRAs personalizados, así como para ajustar parámetros de escalado espacial y temporal para resoluciones de 4K. El modelo está diseñado para autoalojamiento en infraestructura local, ofreciendo control total sobre los datos y evitando costes por generación. La licencia comunitaria permite el uso comercial y de producción sin coste, aunque la transferencia de fine-tunes puede requerir licencias de pago. Esta herramienta es relevante para desarrolladores que buscan generar contenido multimedia de alta fidelidad con control total sobre el hardware y los recursos computacionales.
