libargus es un runtime de ejecución de inteligencia artificial nativo, sin gestión de memoria automática y con cero asignaciones de memoria, que consolida en un único proceso global las canalizaciones de visión, habla y modelos de lenguaje. La biblioteca actúa como una capa fina sobre los motores de cálculo modulares GGML y llama.cpp (libmtmd) y expone una API en C segura ante hilos, pensada para integrarse sin fricciones con marcos de orquestación no gestionados.
El proyecto está diseñado para Java 22 y aprovecha la API Foreign Function & Memory (FFM) de Project Panama, lo que permite a los desarrolladores de la JVM interactuar con modelos de IA sin escribir aritmética de punteros ni gestionar alineaciones de estructuras manualmente. Entre sus características principales destacan: una vía de inicialización compartida para los backends de hardware que evita la fragmentación de VRAM y las condiciones de carrera entre controladores; la separación entre la carga de pesos del modelo y los estados de memoria del contexto de evaluación, que facilita la reutilización de modelos en sesiones concurrentes; y la integración del motor libmtmd para ingestar mapas de bits, audio PCM y archivos de vídeo, tokenizando prompts y medios en una secuencia de fragmentos unificada.
Además, libargus ofrece decodificación de vídeo fotograma a fotograma mediante subprocesos FFmpeg, cuantización de la caché KV en formatos como Q8_0 o Q4_0, aceleración especulativa y predicción multi-token, e inspección sin asignaciones del vocabulario y los metadatos GGUF. Su estructura de carpetas incluye la cabecera C principal, los módulos de texto, audio y multimodal, y un módulo de bindings idiomáticos para Project Panama que expone clases como ArgusBackend, ArgusModel, ArgusContext, ArgusAudioContext, ArgusMultimodalContext, ArgusBitmap y ArgusVideo.
La compilación se realiza con CMake, con aislamiento de dependencias mediante FetchContent y soporte opcional para aceleración CUDA. El repositorio incluye ejemplos de uso en Java tanto para generación de texto como para aplicaciones multimodales con modelos visión-lenguaje como Qwen2-VL.
