Cactus Hybrid: modelos en el dispositivo con puntuación de confianza y derivación a la nube

Fuentes: Cactus Hybrid: on-device models with confidence probes and cloud handoff

Cactus Hybrid es un proyecto de código abierto que incorpora a los modelos en el dispositivo una sonda (probe) entrenada para evaluar la corrección de cada respuesta, devolviendo una puntuación de confianza entre 0 y 1 como dato estructurado y separado del texto generado. La lógica es directa: si la confianza del modelo local es alta, se responde en local con privacidad y baja latencia; si es baja, la consulta se redirige a un modelo mayor en la nube. El repositorio ofrece guías de inicio rápido para cuatro entornos de ejecución: la biblioteca nativa Cactus, Hugging Face Transformers (versión 5.5.4 o 5.5.x), MLX para Apple Silicon y un parche compilado para llama.cpp.

El despliegue inicial se realiza con Gemma 4 E2B Hybrid, un modelo compacto que, según las pruebas publicadas, iguala a Gemini 3.1 Flash-Lite en la mayoría de los benchmarks derivando solo entre el 15% y el 55% de las consultas al modelo mayor, ejecutando en local el resto. Por ejemplo, en MMLU-Pro la derivación ronda el 45–55% en FP16, pero se dispara hasta cerca del 90% en cuantización de 4 bits, lo que evidencia la pérdida de calidad que introduce la cuantización agresiva.

El punto fuerte de la sonda es su capacidad para separar respuestas correctas de incorrectas: la media de AUROC en doce benchmarks de texto, visión y audio alcanza 0,814 frente al 0,549 de la entropía de tokens. El resultado más llamativo es que la sonda logra entre 0,79 y 0,88 de AUROC en cuatro pruebas de audio sin haber sido entrenada con datos de audio, lo que sugiere que detecta una señal de corrección independiente de la modalidad a partir del estado oculto del modelo. El proyecto se distribuye bajo licencia MIT, aunque el uso del modelo Gemma está sujeto a los términos de Gemma.