ZDTaichu5.0-9B es un modelo de lenguaje multimodal de 9 mil millones de parámetros desarrollado por TaichuAI, diseñado para la comprensión visual general, el razonamiento espacial y la interacción con herramientas autónomas. El sistema combina un decodificador de lenguaje Qwen3.5-9B con un codificador de visión C-RADIOv4-H, permitiendo procesar texto, imágenes y vídeos con cualquier resolución dentro de una ventana de contexto de hasta 128.000 tokens.
A diferencia de otros modelos de escala similar, ZDTaichu5.0-9B prioriza la capacidad de razonamiento espacial y la comprensión encarnada (embodied) sobre la especialización extrema. Según las evaluaciones reportadas, el modelo lidera en benchmarks de razonamiento espacial como SparBench y ViewSpatial, y destaca en tareas de agentes mediante las métricas TAU2-Bench y Claw-Eval. La arquitectura incorpora un mecanismo de 'Entropy-Gated Adaptive Recurrent Reasoning', que asigna dinámicamente pasos adicionales de refinamiento en el espacio latente para tokens más complejos, optimizando el rendimiento en tareas de alto nivel.
El modelo está optimizado para aplicaciones que requieren visión matemática, lectura de documentos y gráficos, así como planificación de acciones en entornos físicos. Aunque soporta múltiples imágenes y vídeo, la ejecución de herramientas requiere que la aplicación circundante implemente y valide la seguridad de las operaciones, ya que el modelo no ejecuta herramientas por sí mismo. Esta configuración lo posiciona como una herramienta robusta para investigación en IA encarnada y sistemas de agentes complejos.
