Noticias que mencionan Terminal Bench 2.1

StepFun lanza Step 3.7 Flash con visión multimodal y eficiencia

StepFun ha lanzado Step 3.7 Flash, un modelo de inteligencia artificial de alta eficiencia diseñado para optimizar el rendimiento de los agentes en entornos reales. Esta nueva versión se centra en la comprensión multimodal y la ejecución de tareas complejas, permitiendo entender imágenes, documentos

OpenAI inicia la vista previa limitada de GPT-5.6 Sol, su nuevo modelo insignia

OpenAI comenzó una vista previa limitada de la serie GPT-5.6, integrada por tres modelos: Sol, el buque insignia; Terra, un modelo equilibrado para trabajo cotidiano con rendimiento competitivo frente a GPT-5.5 pero a la mitad de precio; y Luna, una versión rápida y económica. La compañía prevé lanz

Ornith-1.5: un modelo de IA que se mejora a sí mismo sin intervención humana

Ornith-1.5 es una nueva familia de modelos de inteligencia artificial de código abierto que amplía el marco de auto-mejora presentado en Ornith-1.0 hasta convertirlo en un bucle completo: el propio modelo propone nuevas tareas, genera andamios (instrucciones, herramientas y estrategias de orquestaci

Unsloth lanza Dynamic 3.0 GGUFs con más del 10% de precisión adicional

Unsloth ha presentado Dynamic v3.0, una nueva iteración de su sistema de cuantización para modelos de gran tamaño. La compañía publica los GGUF de Qwen3.8-27B bajo este esquema, que según sus pruebas internas ofrecen más de un 10% adicional de exactitud top-1% al mismo tamaño en disco frente a otras

Cuantización de Qwen3.8 27B: 4 bits mantiene el rendimiento, 1 bit colapsa

Quesma Blog publica un análisis exhaustivo sobre cómo afecta la cuantización al rendimiento del modelo Qwen3.8 27B en distintas tareas. El modelo completo en BF16 ocupa 55 GB de VRAM, fuera del alcance de la mayoría del hardware de consumo. Los experimentos, ejecutados con llama.cpp sobre GPUs alqui