Diez problemas técnicos al usar modelos de código abierto en OpenRouter

Fuentes: Ten technical pitfalls when using open models on OpenRouter

Mo Moustafa, creador del asistente de inteligencia artificial Olly, documenta diez problemas técnicos críticos al utilizar modelos de código abierto a través de la plataforma OpenRouter. Tras procesar 18 millones de mensajes, Moustafa identifica que la misma arquitectura de modelo produce resultados dispares dependiendo del proveedor de infraestructura que aloje los pesos. Los benchmarks de GPQA Diamond y TAU-Bench revelan diferencias de hasta 30 puntos porcentuales en el rendimiento de herramientas entre proveedores, lo que invalida la suposición de equivalencia técnica. Además, se detectan fallos en la interpretación de imágenes, donde algunos proveedores devuelven errores de percepción o ignoran la entrada visual, y inconsistencias en el manejo del parámetro de esfuerzo de razonamiento. El filtrado por cuantización (fp8 vs fp4) no garantiza calidad superior, ya que los proveedores con menor precisión a veces superan a los de mayor precisión en las pruebas. Otros problemas incluyen la fuga de llamadas a herramientas en el texto plano, respuestas vacías con código de estado 200, y reglas de historial de conversación que varían por proveedor, provocando errores de validación. Moustafa advierte que las pruebas deben realizarse desde el entorno de producción, ya que los límites de tasa (rate limiting) pueden diferir por dirección IP. Finalmente, la fijación de proveedores específicos puede causar caídas totales del servicio si uno de ellos deja de soportar el modelo o aplica restricciones de tráfico, dejando al usuario sin alternativas de respaldo.