Mistral AI lanza Shieldstral, un clasificador de seguridad multimodal de 3B con políticas adaptables

Fuentes: Mistral AI unveils Shieldstral, a 3B open-weights multimodal safety classifier

Mistral AI ha presentado Shieldstral, un clasificador de seguridad multimodal de 3.000 millones de parámetros con pesos abiertos bajo licencia Apache 2.0, capaz de igualar o superar a modelos de moderación hasta siete veces más grandes en pruebas de seguridad textual y fijar un nuevo estado del arte en moderación multimodal. A diferencia de los modelos de guardarraíl convencionales, que codifican una taxonomía fija en sus pesos, Shieldstral permite definir la política como una pregunta en lenguaje natural en el momento de la inferencia y devuelve una puntuación de seguridad calibrada a partir de un único token. Cada solicitud se estructura en tres partes: instrucción con el contexto y la definición de contenido inseguro, pregunta de sí o no y documento a evaluar (texto, imagen o ambos). El modelo fue entrenado sobre datos heterogéneos unificados en un único formato instrucción–consulta–documento, pares contrastivos para distinguir políticas similares y datos visuales augmentados mediante un reranker visión–lenguaje. Los tres puntos de control se combinan con LoRA y SLERP. Mistral ha desarrollado el sistema íntegramente sobre Forge, su plataforma interna de entrenamiento. El lanzamiento coincide con la entrada de la compañía como miembro fundador de la Open Secure AI Alliance, junto a NVIDIA y otras organizaciones. La compañía señala que seguirá trabajando en cobertura multilingüe, robustez en documentos largos y seguridad multimodal más amplia.