Mozilla.ai presentó en la conferencia ACM FAccT 2026, celebrada en Montreal en junio, un tutorial titulado "Contextual Evaluation of LLM Guardrails Across Languages and Agentic Systems", en el que defendió que los guardrails (mecanismos que filtran, marcan o restringen las entradas y salidas de los modelos de lenguaje) merecen el mismo nivel de escrutinio que los propios modelos. La organización argumenta que las evaluaciones estáticas y genéricas resultan insuficientes y que es necesario evaluar los guardrails en contextos y idiomas específicos para guiar su diseño.
El recorrido expuesto en la sesión se apoyó en una evaluación previa de 120 pares de escenarios centrados en personas refugiadas y solicitantes de asilo, en inglés, farsi, árabe, kurdo-sorani y pastún, valorada por hablantes nativos de Respond Crisis Translation conforme a seis criterios basados en derechos. Los resultados, publicados como datos abiertos MHRE en Mozilla Data Collective, sirvieron para convertir fallos recurrentes (derivaciones inseguras, avisos omitidos, estereotipos) en políticas de guardrail en inglés y farsi. Al probar esas políticas, el equipo detectó un vacío estructural: criterios como factualidad y accionabilidad no pueden juzgarse solo a partir del texto, por lo que planteó la hipótesis de que los guardrails necesitan herramientas como búsqueda web, recuperación de información y verificación para operar de forma fiable. Así nació el guardrail agentic presentado en Montreal, comparado con versiones sin herramientas.
En la sesión práctica, 35 participantes ejecutaron la demostración y compararon jueces agentic y no agentic sobre las mismas respuestas. En el 90% de los casos el veredicto coincidió, pero el uso de herramientas varió según el modelo subyacente: Claude Sonnet 4.6 recurrió a la búsqueda web en cada ejecución (4,1 llamadas de media), mientras que GPT-5 Nano apenas lo hizo (0,2). Cuando se usaron, influyeron en ambos sentidos: verificar datos aumentó la puntuación, mientras que descubrir un error factual no detectado rebajó el veredicto de aprobado a borderline. Mozilla.ai enmarca estas pruebas mediante sus herramientas abiertas any-guardrail y Otari, y anuncia próximos estudios en casos humanitarios, financieros y de ingeniería social, en los pares inglés-farsi e inglés-español.
