DeepSeek-V4.1-Flash sin censura: guía técnica y métricas de abliteración

Fuentes: DeepSeek-V4.1-Flash Uncensored: Technical Guide and Abliteration Metrics

El repositorio dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 documenta un modelo de lenguaje de 552 parámetros que ha sido modificado mediante una técnica de abliteración a nivel de pesos para eliminar sus guardrails de seguridad. Este proceso, desarrollado por el equipo de investigación de dealignai, preserva las capacidades cognitivas del modelo original, incluyendo visión, razonamiento y coherencia en múltiples turnos, mientras que la circuitería de rechazo es eliminada quirúrgicamente. El modelo opera con cuantización nativa FP8 y soporta un contexto de 1 millón de tokens, manteniendo intactos componentes críticos como la memoria Engram, la atención dispersa CSA2 y la torre de visión DeepSeek-ViT.

Las pruebas de evaluación muestran un cambio radical en el comportamiento del modelo. En la batería HarmBench-320, la tasa de cumplimiento (ASR) pasa del 42,81 % en el modelo base al 100 % en la versión modificada, sin importar el nivel de esfuerzo de razonamiento. En la prueba MMLU-14k, la precisión general disminuye de 86,96 % a 82,74 %, una caída de 4,22 puntos porcentuales. Sin embargo, al excluir los clústeres éticos donde el comportamiento de rechazo es más relevante, la pérdida de conocimiento es de solo 1,1 punto porcentual, dentro del objetivo de preservación de 3 puntos. El documento detalla las instrucciones para ejecutar el modelo localmente utilizando vLLM, SGLang o Docker, así como su integración con la librería Transformers, permitiendo a los usuarios desplegar esta versión sin restricciones en sus propios entornos de inferencia.