Liquid AI ha presentado Antidoom, un método de entrenamiento diseñado para eliminar los "doom loops", un fallo frecuente en modelos de razonamiento que consiste en repetir indefinidamente fragmentos como "Espera, déjame reconsiderar…" hasta agotar la ventana de contexto. El problema es más común en modelos pequeños y en trazas de razonamiento largas o sobre problemas difíciles.
La técnica identifica el token exacto que inicia el bucle y entrena al modelo para preferir alternativas coherentes en esa única posición, sin alterar el resto de la distribución. Para ello adapta Antislop y emplea Final Token Preference Optimization (FTPO), un algoritmo de optimización por preferencias similar a DPO pero pensado para modificar solo unos pocos tokens, con regularización KL en espacio de logits y restricción diferenciada entre tokens entrenados y vocabulario restante.
En un checkpoint temprano del modelo LFM2.5-2.6B, el 10,2 % de las completaciones sobre problemas difíciles de matemáticas y código generaban bucles. Tras aplicar Antidoom, la tasa cayó al 1,4 %, y las puntuaciones de evaluación mejoraron de forma generalizada. En pruebas con Qwen3.5-4B, que también sufría repeticiones, la tasa de bucles bajó del 22,9 % al 1 % con muestreo greedy. La generación del conjunto de entrenamiento se completa en una hora con 8 GPUs MI325, y el entrenamiento posterior en una o dos horas con una sola MI325.
