Inco AI presenta DFlash 2, una evolución de su técnica de decodificación especulativa que aumenta en más de un 20% la producción de tokens por cada pasada de verificación del modelo objetivo, con apenas un 1% de latencia adicional y sin alterar la distribución de salida. En las pruebas internas, la ganancia media oscila entre el 16% y el 25%, y con el drafter Qwen3.8-27B liberado junto al anuncio, el motor SGLang sirve entre 2,7 y 3,4 veces el rendimiento de la decodificación autorregresiva a tamaño de lote 1.
DFlash predice cada posición del bloque de tokens en paralelo. El problema es que los candidatos así generados pueden no encajar entre sí. Frente a métodos como Domino o DSpark, que corrigen la coherencia con cabezas secuenciales pesadas, DFlash 2 introduce un selector de trayectoria ligero: mantiene los 16 mejores candidatos por posición y puntúa cada par adyacente mediante una atención bilinear de bajo rango sobre embeddings de 256 dimensiones. Esta capa añade solo 2 millones de parámetros y un 0,6% de latencia, frente a los 77,8 millones y el 9,6% de DSpark, y mejora la longitud de aceptación de 4,27 a 4,61 tokens en T=0 y de 3,78 a 4,25 en T=1.
El artículo describe también el llamado "suffix decay", la caída de precisión hacia el final del bloque que ningún selector puede corregir porque reside en la propia arquitectura del drafter. DFlash 2 ya está disponible en oMLX para Apple Silicon y en los principales motores de inferencia del mercado.
