Telos es una herramienta de código abierto que plantea un bucle adversarial entre dos agentes de programación para reducir el llamado 'slop': código generado por IA que parece correcto pero resulta difícil de mantener. La propuesta parte de una definición operativa: el slop es aquel contenido cuya revisión exige más esfuerzo humano del que costó producirlo, y se acumula porque los agentes actuales escriben código más deprisa de lo que cualquier persona puede revisarlo.
El núcleo de Telos es un orquestador que recibe una especificación de objetivo y enfrenta a dos agentes con roles opuestos: uno genera código y el otro lo audita y prueba, alineados ambos con la misma especificación. El ciclo termina cuando el verificador concede el visto bueno o se agota el presupuesto de revisión. Los autores se apoyan en precedentes como AlphaGo Zero y en trabajos de OpenAI sobre juegos prover-verifier para argumentar que la generación es un problema de búsqueda mucho más difícil que la verificación, y que separar los roles evita los estancamientos típicos de la autoevaluación.
Para medir los resultados, Telos se ha evaluado contra SlopCodeBench, un benchmark que extiende código por etapas. En cinco problemas resueltos con gpt-5.5-high, el bucle redujo la complejidad del código una media del 12% —hasta un 32% en 'cfgpipe'— y superó a la línea base one-shot en hasta 15 puntos de tasa de acierto estricto. El verificador rechazó puntos de control con más del 95% de tests ocultos superados, detectando fallos funcionales que los tests no cubrían, y mantuvo tasas de regresión cercanas al 100% en iteraciones largas, frente al 16% del enfoque one-shot en uno de los problemas.
