El equipo de investigación Off-by-1 Labs, creado recientemente por 1Password, concluye que los modelos de lenguaje de gran tamaño (LLM) generan parches de seguridad defectuosos en más de la mitad de los casos cuando la vulnerabilidad exige un parche complejo. En un estudio sobre seis vulnerabilidades recientes en software de código abierto —incluidas CVE en Linux, ActiveMQ, Chrome, EXIM, SpringAI y Gemini CLI—, los investigadores generaron 6.080 parches con dos modelos de razonamiento con capacidades cibernéticas. La tasa media de éxito completo (parche que resuelve la vulnerabilidad sin alterar el comportamiento de la aplicación) fue del 26,0%; un 20,1% resolvió la vulnerabilidad pero modificó el comportamiento de la aplicación, y un 53,9% no resolvió el problema, introdujo uno nuevo o ambas cosas, categoría que los autores denominan FLAWED (Fix-Like Artifacts with Embedded Defects). El coste medio por intento de parche y ciclo de validación osciló entre 2,11 y 2,81 dólares según el modelo. Los investigadores advierten además que más del 33% de los parches técnicamente exitosos presentaban fragilidad: bloqueaban entradas maliciosas concretas mediante comprobaciones estrechas sin atajar la causa raíz, por lo que la vulnerabilidad podría reaparecer con vectores alternativos. 1Password publica junto al artículo el paper completo, el código de generación y validación y los conjuntos de datos para que otros equipos reproduzcan el experimento. La compañía subraya que, dada la tasa de éxito de uno de cada cuatro, los parches generados por IA siguen necesitando revisión de un ingeniero con experiencia en el dominio antes de desplegarse.
