Repetir una instrucción en el prompt del sistema ayuda, pero solo hasta cuatro veces

Fuentes: Say It Four Times

Un programador sometió a prueba un consejo habitual en el diseño de prompts para agentes de IA: repetir las instrucciones importantes. El experimento, realizado con Gemini 2.5 Flash sobre Vertex, consistió en pedir seis funciones rutinarias de Python bajo una regla de sintaxis (usar comillas simples, nunca dobles), variando cuántas veces aparecía esa regla en el prompt del sistema: cero, una, dos, cuatro, ocho y dieciséis repeticiones, con treinta intentos por combinación, 1.080 ejecuciones en total.

Sin mencionar la regla, el modelo usó comillas dobles en los 171 casos. Con una repetición, cumplió la regla en el 74% de las respuestas; con cuatro, en el 97%. A partir de ahí, la curva se aplana: ocho y dieciséis repeticiones no aportan mejora adicional. Además, entre la mitad y dos tercios de las combinaciones de tarea y repetición dieron resultados inconsistentes entre ejecuciones idénticas, lo que pone en duda las evaluaciones basadas en una sola prueba.

El hallazgo encaja con el estudio de Han-yu Wang When More Becomes Less, que distingue entre repeticiones adyacentes —que mejoran y luego se estabilizan— y repeticiones dispersas —que pueden incluso perjudicar—. Las pruebas se hicieron con copias adyacentes y reglas de sintaxis literales, por lo que sus conclusiones no se extienden automáticamente a instrucciones de comportamiento, reformulaciones ni a prompts separados. El autor concluye que, para reglas resistentes del modelo, repetir hasta cuatro veces es rentable; más allá, no.