Un equipo de investigación propone una metodología de evaluación para sintetizadores de datos con privacidad diferencial (DP) que abandona las tareas proxy tradicionales y se centra en la reproducibilidad de conclusiones publicadas. Los autores denominan «paridad epistémica» a la probabilidad de que los hallazgos de un artículo revisado por pares se mantengan al repetir los experimentos sobre datos sintéticos generados con DP en lugar de los originales. La metodología consiste en seleccionar artículos con datos públicos, expresar computacionalmente las afirmaciones de los autores, generar versiones sintéticas con varios mecanismos DP de última generación y comparar los resultados estadísticos.
Los autores aplican el método a un banco de pruebas de artículos recientes de ciencias sociales indexados en el repositorio ICPSR, expresando los resultados cuantitativos como desigualdades entre dos números que representan efectos como diferencias de medias o probabilidades. Los resultados muestran que, bajo regímenes de privacidad razonables, algunos sintetizadores logran alta paridad epistémica para varios artículos, pero ciertos hallazgos concretos —especialmente correlaciones multivariantes y efectos condicionales— no se reproducen con ninguno de los mecanismos evaluados.
El artículo sitúa el problema en el debate sobre el uso de DP en el Censo de EE. UU. de 2020 y señala que la ausencia de garantías formales de error en los sintetizadores actuales es una limitación mayor. A partir de los hallazgos empíricos, los autores recomiendan una nueva clase de mecanismos que ofrezcan garantías de utilidad más sólidas medidas en términos de paridad epistémica, junto con modelos de amenaza y riesgos específicos por aplicación.
