La simulación de datos falsos (fake-data simulation) permite a los investigadores identificar errores metodológicos en estudios estadísticos sin necesidad de conocimientos especializados en el tema de estudio. Este método, descrito por Andrew Gelman en su blog, utiliza modelos generativos para replicar el proceso de recolección de datos y evaluar la plausibilidad de los resultados observados. En un ejemplo clásico, un estudio publicado en la revista American Journal of Sociology concluyó erróneamente que los padres de gran belleza tenían un 36% más probabilidades de tener hijos varones, un hallazgo que contradecía la literatura existente sobre la proporción de sexos. Al simular 2.792 nacimientos bajo un modelo nulo donde la probabilidad de un hijo varón es constante (0.488), se demostró que la variabilidad aleatoria podía generar patrones similares a los observados, invalidando la conclusión original. El artículo explica que esta técnica, también conocida como experimentación con datos simulados o bootstrap, es una forma de frecuentismo que trata los datos como una sola muestra de una distribución de posibles realizaciones. Aunque requiere esfuerzo adicional para construir modelos generativos y automatizar el análisis, esta práctica actúa como una verificación de seguridad similar a la preregistración, permitiendo a los investigadores evitar conclusiones erróneas antes de que se publiquen. La clave radica en entender que la significancia estadística no garantiza la verdad, sino que la incertidumbre inherente al proceso de muestreo, algo que la simulación ayuda a visualizar y corregir.
