Validación cruzada desde cero: una sorpresa al reducir la muestra a n=100

Fuentes: Cross-Validation From Scratch and a Surprise at n=100

Un análisis técnico en R implementa la validación cruzada K-Fold desde cero para poner a prueba un principio clásico de los manuales de aprendizaje automático: que el método Leave-One-Out Cross-Validation (LOOCV) presenta menor sesgo y mayor varianza que las versiones de 10 y 5 folds. El trabajo simula datos con un proceso generador conocido y compara el ajuste de nueve fórmulas candidatas. Con 1000 observaciones, el modelo correcto —que incluye un término cuadrático en x, un término lineal en w y su interacción— recupera el proceso generador con un RMSE de aproximadamente 1,04, claramente por debajo de las alternativas. La sorpresa llega al reducir el tamaño muestral a 100 observaciones y repetir el experimento 500 veces con ayuda del modelo Claude Sonnet 5: en ese escenario, el LOOCV no solo muestra la mayor varianza esperada, sino que también incurre en un sesgo comparable o incluso superior al de 5-Fold, poniendo en cuestión la afirmación de los libros de texto. El artículo describe paso a paso el código en R para construir la validación cruzada manualmente, calcular el RMSE por fórmula y estimar el error verdadero sobre un conjunto de prueba de 10 000 observaciones. Se trata de un recurso didáctico para entender cómo funciona realmente el remuestreo y por qué los resultados teóricos pueden depender del tamaño de la muestra.