Curso de machine learning avanzado con R #10: Validación del modelo
Cerramos el curso con la pregunta más incómoda de todas: ¿cómo sabes de verdad que tu modelo es bueno, y no que simplemente has tenido suerte con el test set que elegiste? Porque sí, eso puede pasar, y esta clase va de asegurarte de que no te pase a ti.
Vamos a hablar de validación cruzada, una técnica que seguramente has usado desde el primer curso sin cuestionarte demasiado por qué se hace así y no de otra forma. Vas a entender por fin qué gana exactamente un modelo que se evalúa con K particiones distintas frente a uno que se conforma con una sola división de train y test.
También vamos a hablar de un error que es sorprendentemente fácil de cometer y que hace que un modelo parezca brillante en desarrollo y sea un desastre en producción: la fuga de datos. Es de esos fallos silenciosos que no te avisan de que están ahí hasta que ya es demasiado tarde, y aprender a detectarlos es una de esas habilidades que separa a quien sabe usar un algoritmo de quien sabe de verdad si puede confiar en él.
Terminamos con algo muy práctico: cómo guardar un modelo ya entrenado para no tener que repetir todo el proceso cada vez que lo necesites. Pequeño detalle, pero de esos que te ahorran horas el día que menos te lo esperas.