Curso de machine learning avanzado con R #04: Tratamiento de outliers
Seguimos limpiando, pero ahora el problema no son los datos que faltan, sino los que sobran de forma sospechosa. Esa fila con un valor que se sale por completo de la gráfica, ¿es un error de tecleo o es un dato real y valioso que no deberías tocar? Vamos a ver que la respuesta no siempre es obvia, y que borrar sin pensar puede ser tan peligroso como no borrar nada.
También toca hablar de feature engineering, que sonará muy técnico pero es básicamente la parte más creativa de todo el proceso: coger las variables que tienes y combinarlas para sacar información que antes no existía en el dataset. Es el momento en el que tu conocimiento del tema (sí, el tuyo, no el del algoritmo) vale más que cualquier hiperparámetro.
Y luego está la pregunta que seguro te has hecho sin resolver del todo: ¿normalizar o estandarizar? Vas a entender por fin la diferencia real entre las dos, cuándo usar cada una, y por qué hay algoritmos a los que directamente les da igual y otros a los que les puede arruinar el resultado entero.
Cerramos con el train/test split, que ya conoces de sobra en la práctica pero cuyo "por qué" probablemente nunca te has parado a justificar del todo. Aquí lo hacemos.