lock Debes estar suscrito para ver este contenido.

Curso de machine learning avanzado con R #03: Limpieza general

En el curso anterior imputaste los NA casi sin pensarlo demasiado: se encontraba un valor vacío, se rellenaba con algún método y se seguía adelante. Aquí vamos a parar el carro y hacer la pregunta que casi nadie se hace: ¿por qué falta ese dato exactamente? Porque no es lo mismo un hueco por pura mala suerte que un hueco que esconde algo.

Vamos a desmontar los tres tipos de "falta de datos" que existen en estadística, con nombres que suenan más complicados de lo que son (sobre todo porque te los encontrarás que los llaman por sus siglas). Uno de ellos es prácticamente inofensivo. Otro es el más común en la vida real. Y el tercero es el que puede arruinarte un modelo sin que te des ni cuenta, porque el propio motivo de que falte el dato está relacionado con el valor que falta.

También vamos a abrir el capó de mice, el paquete que usaste para imputar sin preguntarte mucho cómo funcionaba por dentro. Spoiler: no rellena huecos con cualquier número que se le ocurre. Hay una lógica detrás bastante ingeniosa, y varios métodos distintos según el tipo de variable con la que estés trabajando.

Si la clase anterior iba de mirar los datos, esta va de empezar a arreglarlos con cabeza. Y créeme, una vez entiendes esto no vuelves a rellenar un NA con la media así, sin más, en tu vida.