Curso de machine learning avanzado con R #02: Exploración de los datos
En el curso anterior hacías str() y summary() casi por reflejo, como quien se persigna antes de entrar en un examen. Aquí vamos a entender qué te está diciendo realmente cada número de esos, y por qué ignorarlos es la forma más rápida de construir un modelo que parece funcionar y luego explota en producción.
Vamos a meternos con las distribuciones: por qué una variable con dos picos no es un capricho estadístico sino una pista, por qué la media puede mentirte más que la mediana, y qué significa de verdad eso de que algo tenga "colas pesadas".
También le vamos a dar una vuelta a la correlación, ese número que todo el mundo calcula y poca gente interpreta bien. Vas a ver por qué dos variables pueden tener una relación clarísima y aun así el coeficiente de correlación te diga que no hay nada, y por qué eso puede arruinarte un análisis si no lo sabes detectar a tiempo.
Al final de esta clase vas a mirar un dataset de otra manera: no como una tabla que hay que limpiar cuanto antes, sino como una fuente de pistas que, si sabes leer, te va a ahorrar muchísimos dolores de cabeza más adelante.