lock Debes estar suscrito para ver este contenido.

Curso de machine learning con R #06: Algoritmos de clasificación

Hasta ahora los modelos predicen números. En esta clase el objetivo cambia: en lugar de estimar un precio, hay que responder una pregunta de sí o no. Concretamente, ¿es este coche un superdeportivo?

Se introduce la regresión logística, que a pesar del nombre es un algoritmo de clasificación. La clave es entender cómo transforma cualquier combinación de variables en una probabilidad entre 0 y 1, y cómo esa probabilidad se convierte en una etiqueta. Se explica la función sigmoide, que es el mecanismo que hace posible esa transformación.

Una vez entrenado el primer clasificador, se aprende a evaluar su rendimiento de forma correcta. La accuracy sola no cuenta toda la historia, especialmente cuando las clases están desbalanceadas. Por eso se trabaja con la matriz de confusión y con métricas como precisión, recall y F1, que dan una imagen más completa. La curva ROC y el AUC añaden otra capa de análisis que permite comparar clasificadores de forma justa.

La segunda mitad de la clase presenta el algoritmo KNN, que funciona de forma completamente distinta: en lugar de aprender un modelo, clasifica cada punto nuevo según los puntos más cercanos en el espacio de variables. Es intuitivo, fácil de implementar y útil para entender el concepto de distancia en ML. También sirve para ilustrar de forma muy clara qué ocurre cuando un modelo es demasiado simple o demasiado complejo.