lock Debes estar suscrito para ver este contenido.

Curso de machine learning con R #09: Clustering y aprendizaje no supervisado

Todas las clases anteriores trabajan con una variable objetivo conocida: el precio, o si un coche es superdeportivo. En esta clase la situación cambia. Se trabaja con datos de telemetría de vueltas en circuito y el objetivo es encontrar grupos naturales en esos datos sin saber de antemano cuántos hay ni cuáles son.

Eso es el aprendizaje no supervisado, y el clustering es su herramienta más habitual. El algoritmo K-Means divide los datos en grupos intentando que los puntos dentro de cada grupo se parezcan entre sí y se diferencien del resto. Aplicado a la telemetría, la pregunta que responde es: ¿existen estilos de pilotaje distinguibles en los datos, sin que nadie los haya etiquetado previamente?

Una parte importante de la clase está dedicada a elegir el número de grupos adecuado, que no siempre es obvio. Se presentan dos métodos complementarios para hacerlo y se discute cómo interpretar sus resultados. Una vez fijado ese número, se caracteriza cada grupo: qué velocidades alcanza, cuántas frenadas fuertes realiza, cuánto desgasta el neumático.

La clase incluye también el clustering jerárquico, que aborda el mismo problema desde un ángulo diferente y produce una representación visual —el dendrograma— que permite explorar la estructura de los datos a distintos niveles de detalle.

Se cierra con una introducción al Análisis de Componentes Principales (PCA), una técnica que reduce la dimensionalidad de los datos y facilita tanto la visualización como el rendimiento de otros algoritmos.