lock Debes estar suscrito para ver este contenido.

Curso de machine learning avanzado con R #07: Árbol de decisión y random forest

Un árbol de decisión es probablemente el algoritmo más fácil de explicar de todo el machine learning: es literalmente una serie de preguntas de sí o no, como el típico juego de adivinar un personaje. Lo interesante no es eso, sino cómo decide el algoritmo qué pregunta hacer primero, y por qué esa elección lo cambia absolutamente todo.

Vamos a hablar de la impureza de los nodos, un concepto que suena rarísimo la primera vez que lo oyes y que después no puedes dejar de ver en todas partes. Y vamos a entender por qué un árbol al que dejas crecer sin control acaba memorizando los datos en vez de aprender de ellos, y qué se puede hacer para evitarlo sin cargarse su utilidad.

De ahí damos el salto a Random Forest, que no es un algoritmo nuevo sino una idea genial aplicada al anterior: en vez de confiar en un solo árbol, construyes cientos y les pides que voten. Vas a entender por qué eso funciona mejor de lo que cualquier intuición te diría a primera vista, y qué papel juega el azar (sí, el azar, a propósito) en todo el proceso.

Terminamos viendo cómo Random Forest te puede decir, sin que se lo pidas explícitamente, qué variables son las que de verdad están pesando en sus decisiones. Y ese dato, bien leído, vale más que muchos modelos enteros.