Curso de machine learning avanzado con R #08: XGBoostt
Si Random Forest te pareció impresionante, prepárate, porque XGBoost es el algoritmo que ganó (y sigue ganando) más competiciones de datos tabulares que casi cualquier otro desde hace más de una década. Y no es magia: es una idea distinta a todo lo que hemos visto hasta ahora, y esta clase va de entenderla desde la raíz.
La clave está en una palabra que suena parecida a "bagging" pero que funciona de forma completamente opuesta: boosting. En vez de construir muchos modelos independientes y promediar, aquí cada modelo nuevo se dedica exclusivamente a corregir los errores del anterior. Es una cadena de correcciones sucesivas, y una vez entiendes esa lógica, entiendes por qué XGBoost es tan bueno.
Vamos a destripar algunos de los hiperparámetros que seguro has tocado sin saber muy bien qué hacían (eta, max_depth, subsample...) y vas a entender por fin qué está controlando cada uno realmente, en vez de limitarte a copiar valores de algún tutorial de internet.
Y para rematar, vas a ver cómo XGBoost sabe solo cuándo parar de entrenar, sin que tengas que decírselo tú. Eso, en la práctica, te ahorra muchísimo tiempo y muchos modelos sobreajustados que ni siquiera sabías que lo estaban.