Vizualizace důležitosti příznaků: které příznaky jsou v datasetu nejdůležitější?
Další způsob, jak prozkoumat své XGBoost modely, je podívat se na důležitost jednotlivých sloupcových příznaků původního datasetu v rámci modelu.
Jeden jednoduchý přístup spočívá v tom, že spočítáme, kolikrát byl každý příznak použit jako kritérium rozdělení napříč všemi boosting koly (stromy) v modelu, a výsledek zobrazíme jako sloupcový graf — příznaky jsou seřazeny podle toho, jak často se v modelu vyskytují. XGBoost nabízí funkci plot_importance(), která ti přesně tohle umožňuje, a v tomto cvičení si ji vyzkoušíš!
Toto cvičení je součástí kurzu
Extreme Gradient Boosting with XGBoost
Pokyny k cvičení
- Vytvoř
DMatrixzXaystejně jako dříve. - Vytvoř slovník parametrů s odpovídající hodnotou
"objective"("reg:squarederror") a"max_depth"nastaveným na4. - Natrénuj model s
10boosting koly, stejně jako v předchozím cvičení. - Pomocí
xgb.plot_importance()předej natrénovaný model a vygeneruj graf důležitosti příznaků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create the DMatrix: housing_dmatrix
housing_dmatrix = ____
# Create the parameter dictionary: params
params = ____
# Train the model: xg_reg
xg_reg = ____
# Plot the feature importances
____
plt.show()