Případová studie – onemocnění ledvin III: Kompletní pipeline
Je čas poskládat všechny transformace dohromady s klasifikátorem XGBClassifier a sestavit kompletní pipeline!
Kromě numeric_categorical_union, který jsi vytvořil/a v předchozím cvičení, jsou potřeba ještě dvě další transformace: Dictifier(), kterou jsme připravili za tebe, a DictVectorizer().
Po vytvoření pipeline ji pomocí křížové validace otestuj a zjisti, jak dobře funguje.
Toto cvičení je součástí kurzu
Extreme Gradient Boosting with XGBoost
Pokyny k cvičení
- Vytvoř pipeline pomocí transformací
numeric_categorical_union,Dictifier()aDictVectorizer(sort=False)a estimátoruxgb.XGBClassifier()s parametremmax_depth=3. Transformace pojmenuj"featureunion","dictifier","vectorizer"a estimátor"clf". - Proveď 3-foldovou křížovou validaci pipeline pomocí
cross_val_score(). Předej jí pipelinepipeline, příznakykidney_data, cílové hodnotyy. Nastav takéscoringna"roc_auc"acvna3.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create full pipeline
pipeline = ____([
("____", ____),
("____", ____),
("____", ____),
("____", ____)
])
# Perform cross-validation
cross_val_scores = ____(____, ____, ____, ____="____", ____=____)
# Print avg. AUC
print("3-fold AUC: ", np.mean(cross_val_scores))