腎臟疾病個案研討 III:完整 pipeline
現在要把所有轉換器與一個 XGBClassifier 串在一起,建立完整的 pipeline!
除了你在上一個練習建立的 numeric_categorical_union,還需要另外兩個轉換器:我們替你準備好的 Dictifier(),以及 DictVectorizer()。
建立好 pipeline 後,你的任務是對它做交叉驗證,看看效能如何。
本練習屬於課程
使用 XGBoost 的極端梯度提升
練習說明
- 使用
numeric_categorical_union、Dictifier()、DictVectorizer(sort=False)三個轉換器,以及xgb.XGBClassifier()(max_depth=3)作為估計器來建立 pipeline。請將這些步驟命名為"featureunion"、"dictifier"、"vectorizer",估計器命名為"clf"。 - 以
cross_val_score()對pipeline進行 3 折交叉驗證。傳入的參數包括 pipeline(pipeline)、特徵(kidney_data)、標的(y),並將scoring設為"roc_auc"、cv設為3。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create full pipeline
pipeline = ____([
("____", ____),
("____", ____),
("____", ____),
("____", ____)
])
# Perform cross-validation
cross_val_scores = ____(____, ____, ____, ____="____", ____=____)
# Print avg. AUC
print("3-fold AUC: ", np.mean(cross_val_scores))