開始使用免費開始

腎臟疾病個案研討 III:完整 pipeline

現在要把所有轉換器與一個 XGBClassifier 串在一起,建立完整的 pipeline!

除了你在上一個練習建立的 numeric_categorical_union,還需要另外兩個轉換器:我們替你準備好的 Dictifier(),以及 DictVectorizer()

建立好 pipeline 後,你的任務是對它做交叉驗證,看看效能如何。

本練習屬於課程

使用 XGBoost 的極端梯度提升

檢視課程

練習說明

  • 使用 numeric_categorical_unionDictifier()DictVectorizer(sort=False) 三個轉換器,以及 xgb.XGBClassifier()max_depth=3)作為估計器來建立 pipeline。請將這些步驟命名為 "featureunion""dictifier""vectorizer",估計器命名為 "clf"
  • cross_val_score()pipeline 進行 3 折交叉驗證。傳入的參數包括 pipeline(pipeline)、特徵(kidney_data)、標的(y),並將 scoring 設為 "roc_auc"cv 設為 3

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create full pipeline
pipeline = ____([
                     ("____", ____),
                     ("____", ____),
                     ("____", ____),
                     ("____", ____)
                    ])

# Perform cross-validation
cross_val_scores = ____(____, ____, ____, ____="____", ____=____)

# Print avg. AUC
print("3-fold AUC: ", np.mean(cross_val_scores))
編輯並執行程式碼