開始使用免費開始

機器學習模型的構成

現在,你要強化對「資料如何影響模型效能」的理解。你將使用 Airbnb 訂房資料集(檔案為 booking.csv)。這個資料集適合用於分類任務,用來預測是否會取消訂房,其中包含多個數值與類別欄位。 你會使用 split_dataset.py 指令碼,將提供的資料集切分為 3 個互斥的樣本——train_A.csvtrain_B.csvtest.csv。接著,對每個訓練資料集執行資料處理與模型訓練的 pipeline,訓練一個 Random Forest 分類器,並使用 model_training.py 在測試集上評估其效能。params.json 中定義的超參數在兩次執行中皆保持一致。

這些 Python 指令碼可接受命令列引數並經由 shell 執行。若你有興趣,歡迎開啟並閱讀這些指令碼以加深理解。

本練習屬於課程

使用 DVC 進行資料版本控管入門

檢視課程

動手互動練習

將理論付諸實踐,立即體驗我們的互動練習

開始練習