機器學習模型的構成
現在,你要強化對「資料如何影響模型效能」的理解。你將使用 Airbnb 訂房資料集(檔案為 booking.csv)。這個資料集適合用於分類任務,用來預測是否會取消訂房,其中包含多個數值與類別欄位。
你會使用 split_dataset.py 指令碼,將提供的資料集切分為 3 個互斥的樣本——train_A.csv、train_B.csv 和 test.csv。接著,對每個訓練資料集執行資料處理與模型訓練的 pipeline,訓練一個 Random Forest 分類器,並使用 model_training.py 在測試集上評估其效能。params.json 中定義的超參數在兩次執行中皆保持一致。
這些 Python 指令碼可接受命令列引數並經由 shell 執行。若你有興趣,歡迎開啟並閱讀這些指令碼以加深理解。
本練習屬於課程
