訓練/測試切分
若要客觀評估機器學習模型,你需要在彼此獨立的資料上進行測試。不能用訓練模型所用的同一份資料:模型在那些資料上表現當然會(相對)較好!
你將把資料切分為兩個部分:
- 訓練資料(用來訓練模型),以及
- 測試資料(用來測試模型)。
注意: 從現在起你會使用航班資料的一個較小子集,這能讓練習執行得更快。
本練習屬於課程
使用 PySpark 的機器學習
練習說明
- 將
flights資料以 80:20 的比例隨機切分為兩個集合。為了可重現性,切分時將隨機種子設為 43。 - 檢查訓練資料是否大約包含原始資料 80% 的紀錄數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)
# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)