開始使用免費開始

訓練/測試切分

若要客觀評估機器學習模型,你需要在彼此獨立的資料上進行測試。不能用訓練模型所用的同一份資料:模型在那些資料上表現當然會(相對)較好!

你將把資料切分為兩個部分:

  • 訓練資料(用來訓練模型),以及
  • 測試資料(用來測試模型)。

注意: 從現在起你會使用航班資料的一個較小子集,這能讓練習執行得更快。

本練習屬於課程

使用 PySpark 的機器學習

檢視課程

練習說明

  • flights 資料以 80:20 的比例隨機切分為兩個集合。為了可重現性,切分時將隨機種子設為 43。
  • 檢查訓練資料是否大約包含原始資料 80% 的紀錄數。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)

# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)
編輯並執行程式碼