載入航班資料
在這個練習中,你要從一個 CSV 檔案載入航空航班資料。為了讓練習執行更快,這些資料已經裁切為僅 50,000 筆記錄。你可以在相同格式下於這裡下載更大的資料集。
CSV 格式說明:
- 欄位以逗號分隔(這是預設分隔符)。
- 遺漏值以字串『NA』表示。
資料字典:
mon— 月份(介於 1 到 12 的整數)dom— 月中的日期(介於 1 到 31 的整數)dow— 星期幾(整數;1 = Monday,7 = Sunday)carrier— 航空公司(IATA code)flight— 航班號碼org— 起飛機場(IATA code)mile— 距離(英里)depart— 起飛時間(十進位小時)duration— 預期飛行時間(分鐘)delay— 延誤時間(分鐘)
已為你匯入 pyspark,並完成工作階段初始化。
※ 注意:這份資料已做大幅降採樣。
本練習屬於課程
使用 PySpark 的機器學習
練習說明
- 從名為
flights.csv的 CSV 檔讀取資料,自動推斷欄位型別,並處理遺漏值。 - 資料中共有多少筆記錄?
- 檢視前 5 筆記錄。
- 各欄位被指派了哪些型別?看起來正確嗎?
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Read data from CSV file
flights = spark.____.____(____,
sep=____,
header=____,
inferSchema=____,
nullValue=____)
# Get number of records
print("The data contain %d records." % flights.____())
# View the first five records
flights.____(5)
# Check column data types
print(flights.____)