開始使用免費開始

載入航班資料

在這個練習中,你要從一個 CSV 檔案載入航空航班資料。為了讓練習執行更快,這些資料已經裁切為僅 50,000 筆記錄。你可以在相同格式下於這裡下載更大的資料集。

CSV 格式說明:

  • 欄位以逗號分隔(這是預設分隔符)。
  • 遺漏值以字串『NA』表示。

資料字典:

  • mon — 月份(介於 1 到 12 的整數)
  • dom — 月中的日期(介於 1 到 31 的整數)
  • dow — 星期幾(整數;1 = Monday,7 = Sunday)
  • carrier — 航空公司(IATA code
  • flight — 航班號碼
  • org — 起飛機場(IATA code
  • mile — 距離(英里)
  • depart — 起飛時間(十進位小時)
  • duration — 預期飛行時間(分鐘)
  • delay — 延誤時間(分鐘)

已為你匯入 pyspark,並完成工作階段初始化。

※ 注意:這份資料已做大幅降採樣。

本練習屬於課程

使用 PySpark 的機器學習

檢視課程

練習說明

  • 從名為 flights.csv 的 CSV 檔讀取資料,自動推斷欄位型別,並處理遺漏值。
  • 資料中共有多少筆記錄?
  • 檢視前 5 筆記錄。
  • 各欄位被指派了哪些型別?看起來正確嗎?

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Read data from CSV file
flights = spark.____.____(____,
                         sep=____,
                         header=____,
                         inferSchema=____,
                         nullValue=____)

# Get number of records
print("The data contain %d records." % flights.____())

# View the first five records
flights.____(5)

# Check column data types
print(flights.____)
編輯並執行程式碼