載入人口普查資料
來建立你的第一個 PySpark DataFrame 吧!檔案 adult_reduced.csv 依多種人口統計面向對成年人口分組。這些資料改編自美國人口普查(US Census)。總共有 32,562 個成人群組。
我們要載入這個 CSV,並查看產生的綱要(schema)。
資料字典:
| 變數 | 說明 |
|---|---|
| age | 個人年齡 |
| education_num | 最高學位對應的教育年數 |
| marital_status | 婚姻狀況 |
| occupation | 職業 |
| income | 收入類別 |
本練習屬於課程
PySpark 入門
練習說明
- 使用
spark.read.csv()方法,從"adult_reduced.csv"檔案建立一個 PySpark DataFrame。 - 顯示產生的 DataFrame。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Read in the CSV
census_adult = ____.____.____(____)
# Show the DataFrame
census_adult.____