国勢調査データの読み込み
最初の PySpark DataFrame を作成してみましょう。ファイル adult_reduced.csv には、さまざまな人口統計カテゴリに基づいて分類された成人のデータが含まれています。このデータは米国国勢調査を基に加工されたもので、合計 32,562 件の分類データが格納されています。
CSV ファイルを読み込み、生成されるスキーマを確認しましょう。
データ辞書:
| 変数名 | 説明 |
|---|---|
| age | 年齢 |
| education_num | 学歴(学位別) |
| marital_status | 婚姻状況 |
| occupation | 職業 |
| income | 収入カテゴリ |
この演習はコースの一部です
PySpark 入門
演習の手順
"adult_reduced.csv"メソッドを使って、spark.read.csv()ファイルから PySpark DataFrame を作成しましょう。- 作成した DataFrame を表示しましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Read in the CSV
census_adult = ____.____.____(____)
# Show the DataFrame
census_adult.____