始める無料で始める

国勢調査データの読み込み

最初の PySpark DataFrame を作成してみましょう。ファイル adult_reduced.csv には、さまざまな人口統計カテゴリに基づいて分類された成人のデータが含まれています。このデータは米国国勢調査を基に加工されたもので、合計 32,562 件の分類データが格納されています。

CSV ファイルを読み込み、生成されるスキーマを確認しましょう。

データ辞書:

変数名 説明
age 年齢
education_num 学歴(学位別)
marital_status 婚姻状況
occupation 職業
income 収入カテゴリ

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • "adult_reduced.csv" メソッドを使って、spark.read.csv() ファイルから PySpark DataFrame を作成しましょう。
  • 作成した DataFrame を表示しましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Read in the CSV
census_adult = ____.____.____(____)

# Show the DataFrame
census_adult.____
コードを編集して実行