始める無料で始める

推論してフィルターする

ヘッダーとスキーマを持つ国勢調査データセットがあるとします。そのデータセットを読み込み、PySpark にスキーマを推論させてみましょう。40歳以上の成人でフィルタリングすると、どのような結果になるでしょうか?

ワークスペースにはすでに SparkSession として spark が用意されています。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • JSON ファイル adults.json を読み込みます。
  • age40 より大きい成人のデータに絞り込みます。
  • 結果を表示します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the dataframe
census_df = spark.read.json("adults.json")

# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)

# Show the result
____
コードを編集して実行