推論してフィルターする
ヘッダーとスキーマを持つ国勢調査データセットがあるとします。そのデータセットを読み込み、PySpark にスキーマを推論させてみましょう。40歳以上の成人でフィルタリングすると、どのような結果になるでしょうか?
ワークスペースにはすでに SparkSession として spark が用意されています。
この演習はコースの一部です
PySpark 入門
演習の手順
- JSON ファイル
adults.jsonを読み込みます。 ageが40より大きい成人のデータに絞り込みます。- 結果を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the dataframe
census_df = spark.read.json("adults.json")
# Filter rows based on age condition
salary_filtered_census = census_df.____(census_df[____]____)
# Show the result
____