始める無料で始める

Spark SQL の結合

複雑な結合は、SQL で書いたほうがずっと簡単なことがあります。この演習では、結合キーはすでに同じ形式と精度になっている前提で、結合自体は SparkSQL を使って行います。

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • DataFrame を createOrReplaceTempView で SparkSQL のテーブルとして登録し、それぞれ dfwalk_df という名前を付けます。
  • 文字列 join_sql の中で、左側のテーブルを df、右側のテーブルを walk_df に設定します。
  • 結合を実行するために、文字列 join_sql に対して spark.sql() を呼び出します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Register dataframes as tables
____.createOrReplaceTempView(____)
____.createOrReplaceTempView(____)

# SQL to join dataframes
join_sql = 	"""
			SELECT 
				*
			FROM ____
			LEFT JOIN ____
			ON df.longitude = walk_df.longitude
			AND df.latitude = walk_df.latitude
			"""
# Perform sql join
joined_df = spark.sql(____)
コードを編集して実行