Spark SQL の結合
複雑な結合は、SQL で書いたほうがずっと簡単なことがあります。この演習では、結合キーはすでに同じ形式と精度になっている前提で、結合自体は SparkSQL を使って行います。
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
- DataFrame を
createOrReplaceTempViewで SparkSQL のテーブルとして登録し、それぞれdfとwalk_dfという名前を付けます。 - 文字列
join_sqlの中で、左側のテーブルをdf、右側のテーブルをwalk_dfに設定します。 - 結合を実行するために、文字列
join_sqlに対してspark.sql()を呼び出します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Register dataframes as tables
____.createOrReplaceTempView(____)
____.createOrReplaceTempView(____)
# SQL to join dataframes
join_sql = """
SELECT
*
FROM ____
LEFT JOIN ____
ON df.longitude = walk_df.longitude
AND df.latitude = walk_df.latitude
"""
# Perform sql join
joined_df = spark.sql(____)