DataFrame で SQL を実行する
PySpark では、SQL クエリを使って DataFrame を簡単に操作できます。SparkSession の .sql() メソッドを使うと、SQL クエリをプログラムから実行し、結果を別の DataFrame として取得できます。この演習では、これまでに作成した DataFrame から一時テーブルを作成し、その一時テーブルから人の名前を取得するクエリを構築して、結果を新しい DataFrame に代入します。
なお、SparkSession spark と DataFrame df はすでにワークスペースで使用可能な状態になっています。
この演習はコースの一部です
PySpark 入門
演習の手順
"people"DataFrame からdfという名前の一時テーブルを作成してください。- 一時テーブル
peopleから人の名前を取得するクエリを構築してください。 - Spark のクエリ結果を
people_df_namesという新しい DataFrame に代入してください。 people_df_namesDataFrame から上位 10 件の名前を出力してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a temporary table "people"
df.____("people")
# Select the names from the temporary table people
query = """SELECT name FROM ____"""
# Assign the result of Spark's query to people_df_names
people_df_names = spark.sql(____)
# Print the top 10 names of the people
people_df_names.____(____)