始める無料で始める

DataFrame で SQL を実行する

PySpark では、SQL クエリを使って DataFrame を簡単に操作できます。SparkSession の .sql() メソッドを使うと、SQL クエリをプログラムから実行し、結果を別の DataFrame として取得できます。この演習では、これまでに作成した DataFrame から一時テーブルを作成し、その一時テーブルから人の名前を取得するクエリを構築して、結果を新しい DataFrame に代入します。

なお、SparkSession spark と DataFrame df はすでにワークスペースで使用可能な状態になっています。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • "people" DataFrame から df という名前の一時テーブルを作成してください。
  • 一時テーブル people から人の名前を取得するクエリを構築してください。
  • Spark のクエリ結果を people_df_names という新しい DataFrame に代入してください。
  • people_df_names DataFrame から上位 10 件の名前を出力してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a temporary table "people"
df.____("people")

# Select the names from the temporary table people
query = """SELECT name FROM ____"""

# Assign the result of Spark's query to people_df_names
people_df_names = spark.sql(____)

# Print the top 10 names of the people
people_df_names.____(____)
コードを編集して実行