Query(クエリ)してみましょう?
DataFrame インターフェイスの利点の 1 つは、Spark クラスター内のテーブルに対して SQL クエリを実行できることです。SQL の経験がなくても心配いりません。こちらでクエリを用意しています!(SQL をもっと学びたい場合は、Introduction to SQL コースから始めてみてください。)
前の演習で見たように、クラスターには flights テーブルがあります。このテーブルには、2014 年と 2015 年に Portland International Airport(PDX)または Seattle-Tacoma International Airport(SEA)を出発した各フライトの行が含まれています。
このテーブルに対してクエリを実行するのは簡単で、SparkSession の .sql() メソッドを使います。このメソッドはクエリ文字列を受け取り、結果を含む DataFrame を返します!
よく見ると、クエリ内で flights テーブルに言及しているだけで、どのメソッドの引数にも渡していないことに気づくはずです。これは、ローカル環境にそのデータを保持するオブジェクトが存在しないため、テーブルを引数として渡しても意味がないからです。
ワークスペースにはすでに spark という SparkSession を作成済みです(こちらで用意したので、もう my_spark とは呼びません!)。
この演習はコースの一部です
PySpark入門
演習の手順
.sql()メソッドを使ってflightsテーブルの先頭 10 行を取得し、結果をflights10に保存してください。変数queryには適切な SQL クエリが入っています。- DataFrame メソッド
.show()を使ってflights10を表示してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Don't change this query
query = "FROM flights SELECT * LIMIT 10"
# Get the first 10 rows of flights
flights10 = ____
# Show the results
flights10.____