PySpark の対話的な利用
Spark には、PySpark があらかじめインストールされた対話型の Python シェルが付属しています。PySpark シェルは基本的なテストやデバッグに便利で、非常に強力です。PySpark シェルの力を手早く体験するには、演習が一番です。この演習では、1 から 100 までの数値を含むシンプルなリストを PySpark シェルに読み込みます。
ここで最も重要なのは、SparkContext オブジェクトを自分で作成しない点です。PySpark シェルでは、sc という名前の SparkContext オブジェクトが自動的に作成されます。
この演習はコースの一部です
PySparkで学ぶBig Data入門
演習の手順
- 1 から 100 までの数値を含む Python のリスト
numbを作成します。 - Spark Context の
parallelizeメソッドを使ってリストを Spark に読み込み、変数spark_dataに代入します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a Python list of numbers from 1 to 100
numb = range(____, ____)
# Load the list into PySpark
spark_data = sc.____(numb)