始める無料で始める

PySpark の対話的な利用

Spark には、PySpark があらかじめインストールされた対話型の Python シェルが付属しています。PySpark シェルは基本的なテストやデバッグに便利で、非常に強力です。PySpark シェルの力を手早く体験するには、演習が一番です。この演習では、1 から 100 までの数値を含むシンプルなリストを PySpark シェルに読み込みます。

ここで最も重要なのは、SparkContext オブジェクトを自分で作成しない点です。PySpark シェルでは、sc という名前の SparkContext オブジェクトが自動的に作成されます。

この演習はコースの一部です

PySparkで学ぶBig Data入門

コースを見る

演習の手順

  • 1 から 100 までの数値を含む Python のリスト numb を作成します。
  • Spark Context の parallelize メソッドを使ってリストを Spark に読み込み、変数 spark_data に代入します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a Python list of numbers from 1 to 100 
numb = range(____, ____)

# Load the list into PySpark  
spark_data = sc.____(numb)
コードを編集して実行