Python で Spark を使う
Spark を使う最初のステップは、クラスターに接続することです。
実際には、クラスターは他のすべてのノードに接続されたリモートマシン上でホストされます。データと計算を分割して管理する master と呼ばれるコンピュータが 1 台あります。master はクラスター内の残りのコンピュータ(worker と呼びます)に接続されています。master は worker にデータと計算を送信し、worker は結果を master に返します。
Spark を使い始めたばかりのときは、ローカルでクラスターを実行する方が簡単です。そこでこのコースでは、別のコンピュータに接続するのではなく、すべての計算を DataCamp のサーバー上でシミュレートされたクラスターとして実行します。
接続の作成は、SparkContext クラスのインスタンスを作るだけで完了します。クラスのコンストラクタには、接続先のクラスターの属性を指定できるいくつかのオプション引数があります。
これらの属性をすべて保持するオブジェクトは、SparkConf() コンストラクタで作成できます。詳細はドキュメントをご覧ください!
このコースの残りのパートでは、ワークスペースに sc という名前の SparkContext があらかじめ用意されています。
PySpark から Spark クラスターに接続するにはどうすればよいでしょうか?
この演習はコースの一部です
