始める無料で始める

Python で Spark を使う

Spark を使う最初のステップは、クラスターに接続することです。

実際には、クラスターは他のすべてのノードに接続されたリモートマシン上でホストされます。データと計算を分割して管理する master と呼ばれるコンピュータが 1 台あります。master はクラスター内の残りのコンピュータ(worker と呼びます)に接続されています。master は worker にデータと計算を送信し、worker は結果を master に返します。

Spark を使い始めたばかりのときは、ローカルでクラスターを実行する方が簡単です。そこでこのコースでは、別のコンピュータに接続するのではなく、すべての計算を DataCamp のサーバー上でシミュレートされたクラスターとして実行します。

接続の作成は、SparkContext クラスのインスタンスを作るだけで完了します。クラスのコンストラクタには、接続先のクラスターの属性を指定できるいくつかのオプション引数があります。

これらの属性をすべて保持するオブジェクトは、SparkConf() コンストラクタで作成できます。詳細はドキュメントをご覧ください!

このコースの残りのパートでは、ワークスペースに sc という名前の SparkContext があらかじめ用意されています。

PySpark から Spark クラスターに接続するにはどうすればよいでしょうか?

この演習はコースの一部です

PySpark入門

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する