Začněte nyníZačněte zdarma

Použití Sparku v Pythonu

Prvním krokem při práci se Sparkem je připojení ke clusteru.

V praxi bývá cluster hostovaný na vzdáleném stroji, který je propojený se všemi ostatními uzly. Jeden počítač, tzv. master, řídí rozdělování dat a výpočtů. Master je spojený se zbytkem počítačů v clusteru, které se nazývají worker. Master jim posílá data a úlohy ke zpracování a oni mu posílají výsledky zpět.

Pokud se Sparkem teprve začínáš, je nejjednodušší spustit cluster lokálně. V tomto kurzu se proto místo připojení k jinému počítači poběží všechny výpočty na serverech DataCampu v simulovaném clusteru.

Vytvoření připojení je stejně snadné jako vytvoření instance třídy SparkContext. Konstruktor třídy přijímá několik volitelných argumentů, pomocí kterých můžeš nastavit vlastnosti clusteru, ke kterému se připojuješ.

Objekt obsahující všechna tato nastavení lze vytvořit pomocí konstruktoru SparkConf(). Podrobnosti najdeš v dokumentaci!

Po zbytek kurzu budeš mít v prostředí k dispozici již připravený SparkContext s názvem sc.

Jak se z PySparku připojíš ke Spark clusteru?

Toto cvičení je součástí kurzu

Foundations of PySpark

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení