Zacznij terazZacznij za darmo

Używanie Sparka w Pythonie

Pierwszym krokiem do pracy ze Sparkiem jest połączenie z klastrem.

W praktyce klaster jest hostowany na zdalnej maszynie połączonej ze wszystkimi pozostałymi węzłami. Jeden komputer, zwany masterem, zarządza podziałem danych i obliczeń. Master jest połączony z pozostałymi komputerami w klastrze, zwanymi workerami. Wysyła do nich dane i zadania obliczeniowe, a one odsyłają wyniki z powrotem do mastera.

Kiedy dopiero zaczynasz pracę ze Sparkiem, najprościej jest uruchomić klaster lokalnie. Dlatego w tym kursie zamiast łączyć się z zewnętrznym komputerem, wszystkie obliczenia będą wykonywane na serwerach DataCamp w symulowanym klastrze.

Nawiązanie połączenia sprowadza się do utworzenia instancji klasy SparkContext. Konstruktor tej klasy przyjmuje kilka opcjonalnych argumentów, które pozwalają określić atrybuty klastra, z którym się łączysz.

Obiekt przechowujący wszystkie te atrybuty można utworzyć za pomocą konstruktora SparkConf(). Zajrzyj do dokumentacji, aby poznać szczegóły!

W pozostałej części kursu będziesz mieć w swoim środowisku gotowy obiekt SparkContext o nazwie sc.

Jak połączyć się z klastrem Spark z poziomu PySpark?

To ćwiczenie jest częścią kursu

Podstawy PySpark

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń

Rozpocznij ćwiczenie