Używanie Sparka w Pythonie
Pierwszym krokiem do pracy ze Sparkiem jest połączenie z klastrem.
W praktyce klaster jest hostowany na zdalnej maszynie połączonej ze wszystkimi pozostałymi węzłami. Jeden komputer, zwany masterem, zarządza podziałem danych i obliczeń. Master jest połączony z pozostałymi komputerami w klastrze, zwanymi workerami. Wysyła do nich dane i zadania obliczeniowe, a one odsyłają wyniki z powrotem do mastera.
Kiedy dopiero zaczynasz pracę ze Sparkiem, najprościej jest uruchomić klaster lokalnie. Dlatego w tym kursie zamiast łączyć się z zewnętrznym komputerem, wszystkie obliczenia będą wykonywane na serwerach DataCamp w symulowanym klastrze.
Nawiązanie połączenia sprowadza się do utworzenia instancji klasy SparkContext. Konstruktor tej klasy przyjmuje kilka opcjonalnych argumentów, które pozwalają określić atrybuty klastra, z którym się łączysz.
Obiekt przechowujący wszystkie te atrybuty można utworzyć za pomocą konstruktora SparkConf(). Zajrzyj do dokumentacji, aby poznać szczegóły!
W pozostałej części kursu będziesz mieć w swoim środowisku gotowy obiekt SparkContext o nazwie sc.
Jak połączyć się z klastrem Spark z poziomu PySpark?
To ćwiczenie jest częścią kursu
Podstawy PySpark
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie