Zacznij terazZacznij za darmo

Wczytywanie danych w powłoce PySpark

W PySpark obliczenia wyrażamy poprzez operacje na rozproszonych kolekcjach, które są automatycznie zrównoleglane w całym klastrze. W poprzednim ćwiczeniu wczytywałeś listę jako zrównolegloną kolekcję – teraz wczytasz dane z lokalnego pliku w powłoce PySpark.

Pamiętaj, że w swoim środowisku masz już dostęp do SparkContext sc oraz zmiennej file_path zawierającej ścieżkę do pliku README.md.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj lokalny plik tekstowy README.md w powłoce PySpark.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load a local file into PySpark shell
lines = sc.____(file_path)
Edytuj i uruchom kod