Wczytywanie danych w powłoce PySpark
W PySpark obliczenia wyrażamy poprzez operacje na rozproszonych kolekcjach, które są automatycznie zrównoleglane w całym klastrze. W poprzednim ćwiczeniu wczytywałeś listę jako zrównolegloną kolekcję – teraz wczytasz dane z lokalnego pliku w powłoce PySpark.
Pamiętaj, że w swoim środowisku masz już dostęp do SparkContext sc oraz zmiennej file_path zawierającej ścieżkę do pliku README.md.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Wczytaj lokalny plik tekstowy
README.mdw powłoce PySpark.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load a local file into PySpark shell
lines = sc.____(file_path)