RDD z zewnętrznych zbiorów danych
PySpark pozwala w łatwy sposób tworzyć RDD z plików przechowywanych na zewnętrznych urządzeniach, takich jak HDFS (Hadoop Distributed File System), zasobniki Amazon S3 i inne. Najczęściej jednak RDD tworzy się z plików znajdujących się w lokalnym systemie plików. Ta metoda przyjmuje ścieżkę do pliku i wczytuje go jako kolekcję wierszy. W tym ćwiczeniu utworzysz RDD na podstawie ścieżki (file_path) do pliku README.md, który jest już dostępny w twoim obszarze roboczym.
Pamiętaj, że SparkContext sc jest już dostępny w twoim obszarze roboczym.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Wyświetl
file_pathw powłoce PySpark. - Utwórz RDD o nazwie
fileRDDna podstawiefile_path. - Wyświetl typ utworzonego
fileRDD.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))