Zacznij terazZacznij za darmo

RDD z zewnętrznych zbiorów danych

PySpark pozwala w łatwy sposób tworzyć RDD z plików przechowywanych na zewnętrznych urządzeniach, takich jak HDFS (Hadoop Distributed File System), zasobniki Amazon S3 i inne. Najczęściej jednak RDD tworzy się z plików znajdujących się w lokalnym systemie plików. Ta metoda przyjmuje ścieżkę do pliku i wczytuje go jako kolekcję wierszy. W tym ćwiczeniu utworzysz RDD na podstawie ścieżki (file_path) do pliku README.md, który jest już dostępny w twoim obszarze roboczym.

Pamiętaj, że SparkContext sc jest już dostępny w twoim obszarze roboczym.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyświetl file_path w powłoce PySpark.
  • Utwórz RDD o nazwie fileRDD na podstawie file_path.
  • Wyświetl typ utworzonego fileRDD.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
Edytuj i uruchom kod