ÎncepețiÎncepe gratuit

RDD-uri din seturi de date externe

PySpark poate crea cu ușurință RDD-uri din fișiere stocate pe dispozitive de stocare externe, cum ar fi HDFS (Hadoop Distributed File System), bucket-uri Amazon S3 etc. Totuși, cea mai frecventă metodă de creare a RDD-urilor este din fișiere stocate în sistemul de fișiere local. Această metodă primește o cale către un fișier și îl citește ca o colecție de linii. În acest exercițiu, vei crea un RDD din calea fișierului (file_path) cu numele README.md, care este deja disponibil în spațiul tău de lucru.

Amintește-ți că ai deja un SparkContext sc disponibil în spațiul de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Afișează file_path în shell-ul PySpark.
  • Creează un RDD numit fileRDD din file_path.
  • Afișează tipul RDD-ului fileRDD creat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
Editează și rulează codul