RDD-uri din seturi de date externe
PySpark poate crea cu ușurință RDD-uri din fișiere stocate pe dispozitive de stocare externe, cum ar fi HDFS (Hadoop Distributed File System), bucket-uri Amazon S3 etc. Totuși, cea mai frecventă metodă de creare a RDD-urilor este din fișiere stocate în sistemul de fișiere local. Această metodă primește o cale către un fișier și îl citește ca o colecție de linii. În acest exercițiu, vei crea un RDD din calea fișierului (file_path) cu numele README.md, care este deja disponibil în spațiul tău de lucru.
Amintește-ți că ai deja un SparkContext sc disponibil în spațiul de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Afișează
file_pathîn shell-ul PySpark. - Creează un RDD numit
fileRDDdinfile_path. - Afișează tipul RDD-ului
fileRDDcreat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))