RDD з зовнішніх наборів даних
PySpark легко створює RDD з файлів, що зберігаються на зовнішніх носіях, як-от HDFS (Hadoop Distributed File System), сховища Amazon S3 тощо. Проте найпоширеніший спосіб створення RDD — з файлів, що зберігаються у вашій локальній файловій системі. Цей метод приймає шлях до файлу та читає його як колекцію рядків. У цій вправі ви створите RDD з шляху до файлу (file_path) з ім'ям файлу README.md, який уже доступний у вашому робочому середовищі.
Пам'ятайте: у вашому робочому середовищі вже є SparkContext sc.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Виведіть
file_pathу консолі PySpark. - Створіть RDD з назвою
fileRDDзfile_path. - Виведіть тип створеного
fileRDD.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))