RDD из внешних наборов данных
PySpark позволяет легко создавать RDD из файлов, хранящихся на внешних устройствах, — например, в HDFS (Hadoop Distributed File System), Amazon S3 и других. Однако наиболее распространённый способ — создание RDD из файлов локальной файловой системы. Этот метод принимает путь к файлу и считывает его как набор строк. В этом упражнении вы создадите RDD из пути к файлу (file_path) с именем README.md, который уже доступен в вашей рабочей области.
Напомним, что SparkContext sc уже доступен в вашей рабочей области.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Выведите значение
file_pathв оболочке PySpark. - Создайте RDD с именем
fileRDDизfile_path. - Выведите тип созданного объекта
fileRDD.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))