НачатьНачать бесплатно

RDD из внешних наборов данных

PySpark позволяет легко создавать RDD из файлов, хранящихся на внешних устройствах, — например, в HDFS (Hadoop Distributed File System), Amazon S3 и других. Однако наиболее распространённый способ — создание RDD из файлов локальной файловой системы. Этот метод принимает путь к файлу и считывает его как набор строк. В этом упражнении вы создадите RDD из пути к файлу (file_path) с именем README.md, который уже доступен в вашей рабочей области.

Напомним, что SparkContext sc уже доступен в вашей рабочей области.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Выведите значение file_path в оболочке PySpark.
  • Создайте RDD с именем fileRDD из file_path.
  • Выведите тип созданного объекта fileRDD.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
Редактировать и запускать код