ПочатиПочніть безкоштовно

RDD з зовнішніх наборів даних

PySpark легко створює RDD з файлів, що зберігаються на зовнішніх носіях, як-от HDFS (Hadoop Distributed File System), сховища Amazon S3 тощо. Проте найпоширеніший спосіб створення RDD — з файлів, що зберігаються у вашій локальній файловій системі. Цей метод приймає шлях до файлу та читає його як колекцію рядків. У цій вправі ви створите RDD з шляху до файлу (file_path) з ім'ям файлу README.md, який уже доступний у вашому робочому середовищі.

Пам'ятайте: у вашому робочому середовищі вже є SparkContext sc.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Виведіть file_path у консолі PySpark.
  • Створіть RDD з назвою fileRDD з file_path.
  • Виведіть тип створеного fileRDD.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
Редагувати та запускати код