НачатьНачать бесплатно

RDD из параллелизованных коллекций

Resilient Distributed Dataset (RDD) — это базовая абстракция в Spark, представляющая собой неизменяемую распределённую коллекцию объектов. Поскольку RDD является фундаментальным типом данных в Spark, важно понять, как его создавать. В этом упражнении вы создадите свой первый RDD в PySpark из коллекции слов.

Напомним, что SparkContext sc уже доступен в вашем рабочем пространстве.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте RDD с именем RDD из списка Python, содержащего слова.
  • Убедитесь, что созданный объект является RDD.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
Редактировать и запускать код