RDD из параллелизованных коллекций
Resilient Distributed Dataset (RDD) — это базовая абстракция в Spark, представляющая собой неизменяемую распределённую коллекцию объектов. Поскольку RDD является фундаментальным типом данных в Spark, важно понять, как его создавать. В этом упражнении вы создадите свой первый RDD в PySpark из коллекции слов.
Напомним, что SparkContext sc уже доступен в вашем рабочем пространстве.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Создайте RDD с именем
RDDиз списка Python, содержащего слова. - Убедитесь, что созданный объект является RDD.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))