RDD з паралелізованих колекцій
Resilient Distributed Dataset (RDD) — це базова абстракція в Spark. Це незмінна розподілена колекція об'єктів. Оскільки RDD — фундаментальний і опорний тип даних у Spark, важливо розуміти, як його створювати. У цій вправі ви створите свій перший RDD у PySpark з колекції слів.
Пам'ятайте, у вашому робочому середовищі вже доступний SparkContext sc.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Створіть RDD з назвою
RDDз списку Python зі словами. - Переконайтеся, що створений об'єкт — це RDD.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))