ПочатиПочніть безкоштовно

RDD з паралелізованих колекцій

Resilient Distributed Dataset (RDD) — це базова абстракція в Spark. Це незмінна розподілена колекція об'єктів. Оскільки RDD — фундаментальний і опорний тип даних у Spark, важливо розуміти, як його створювати. У цій вправі ви створите свій перший RDD у PySpark з колекції слів.

Пам'ятайте, у вашому робочому середовищі вже доступний SparkContext sc.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Створіть RDD з назвою RDD з списку Python зі словами.
  • Переконайтеся, що створений об'єкт — це RDD.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
Редагувати та запускати код