ПочатиПочніть безкоштовно

Створіть базовий RDD і перетворіть його

Обсяг неструктурованих даних (журнальні рядки, зображення, бінарні файли) стрімко зростає, і PySpark — чудова платформа для аналізу таких даних через RDD. У цій вправі з трьох частин ви напишете код, який обчислює найпоширеніші слова з Complete Works of William Shakespeare.

Ось короткі кроки для написання програми підрахунку слів:

  • Створіть базовий RDD з файла Complete_Shakespeare.txt.
  • Використайте перетворення RDD, щоб отримати довгий список слів з кожного елемента базового RDD.
  • Приберіть стоп-слова з даних.
  • Створіть парний RDD, де кожен елемент — це кортеж пари ('w', 1).
  • Згрупуйте елементи парного RDD за ключем (словом) і підсумуйте їхні значення.
  • Поміняйте місцями ключі (слова) та значення (лічильники), щоб ключем була кількість, а значенням — слово.
  • Нарешті відсортуйте RDD за спаданням і виведіть 10 найчастотніших слів та їхні частоти.

У цій першій вправі ви створите базовий RDD з файла Complete_Shakespeare.txt і перетворите його, щоб отримати довгий список слів.

Пам'ятайте, у вашому середовищі вже доступний SparkContext sc. Змінна file_path (шлях до файла Complete_Shakespeare.txt) також підготовлена для вас.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Створіть RDD з назвою baseRDD, який читає рядки з file_path.
  • Перетворіть baseRDD на довгий список слів і створіть новий splitRDD.
  • Порахуйте загальну кількість слів у splitRDD.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create a baseRDD from the file path
baseRDD = sc.____(file_path)

# Split the lines of baseRDD into words
splitRDD = baseRDD.____(lambda x: x.split())

# Count the total number of words
print("Total number of words in splitRDD:", splitRDD.____())
Редагувати та запускати код