Створіть базовий RDD і перетворіть його
Обсяг неструктурованих даних (журнальні рядки, зображення, бінарні файли) стрімко зростає, і PySpark — чудова платформа для аналізу таких даних через RDD. У цій вправі з трьох частин ви напишете код, який обчислює найпоширеніші слова з Complete Works of William Shakespeare.
Ось короткі кроки для написання програми підрахунку слів:
- Створіть базовий RDD з файла
Complete_Shakespeare.txt. - Використайте перетворення RDD, щоб отримати довгий список слів з кожного елемента базового RDD.
- Приберіть стоп-слова з даних.
- Створіть парний RDD, де кожен елемент — це кортеж пари
('w', 1). - Згрупуйте елементи парного RDD за ключем (словом) і підсумуйте їхні значення.
- Поміняйте місцями ключі (слова) та значення (лічильники), щоб ключем була кількість, а значенням — слово.
- Нарешті відсортуйте RDD за спаданням і виведіть 10 найчастотніших слів та їхні частоти.
У цій першій вправі ви створите базовий RDD з файла Complete_Shakespeare.txt і перетворите його, щоб отримати довгий список слів.
Пам'ятайте, у вашому середовищі вже доступний SparkContext sc. Змінна file_path (шлях до файла Complete_Shakespeare.txt) також підготовлена для вас.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Створіть RDD з назвою
baseRDD, який читає рядки зfile_path. - Перетворіть
baseRDDна довгий список слів і створіть новийsplitRDD. - Порахуйте загальну кількість слів у
splitRDD.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a baseRDD from the file path
baseRDD = sc.____(file_path)
# Split the lines of baseRDD into words
splitRDD = baseRDD.____(lambda x: x.split())
# Count the total number of words
print("Total number of words in splitRDD:", splitRDD.____())