Завантаження даних в оболонці PySpark
У PySpark ми описуємо обчислення через операції над розподіленими колекціями, які автоматично паралелізуються в кластері. У попередній вправі ви бачили приклад завантаження списку як паралелізованих колекцій, а в цій вправі ви завантажите дані з локального файла в оболонці PySpark.
Пам'ятайте: у вашому робочому середовищі вже доступні SparkContext sc і змінна file_path (це шлях до файла README.md).
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Завантажте локальний текстовий файл
README.mdв оболонці PySpark.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load a local file into PySpark shell
lines = sc.____(file_path)