ПочатиПочніть безкоштовно

Завантаження даних в оболонці PySpark

У PySpark ми описуємо обчислення через операції над розподіленими колекціями, які автоматично паралелізуються в кластері. У попередній вправі ви бачили приклад завантаження списку як паралелізованих колекцій, а в цій вправі ви завантажите дані з локального файла в оболонці PySpark.

Пам'ятайте: у вашому робочому середовищі вже доступні SparkContext sc і змінна file_path (це шлях до файла README.md).

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Завантажте локальний текстовий файл README.md в оболонці PySpark.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load a local file into PySpark shell
lines = sc.____(file_path)
Редагувати та запускати код