НачатьНачать бесплатно

Загрузка данных в оболочке PySpark

В PySpark вычисления выражаются через операции над распределёнными коллекциями, которые автоматически распараллеливаются по всему кластеру. В предыдущем упражнении вы видели пример загрузки списка в виде параллельной коллекции. В этом упражнении вы загрузите данные из локального файла в оболочке PySpark.

Обратите внимание: в рабочей среде уже доступны объект SparkContext sc и переменная file_path — путь к файлу README.md.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Загрузите локальный текстовый файл README.md в оболочке PySpark.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load a local file into PySpark shell
lines = sc.____(file_path)
Редактировать и запускать код