Загрузка данных в оболочке PySpark
В PySpark вычисления выражаются через операции над распределёнными коллекциями, которые автоматически распараллеливаются по всему кластеру. В предыдущем упражнении вы видели пример загрузки списка в виде параллельной коллекции. В этом упражнении вы загрузите данные из локального файла в оболочке PySpark.
Обратите внимание: в рабочей среде уже доступны объект SparkContext sc и переменная file_path — путь к файлу README.md.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Загрузите локальный текстовый файл
README.mdв оболочке PySpark.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load a local file into PySpark shell
lines = sc.____(file_path)