НачатьНачать бесплатно

Без лишних посредников

Теперь вы знаете, как загружать данные в Spark через pandas, но, возможно, задаётесь вопросом: зачем вообще использовать pandas? Разве не проще читать текстовый файл напрямую в Spark? Конечно, проще!

К счастью, у объекта SparkSession есть атрибут .read с несколькими методами для загрузки данных из разных источников в Spark DataFrames. С их помощью можно создать DataFrame из файла .csv точно так же, как это делается в pandas!

Переменная file_path содержит строку с путём к файлу airports.csv. Этот файл включает информацию о различных аэропортах по всему миру.

В вашем рабочем пространстве доступен объект SparkSession с именем spark.

Это упражнение является частью курса

Основы PySpark

Посмотреть курс

Инструкции к упражнению

  • С помощью метода .read.csv() создайте Spark DataFrame с именем airports.
    • Первый аргумент — file_path.
    • Передайте аргумент header=True, чтобы Spark взял названия столбцов из первой строки файла.
  • Выведите этот DataFrame с помощью метода .show().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
Редактировать и запускать код