Без лишних посредников
Теперь вы знаете, как загружать данные в Spark через pandas, но, возможно, задаётесь вопросом: зачем вообще использовать pandas? Разве не проще читать текстовый файл напрямую в Spark? Конечно, проще!
К счастью, у объекта SparkSession есть атрибут .read с несколькими методами для загрузки данных из разных источников в Spark DataFrames. С их помощью можно создать DataFrame из файла .csv точно так же, как это делается в pandas!
Переменная file_path содержит строку с путём к файлу airports.csv. Этот файл включает информацию о различных аэропортах по всему миру.
В вашем рабочем пространстве доступен объект SparkSession с именем spark.
Это упражнение является частью курса
Основы PySpark
Инструкции к упражнению
- С помощью метода
.read.csv()создайте Spark DataFrame с именемairports.- Первый аргумент —
file_path. - Передайте аргумент
header=True, чтобы Spark взял названия столбцов из первой строки файла.
- Первый аргумент —
- Выведите этот DataFrame с помощью метода
.show().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()