ПочатиПочніть безкоштовно

Без посередників

Тепер ви вмієте завантажувати дані у Spark через pandas, але, мабуть, замислюєтеся: навіщо взагалі залучати pandas? Хіба не простіше одразу прочитати текстовий файл у Spark? Звісно, простіше!

На щастя, ваш SparkSession має атрибут .read із кількома методами для зчитування різних джерел даних у датафрейми Spark. Завдяки їм ви можете створити датафрейм з файлу .csv так само, як і звичайний датафрейм у pandas!

Змінна file_path — це рядок із шляхом до файлу airports.csv. У цьому файлі міститься інформація про різні аеропорти з усього світу.

У вашому робочому середовищі доступний SparkSession з назвою spark.

Ця вправа є частиною курсу

Основи PySpark

Переглянути курс

Інструкції до вправи

  • Використайте метод .read.csv() для створення датафрейму Spark під назвою airports.
    • Першим аргументом передайте file_path.
    • Передайте аргумент header=True, щоб Spark узяв назви стовпців з першого рядка файлу.
  • Виведіть цей датафрейм, викликавши .show().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
Редагувати та запускати код