ПочатиПочніть безкоштовно

Об'єднання II

У PySpark об'єднання виконують за допомогою методу датафрейму .join(). Цей метод приймає три аргументи. Перший — це другий DataFrame, який ви хочете об'єднати з першим. Другий аргумент, on, — це назва стовпця(ів)-ключа рядком. Назви стовпців-ключів у кожній таблиці мають збігатися. Третій аргумент, how, визначає тип об'єднання. У цьому курсі ми завжди використовуватимемо значення how="leftouter".

Набір даних flights і новий набір даних під назвою airports уже є у вашому робочому середовищі.

Ця вправа є частиною курсу

Основи PySpark

Переглянути курс

Інструкції до вправи

  • Перегляньте DataFrame airports, викликавши .show(). Зверніть увагу, який стовпець-ключ дасть змогу об'єднати airports з таблицею flights.
  • Перейменуйте стовпець faa у airports на dest, переприсвоївши результат airports.withColumnRenamed("faa", "dest") змінній airports.
  • Об'єднайте flights з DataFrame airports за стовпцем dest, викликавши метод .join() на flights. Збережіть результат як flights_with_airports.
    • Першим аргументом має бути інший DataFrame, airports.
    • Аргумент on має бути стовпцем-ключем.
    • Аргумент how має бути "leftouter".
  • Викличте .show() на flights_with_airports, щоб знову переглянути дані. Зверніть увагу на нову інформацію, яку додано.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Examine the data
print(____)

# Rename the faa column
airports = ____

# Join the DataFrames
flights_with_airports = ____

# Examine the new DataFrame
print(____)
Редагувати та запускати код