Об'єднання II
У PySpark об'єднання виконують за допомогою методу датафрейму .join(). Цей метод приймає три аргументи. Перший — це другий DataFrame, який ви хочете об'єднати з першим. Другий аргумент, on, — це назва стовпця(ів)-ключа рядком. Назви стовпців-ключів у кожній таблиці мають збігатися. Третій аргумент, how, визначає тип об'єднання. У цьому курсі ми завжди використовуватимемо значення how="leftouter".
Набір даних flights і новий набір даних під назвою airports уже є у вашому робочому середовищі.
Ця вправа є частиною курсу
Основи PySpark
Інструкції до вправи
- Перегляньте DataFrame
airports, викликавши.show(). Зверніть увагу, який стовпець-ключ дасть змогу об'єднатиairportsз таблицеюflights. - Перейменуйте стовпець
faaуairportsнаdest, переприсвоївши результатairports.withColumnRenamed("faa", "dest")зміннійairports. - Об'єднайте
flightsз DataFrameairportsза стовпцемdest, викликавши метод.join()наflights. Збережіть результат якflights_with_airports.- Першим аргументом має бути інший DataFrame,
airports. - Аргумент
onмає бути стовпцем-ключем. - Аргумент
howмає бути"leftouter".
- Першим аргументом має бути інший DataFrame,
- Викличте
.show()наflights_with_airports, щоб знову переглянути дані. Зверніть увагу на нову інформацію, яку додано.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)