НачатьНачать бесплатно

Объединение таблиц II

В PySpark объединение таблиц выполняется с помощью метода .join() объекта DataFrame. Этот метод принимает три аргумента. Первый — второй DataFrame, с которым нужно выполнить объединение. Второй аргумент, on, — название ключевого столбца (или столбцов) в виде строки. Названия ключевых столбцов должны совпадать в обеих таблицах. Третий аргумент, how, определяет тип объединения. В этом курсе мы всегда будем использовать значение how="leftouter".

Набор данных flights и новый набор данных airports уже доступны в вашем рабочем пространстве.

Это упражнение является частью курса

Основы PySpark

Посмотреть курс

Инструкции к упражнению

  • Изучите DataFrame airports, вызвав .show(). Определите, какой ключевой столбец позволит объединить airports с таблицей flights.
  • Переименуйте столбец faa в airports в dest, переприсвоив результат airports.withColumnRenamed("faa", "dest") переменной airports.
  • Объедините flights с DataFrame airports по столбцу dest, вызвав метод .join() на объекте flights. Сохраните результат в переменную flights_with_airports.
    • Первым аргументом должен быть второй DataFrame — airports.
    • Аргумент on должен указывать на ключевой столбец.
    • Аргумент how должен иметь значение "leftouter".
  • Вызовите .show() на объекте flights_with_airports, чтобы просмотреть данные. Обратите внимание на новую информацию, которая появилась в таблице.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Examine the data
print(____)

# Rename the faa column
airports = ____

# Join the DataFrames
flights_with_airports = ____

# Examine the new DataFrame
print(____)
Редактировать и запускать код