Объединение таблиц II
В PySpark объединение таблиц выполняется с помощью метода .join() объекта DataFrame. Этот метод принимает три аргумента. Первый — второй DataFrame, с которым нужно выполнить объединение. Второй аргумент, on, — название ключевого столбца (или столбцов) в виде строки. Названия ключевых столбцов должны совпадать в обеих таблицах. Третий аргумент, how, определяет тип объединения. В этом курсе мы всегда будем использовать значение how="leftouter".
Набор данных flights и новый набор данных airports уже доступны в вашем рабочем пространстве.
Это упражнение является частью курса
Основы PySpark
Инструкции к упражнению
- Изучите DataFrame
airports, вызвав.show(). Определите, какой ключевой столбец позволит объединитьairportsс таблицейflights. - Переименуйте столбец
faaвairportsвdest, переприсвоив результатairports.withColumnRenamed("faa", "dest")переменнойairports. - Объедините
flightsс DataFrameairportsпо столбцуdest, вызвав метод.join()на объектеflights. Сохраните результат в переменнуюflights_with_airports.- Первым аргументом должен быть второй DataFrame —
airports. - Аргумент
onдолжен указывать на ключевой столбец. - Аргумент
howдолжен иметь значение"leftouter".
- Первым аргументом должен быть второй DataFrame —
- Вызовите
.show()на объектеflights_with_airports, чтобы просмотреть данные. Обратите внимание на новую информацию, которая появилась в таблице.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)