Łączenie tabel II
W PySparku łączenie tabel odbywa się za pomocą metody .join() na obiektach DataFrame. Metoda ta przyjmuje trzy argumenty. Pierwszy to drugi DataFrame, który chcesz połączyć z pierwszym. Drugi argument, on, to nazwa kolumny (lub kolumn) klucza podana jako ciąg znaków. Kolumny klucza muszą mieć taką samą nazwę w obu tabelach. Trzeci argument, how, określa rodzaj złączenia. W tym kursie zawsze będziemy używać wartości how="leftouter".
Zbiór danych flights oraz nowy zbiór danych airports są już dostępne w twoim obszarze roboczym.
To ćwiczenie jest częścią kursu
Podstawy PySpark
Instrukcje do ćwiczenia
- Sprawdź zawartość DataFrame
airports, wywołując metodę.show(). Zwróć uwagę, która kolumna klucza pozwoli ci połączyćairportsz tabeląflights. - Zmień nazwę kolumny
faaw DataFrameairportsnadest, przypisując wynik wywołaniaairports.withColumnRenamed("faa", "dest")z powrotem do zmiennejairports. - Połącz DataFrame
flightsz DataFrameairportspo kolumniedest, wywołując metodę.join()na obiekcieflights. Zapisz wynik jakoflights_with_airports.- Pierwszym argumentem powinien być drugi DataFrame, czyli
airports. - Argument
onpowinien wskazywać kolumnę klucza. - Argument
howpowinien mieć wartość"leftouter".
- Pierwszym argumentem powinien być drugi DataFrame, czyli
- Wywołaj
.show()naflights_with_airports, aby ponownie przejrzeć dane. Zwróć uwagę na nowe informacje, które zostały dodane.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)