Joining II
I PySpark utförs joins med DataFrame-metoden .join(). Metoden tar tre argument. Det första är den andra DataFrame som du vill joina med den första. Det andra argumentet, on, är namnet på nyckelkolumnen (eller nyckelkolumnerna) som en sträng. Nyckelkolumnerna måste ha samma namn i båda tabellerna. Det tredje argumentet, how, anger vilken typ av join som ska utföras. I den här kursen använder vi alltid värdet how="leftouter".
Datamängden flights och en ny datamängd kallad airports finns redan i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i PySpark
Övningsinstruktioner
- Undersök DataFrame:n
airportsgenom att anropa.show(). Notera vilken nyckelkolumn som låter dig joinaairportsmed tabellenflights. - Byt namn på kolumnen
faaiairportstilldestgenom att tilldela resultatet avairports.withColumnRenamed("faa", "dest")tillairports. - Joina
flightsmed DataFrame:nairportspå kolumnendestgenom att anropa metoden.join()påflights. Spara resultatet somflights_with_airports.- Det första argumentet ska vara den andra DataFrame:n,
airports. - Argumentet
onska vara nyckelkolumnen. - Argumentet
howska vara"leftouter".
- Det första argumentet ska vara den andra DataFrame:n,
- Anropa
.show()påflights_with_airportsför att undersöka data igen. Notera den nya information som har lagts till.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)