Kom igångKom igång gratis

Joining II

I PySpark utförs joins med DataFrame-metoden .join(). Metoden tar tre argument. Det första är den andra DataFrame som du vill joina med den första. Det andra argumentet, on, är namnet på nyckelkolumnen (eller nyckelkolumnerna) som en sträng. Nyckelkolumnerna måste ha samma namn i båda tabellerna. Det tredje argumentet, how, anger vilken typ av join som ska utföras. I den här kursen använder vi alltid värdet how="leftouter".

Datamängden flights och en ny datamängd kallad airports finns redan i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i PySpark

Visa kurs

Övningsinstruktioner

  • Undersök DataFrame:n airports genom att anropa .show(). Notera vilken nyckelkolumn som låter dig joina airports med tabellen flights.
  • Byt namn på kolumnen faa i airports till dest genom att tilldela resultatet av airports.withColumnRenamed("faa", "dest") till airports.
  • Joina flights med DataFrame:n airports på kolumnen dest genom att anropa metoden .join()flights. Spara resultatet som flights_with_airports.
    • Det första argumentet ska vara den andra DataFrame:n, airports.
    • Argumentet on ska vara nyckelkolumnen.
    • Argumentet how ska vara "leftouter".
  • Anropa .show()flights_with_airports för att undersöka data igen. Notera den nya information som har lagts till.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Examine the data
print(____)

# Rename the faa column
airports = ____

# Join the DataFrames
flights_with_airports = ____

# Examine the new DataFrame
print(____)
Redigera och kör kod