ÎncepețiÎncepe gratuit

Joining II

În PySpark, îmbinările se realizează folosind metoda .join() a unui DataFrame. Această metodă primește trei argumente. Primul este al doilea DataFrame cu care vrei să îl îmbini pe primul. Al doilea argument, on, reprezintă numele coloanei (sau coloanelor) cheie, ca șir de caractere. Numele coloanelor cheie trebuie să fie identice în ambele tabele. Al treilea argument, how, specifică tipul de îmbinare. În acest curs vom folosi întotdeauna valoarea how="leftouter".

Setul de date flights și un nou set de date numit airports sunt deja disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamente PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Examinează DataFrame-ul airports apelând .show(). Observă ce coloană cheie îți permite să îmbini airports cu tabelul flights.
  • Redenumește coloana faa din airports în dest, reatribuind rezultatul lui airports.withColumnRenamed("faa", "dest") variabilei airports.
  • Îmbină DataFrame-urile flights și airports pe coloana dest, apelând metoda .join() pe flights. Salvează rezultatul ca flights_with_airports.
    • Primul argument trebuie să fie celălalt DataFrame, airports.
    • Argumentul on trebuie să fie coloana cheie.
    • Argumentul how trebuie să fie "leftouter".
  • Apelează .show() pe flights_with_airports pentru a examina datele din nou. Observă informațiile noi care au fost adăugate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Examine the data
print(____)

# Rename the faa column
airports = ____

# Join the DataFrames
flights_with_airports = ____

# Examine the new DataFrame
print(____)
Editează și rulează codul