Joining II
În PySpark, îmbinările se realizează folosind metoda .join() a unui DataFrame. Această metodă primește trei argumente. Primul este al doilea DataFrame cu care vrei să îl îmbini pe primul. Al doilea argument, on, reprezintă numele coloanei (sau coloanelor) cheie, ca șir de caractere. Numele coloanelor cheie trebuie să fie identice în ambele tabele. Al treilea argument, how, specifică tipul de îmbinare. În acest curs vom folosi întotdeauna valoarea how="leftouter".
Setul de date flights și un nou set de date numit airports sunt deja disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Fundamente PySpark
Instrucțiuni pentru exercițiu
- Examinează DataFrame-ul
airportsapelând.show(). Observă ce coloană cheie îți permite să îmbiniairportscu tabelulflights. - Redenumește coloana
faadinairportsîndest, reatribuind rezultatul luiairports.withColumnRenamed("faa", "dest")variabileiairports. - Îmbină DataFrame-urile
flightsșiairportspe coloanadest, apelând metoda.join()peflights. Salvează rezultatul caflights_with_airports.- Primul argument trebuie să fie celălalt DataFrame,
airports. - Argumentul
ontrebuie să fie coloana cheie. - Argumentul
howtrebuie să fie"leftouter".
- Primul argument trebuie să fie celălalt DataFrame,
- Apelează
.show()peflights_with_airportspentru a examina datele din nou. Observă informațiile noi care au fost adăugate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)