Spojování tabulek II
V PySparku se tabulky spojují pomocí metody .join() třídy DataFrame. Tato metoda přijímá tři argumenty. První je druhý DataFrame, který chceš spojit s tím prvním. Druhý argument, on, je název klíčového sloupce (nebo sloupců) jako řetězec. Názvy klíčových sloupců musí být v obou tabulkách stejné. Třetí argument, how, určuje typ spojení. V tomto kurzu budeme vždy používat hodnotu how="leftouter".
Dataset flights a nový dataset airports už máš k dispozici ve svém pracovním prostoru.
Toto cvičení je součástí kurzu
Foundations of PySpark
Pokyny k cvičení
- Prohlédni si DataFrame
airportspomocí metody.show(). Všimni si, který klíčový sloupec umožní spojitairportss tabulkouflights. - Přejmenuj sloupec
faav DataFramuairportsnadesttak, že výsledek voláníairports.withColumnRenamed("faa", "dest")přiřadíš zpět do proměnnéairports. - Spoj DataFrame
flightss DataFramemairportspřes sloupecdest– zavolej metodu.join()na objektuflights. Výsledek ulož jakoflights_with_airports.- Prvním argumentem by měl být druhý DataFrame, tedy
airports. - Argument
onby měl být klíčový sloupec. - Argument
howby měl mít hodnotu"leftouter".
- Prvním argumentem by měl být druhý DataFrame, tedy
- Zavolej
.show()naflights_with_airportsa prohlédni si data. Všimni si nových informací, které přibyly.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)