Líné zpracování v praxi
Operace líného zpracování se obvykle dokončí přibližně za stejnou dobu bez ohledu na skutečné množství dat. Je to proto, že Spark neprovádí žádné transformace, dokud není vyžádána akce.
V tomto cvičení nadefinuješ DataFrame (aa_dfw_df) a přidáš k němu několik transformací. Všímej si, jak dlouho trvá dokončení transformací při jejich definování oproti situaci, kdy se data skutečně dotazují. Rozdíly mohou být malé, ale postřehnutelné. Na plnohodnotném Spark clusteru s větším objemem dat bude tento rozdíl mnohem výraznější.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Načti DataFrame.
- Přidej transformaci
F.lower()na sloupecDestination Airport. - Zobraz DataFrame pomocí
.show()a všímej si, jak dlouho tato akce trvá.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____