Začněte nyníZačněte zdarma

Líné zpracování v praxi

Operace líného zpracování se obvykle dokončí přibližně za stejnou dobu bez ohledu na skutečné množství dat. Je to proto, že Spark neprovádí žádné transformace, dokud není vyžádána akce.

V tomto cvičení nadefinuješ DataFrame (aa_dfw_df) a přidáš k němu několik transformací. Všímej si, jak dlouho trvá dokončení transformací při jejich definování oproti situaci, kdy se data skutečně dotazují. Rozdíly mohou být malé, ale postřehnutelné. Na plnohodnotném Spark clusteru s větším objemem dat bude tento rozdíl mnohem výraznější.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Načti DataFrame.
  • Přidej transformaci F.lower() na sloupec Destination Airport.
  • Zobraz DataFrame pomocí .show() a všímej si, jak dlouho tato akce trvá.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')

# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))

# Show the DataFrame
____
Upravit a spustit kód