Procvičování ukládání do mezipaměti: část 1
V několika následujících cvičeních si vyzkoušíš různé způsoby ukládání dvou DataFrames do mezipaměti.
DataFrame df1 je načten ze souboru CSV a prochází několika kroky zpracování. Protože se df1 použije víckrát, je vhodným kandidátem pro uložení do mezipaměti.
Druhý DataFrame df2 vznikne provedením dalších výpočetně náročných kroků na df1. I ten je kandidátem pro uložení do mezipaměti.
Protože df2 závisí na df1, vyvstává otázka: je lepší uložit do mezipaměti df1, nebo df2?
V tomto cvičení zkusíš uložit do mezipaměti df1. Všimni si, jak dlouho trvá každá akce – v příštím cvičení je budeme porovnávat.
Toto cvičení je součástí kurzu
Úvod do Spark SQL v Pythonu
Pokyny k cvičení
- Ulož do mezipaměti pouze
df1. - Spusť první akci na
df1, zopakuj ji, pak spusť akci nadf2a tu také zopakuj. Tento krok je již připraven za tebe. - Ověř, jestli je
df1uložen v mezipaměti.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Unpersists df1 and df2 and initializes a timer
prep(df1, df2)
# Cache df1
____
# Run actions on both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)
# Prove df1 is cached
print(____)