Začněte nyníZačněte zdarma

Procvičování ukládání do mezipaměti: část 1

V několika následujících cvičeních si vyzkoušíš různé způsoby ukládání dvou DataFrames do mezipaměti.

DataFrame df1 je načten ze souboru CSV a prochází několika kroky zpracování. Protože se df1 použije víckrát, je vhodným kandidátem pro uložení do mezipaměti.

Druhý DataFrame df2 vznikne provedením dalších výpočetně náročných kroků na df1. I ten je kandidátem pro uložení do mezipaměti.

Protože df2 závisí na df1, vyvstává otázka: je lepší uložit do mezipaměti df1, nebo df2?

V tomto cvičení zkusíš uložit do mezipaměti df1. Všimni si, jak dlouho trvá každá akce – v příštím cvičení je budeme porovnávat.

Toto cvičení je součástí kurzu

Úvod do Spark SQL v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Ulož do mezipaměti pouze df1.
  • Spusť první akci na df1, zopakuj ji, pak spusť akci na df2 a tu také zopakuj. Tento krok je již připraven za tebe.
  • Ověř, jestli je df1 uložen v mezipaměti.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Unpersists df1 and df2 and initializes a timer
prep(df1, df2) 

# Cache df1
____

# Run actions on both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)

# Prove df1 is cached
print(____)
Upravit a spustit kód