Prohlížení cache ve Spark UI
K dispozici je dataframe partitioned_df, který slouží k registraci dočasné tabulky text. Tabulka text je pak uložena do cache pomocí spark.catalog.cacheTable('text'). Při lokálním spuštění Sparku by bylo Spark UI dostupné na adrese http://localhost:4040/storage/. Pro účely tohoto cvičení si prohlédni následující obrázek. Zobrazuje, co by Spark UI ukázalo po načtení cache pro tabulku text:

Obrázek ukazuje, že tabulka text se sedmi oddíly (partitions) je uložena v paměti. Která z následujících možností by okamžitě způsobila zobrazení výše uvedeného ve Spark UI?
Provedení transformace na podkladovém dataframu, například
df = partitioned_df.distinct().Spočítání řádků podkladového dataframu, například:
partitioned_df.count()Dotaz na tabulku, například:
spark.sql("select count(*) from text")Dotaz na tabulku a zobrazení výsledku, například:
spark.sql("select count(*) from text").show()
Toto cvičení je součástí kurzu
Úvod do Spark SQL v Pythonu
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení