Začněte nyníZačněte zdarma

Prohlížení cache ve Spark UI

K dispozici je dataframe partitioned_df, který slouží k registraci dočasné tabulky text. Tabulka text je pak uložena do cache pomocí spark.catalog.cacheTable('text'). Při lokálním spuštění Sparku by bylo Spark UI dostupné na adrese http://localhost:4040/storage/. Pro účely tohoto cvičení si prohlédni následující obrázek. Zobrazuje, co by Spark UI ukázalo po načtení cache pro tabulku text:

Spark UI Storage

Obrázek ukazuje, že tabulka text se sedmi oddíly (partitions) je uložena v paměti. Která z následujících možností by okamžitě způsobila zobrazení výše uvedeného ve Spark UI?

  1. Provedení transformace na podkladovém dataframu, například df = partitioned_df.distinct().

  2. Spočítání řádků podkladového dataframu, například: partitioned_df.count()

  3. Dotaz na tabulku, například: spark.sql("select count(*) from text")

  4. Dotaz na tabulku a zobrazení výsledku, například: spark.sql("select count(*) from text").show()

Toto cvičení je součástí kurzu

Úvod do Spark SQL v Pythonu

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení