Kom igångKom igång gratis

Granska cache i Spark UI

En dataram partitioned_df är tillgänglig. Den används för att registrera en temporär tabell kallad text. text cachas sedan med spark.catalog.cacheTable('text'). Om du kör Spark lokalt är Spark UI tillgängligt på http://localhost:4040/storage/. Granska bilden nedan för den här övningens skull. Den visar vad Spark UI skulle visa när cachen för text har laddats:

Spark UI Storage

Bilden visar att en tabell kallad text med sju partitioner är cachad i minnet. Vilket av följande skulle omedelbart göra att ovanstående visas i Spark UI?

  1. Utföra en transformation på den underliggande dataframen, till exempel df = partitioned_df.distinct().

  2. Räkna raderna i den underliggande dataframen, till exempel: partitioned_df.count()

  3. Fråga tabellen med exempelvis: spark.sql("select count(*) from text")

  4. Fråga tabellen och visa resultatet, till exempel: spark.sql("select count(*) from text").show()

Den här övningen är en del av kursen

Introduktion till Spark SQL i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Gör teori till handling med en av våra interaktiva övningar

Starta övningen