ÎncepețiÎncepe gratuit

Inspectarea cache-ului în Spark UI

Un DataFrame partitioned_df este disponibil. Este folosit pentru a înregistra un tabel temporar numit text. Tabelul text este apoi pus în cache cu spark.catalog.cacheTable('text'). Dacă ai rula Spark local, Spark UI ar fi disponibil la http://localhost:4040/storage/. Pentru scopul acestui exercițiu, examinează imaginea de mai jos. Aceasta arată ce ar afișa Spark UI odată ce cache-ul pentru text este încărcat:

Spark UI Storage

Imagine arată că un tabel numit text, cu șapte partiții, este stocat în cache în memorie. Care dintre variantele de mai jos ar determina imediat apariția acestei informații în Spark UI?

  1. Aplicarea unei transformări pe DataFrame-ul de bază, de exemplu df = partitioned_df.distinct().

  2. Numărarea rândurilor din DataFrame-ul de bază, de exemplu: partitioned_df.count()

  3. Interogarea tabelului, de exemplu: spark.sql("select count(*) from text")

  4. Interogarea tabelului și afișarea rezultatului, de exemplu: spark.sql("select count(*) from text").show()

Acest exercițiu face parte din cursul

Introducere în Spark SQL în Python

Vezi cursul

Exercițiu interactiv practic

Transformă teoria în practică cu unul dintre exercițiile noastre interactive

Începe exercițiul