CommencezCommencez gratuitement

Inspecter la mémoire cache dans l'interface Spark UI

Un dataframe partitioned_df est disponible. Il sert à enregistrer une table temporaire appelée text. text est ensuite mis en cache avec spark.catalog.cacheTable('text'). Si vous exécutiez Spark localement, l'interface Spark UI serait accessible à http://localhost:4040/storage/. Pour les besoins de cet exercice, examinez l'image suivante. Elle montre ce que l'interface Spark UI afficherait une fois la mémoire cache de text chargée :

Spark UI Storage

Cela indique qu'une table appelée text comportant sept partitions est mise en cache en mémoire. Laquelle des options suivantes ferait apparaître immédiatement ce qui précède dans l'interface Spark UI ?

  1. Effectuer une transformation sur le dataframe sous-jacent, par exemple : df = partitioned_df.distinct().

  2. Compter le dataframe sous-jacent, par exemple : partitioned_df.count()

  3. Interroger la table en utilisant, par exemple : spark.sql("select count(*) from text")

  4. Interroger et afficher le résultat, par exemple : spark.sql("select count(*) from text").show()

Cette activité fait partie du cours

Introduction à Spark SQL en Python

Voir le cours

Exercice interactif pratique

Passez de la théorie à l’action grâce à l’un de nos exercices interactifs

Commencer l’exercice