CommencezCommencez gratuitement

Mettons tout ensemble II

Créez un DataFrame, appliquez des transformations, mettez-le en cache et vérifiez s'il est bien en cache. Ensuite, retirez-le du cache pour libérer la mémoire. Pour cet exercice, une session spark a déjà été créée pour vous ! Regardez attentivement le résultat de la méthode .explain() pour bien comprendre ce qui se passe !

Cette activité fait partie du cours

Introduction à PySpark

Voir le cours

Instructions de l’exercice

  • Mettez en cache le DataFrame df.
  • Expliquez le traitement du DataFrame agg_result.
  • Supprimez le cache du DataFrame df après le traitement en appelant unpersist().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Cache the DataFrame
df.____

# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()

# Analyze the execution plan
agg_result.____

# Uncache the DataFrame
df.____
Modifier et exécuter le code