Mettons tout ensemble II
Créez un DataFrame, appliquez des transformations, mettez-le en cache et vérifiez s'il est bien en cache. Ensuite, retirez-le du cache pour libérer la mémoire.
Pour cet exercice, une session spark a déjà été créée pour vous ! Regardez attentivement le résultat de la méthode .explain() pour bien comprendre ce qui se passe !
Cette activité fait partie du cours
Introduction à PySpark
Instructions de l’exercice
- Mettez en cache le DataFrame
df. - Expliquez le traitement du DataFrame
agg_result. - Supprimez le cache du DataFrame
dfaprès le traitement en appelantunpersist().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____