CommencezCommencez gratuitement

Comparer les jointures diffusées et normales

Vous avez créé deux types de jointures, normale et diffusée. Votre gestionnaire souhaite maintenant connaître le gain de performance obtenu grâce aux optimisations de Spark. Si les résultats sont prometteurs, vous aurez plus de latitude pour ajuster la configuration de Spark au besoin.

Vos DataFrames normal_df et broadcast_df sont prêts à être utilisés.

Cette activité fait partie du cours

Nettoyer des données avec PySpark

Voir le cours

Instructions de l’exercice

  • Exécutez .count() sur le DataFrame normal.
  • Exécutez .count() sur le DataFrame diffusé (broadcast).
  • Affichez le nombre et la durée pour les DataFrames en notant toute différence.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time

start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time

# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))
Modifier et exécuter le code