CommencezCommencez gratuitement

Valider les lignes par jointure

Un autre exemple de filtrage des données consiste à utiliser des jointures pour retirer les entrées non valides. Vous devez vérifier que les noms de dossiers sont conformes selon un DataFrame donné nommé valid_folders_df. Le DataFrame split_df est resté tel que vous l'avez laissé, avec un ensemble de colonnes éclatées.

L'objet spark est disponible, et pyspark.sql.functions est importé sous F.

Cette activité fait partie du cours

Nettoyer des données avec PySpark

Voir le cours

Instructions de l’exercice

  • Renommez la colonne _c0 en folder dans le DataFrame valid_folders_df.
  • Comptez le nombre de lignes dans split_df.
  • Joignez les deux DataFrames sur le nom du dossier et nommez le DataFrame résultant joined_df. Assurez-vous de diffuser (broadcast) le plus petit DataFrame.
  • Vérifiez le nombre de lignes restantes dans le DataFrame et comparez.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
Modifier et exécuter le code