Examiner les lignes non valides
Vous avez réussi à filtrer les lignes au moyen d'une jointure, mais il arrive que vous vouliez examiner les données non valides. Vous pouvez conserver ces données pour un traitement ultérieur ou pour dépanner vos sources de données.
Vous souhaitez trouver la différence entre deux DataFrames et stocker les lignes non valides.
L'objet spark est défini et pyspark.sql.functions est importé sous le nom F. Le DataFrame initial split_df et le DataFrame joint joined_df sont disponibles tels qu'ils étaient auparavant.
Cette activité fait partie du cours
Nettoyer des données avec PySpark
Instructions de l’exercice
- Déterminez le nombre de lignes pour chaque DataFrame.
- Créez un DataFrame ne contenant que les lignes non valides.
- Validez que le nombre de lignes du nouveau DataFrame correspond aux attentes.
- Déterminez le nombre de lignes de dossiers distincts retirées.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____
# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')
# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))
# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)