Effectuer une validation des données
Vous avez désormais défini le schéma ; il est temps d’exécuter la validation des données. Dans cet exercice, vous allez créer des règles de validation pour garantir la qualité des données et vérifier des problèmes courants comme les doublons et les valeurs nulles.
Le table_schema de l’exercice précédent est préchargé pour vous, ainsi que le DataFrame ts et la bibliothèque pointblank.
Cet exercice fait partie du cours
<cours>Concevoir des pipelines de prévision pour la production</cours>Instructions de l’exercice
- Définissez la validation en utilisant la bonne méthode et en passant le DataFrame
ts. - Mettez en place des règles de validation avec
table_schemaet vérifiez les doublons. - Affichez le rapport de validation.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define the validation
validation = (pb.____(data=____,
tbl_name="US48 Data Validation",
label="Data Refresh",
thresholds=pb.Thresholds(warning=0.2, error=0, critical=0.1))
# Set up the validation rules
.col_schema_match(schema=____)
.col_vals_gt(columns="value", value=0)
.col_vals_in_set(columns="respondent", set = ["US48"])
.col_vals_in_set(columns="type", set = ["D"])
.col_vals_not_null(columns=["period", "value"])
.____()
.interrogate())
# Print the validation report
print(validation.____())