CommencerCommencez gratuitement

Effectuer une validation des données

Vous avez désormais défini le schéma ; il est temps d’exécuter la validation des données. Dans cet exercice, vous allez créer des règles de validation pour garantir la qualité des données et vérifier des problèmes courants comme les doublons et les valeurs nulles.

Le table_schema de l’exercice précédent est préchargé pour vous, ainsi que le DataFrame ts et la bibliothèque pointblank.

Cet exercice fait partie du cours

<cours>Concevoir des pipelines de prévision pour la production</cours>
Voir le cours

Instructions de l’exercice

  • Définissez la validation en utilisant la bonne méthode et en passant le DataFrame ts.
  • Mettez en place des règles de validation avec table_schema et vérifiez les doublons.
  • Affichez le rapport de validation.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Define the validation
validation = (pb.____(data=____,
tbl_name="US48 Data Validation",
label="Data Refresh",
thresholds=pb.Thresholds(warning=0.2, error=0, critical=0.1))
             
    # Set up the validation rules
    .col_schema_match(schema=____)
    .col_vals_gt(columns="value", value=0)
    .col_vals_in_set(columns="respondent", set = ["US48"])
    .col_vals_in_set(columns="type", set = ["D"])
    .col_vals_not_null(columns=["period", "value"])
    .____()
    .interrogate())

# Print the validation report
print(validation.____())
Modifier et exécuter le code