Vérifier les types de données
À l'ère des données, nous avons accès à plus d'attributs que jamais. Pour tous les gérer, nous allons automatiser beaucoup de choses, mais au minimum il faut que leurs types de données soient corrects. Dans cet exercice, nous allons valider un dictionnaire d'attributs et leurs types de données pour vérifier s'ils sont conformes. Ce dictionnaire est stocké dans la variable validation_dict et est disponible dans votre espace de travail.
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- En utilisant
df, créez une liste de tuples (attribut, type de données) avecdtypes, appeléeactual_dtypes_list. - Parcourez
actual_dtypes_listet vérifiez si les noms de colonnes existent dans le dictionnaire des types attendusvalidation_dict. - Pour les clés qui existent dans le dictionnaire, comparez leurs types de données et affichez celles qui correspondent.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)
# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
# Check if column name is dictionary of expected dtypes
col_name = attribute_tuple[____]
if col_name in ____:
# Compare attribute types
col_type = attribute_tuple[____]
if col_type == validation_dict[____]:
print(col_name + ' has expected dtype.')