Vérifier les types de données
À l’ère des données, nous avons accès à plus d’attributs que jamais. Pour tous les gérer, nous allons automatiser beaucoup de choses, mais au minimum, leurs types de données doivent être corrects. Dans cet exercice, nous allons valider un dictionnaire d’attributs et de leurs types de données pour vérifier qu’ils sont corrects. Ce dictionnaire est stocké dans la variable validation_dict et est disponible dans votre espace de travail.
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- En partant de
df, créez une liste de tuples (attribut, type de données) avecdtypes, appeléeactual_dtypes_list. - Parcourez
actual_dtypes_listet vérifiez si les noms de colonnes existent dans le dictionnaire des types attendusvalidation_dict. - Pour les clés présentes dans le dictionnaire, comparez leurs types de données et affichez celles qui correspondent.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)
# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
# Check if column name is dictionary of expected dtypes
col_name = attribute_tuple[____]
if col_name in ____:
# Compare attribute types
col_type = attribute_tuple[____]
if col_type == validation_dict[____]:
print(col_name + ' has expected dtype.')