CommencerCommencez gratuitement

Vérifier les types de données

À l’ère des données, nous avons accès à plus d’attributs que jamais. Pour tous les gérer, nous allons automatiser beaucoup de choses, mais au minimum, leurs types de données doivent être corrects. Dans cet exercice, nous allons valider un dictionnaire d’attributs et de leurs types de données pour vérifier qu’ils sont corrects. Ce dictionnaire est stocké dans la variable validation_dict et est disponible dans votre espace de travail.

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • En partant de df, créez une liste de tuples (attribut, type de données) avec dtypes, appelée actual_dtypes_list.
  • Parcourez actual_dtypes_list et vérifiez si les noms de colonnes existent dans le dictionnaire des types attendus validation_dict.
  • Pour les clés présentes dans le dictionnaire, comparez leurs types de données et affichez celles qui correspondent.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)

# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
  
  # Check if column name is dictionary of expected dtypes
  col_name = attribute_tuple[____]
  if col_name in ____:

    # Compare attribute types
    col_type = attribute_tuple[____]
    if col_type == validation_dict[____]:
      print(col_name + ' has expected dtype.')
Modifier et exécuter le code