CommencezCommencez gratuitement

Vérifier les types de données

À l'ère des données, nous avons accès à plus d'attributs que jamais. Pour tous les gérer, nous allons automatiser beaucoup de choses, mais au minimum il faut que leurs types de données soient corrects. Dans cet exercice, nous allons valider un dictionnaire d'attributs et leurs types de données pour vérifier s'ils sont conformes. Ce dictionnaire est stocké dans la variable validation_dict et est disponible dans votre espace de travail.

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • En utilisant df, créez une liste de tuples (attribut, type de données) avec dtypes, appelée actual_dtypes_list.
  • Parcourez actual_dtypes_list et vérifiez si les noms de colonnes existent dans le dictionnaire des types attendus validation_dict.
  • Pour les clés qui existent dans le dictionnaire, comparez leurs types de données et affichez celles qui correspondent.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)

# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
  
  # Check if column name is dictionary of expected dtypes
  col_name = attribute_tuple[____]
  if col_name in ____:

    # Compare attribute types
    col_type = attribute_tuple[____]
    if col_type == validation_dict[____]:
      print(col_name + ' has expected dtype.')
Modifier et exécuter le code