Aan de slagBegin gratis

Gegevenstypen verifiëren

In het datatijdperk hebben we toegang tot meer attributen dan ooit. Om die allemaal te verwerken bouwen we veel automatisering, maar minimaal moeten hun gegevenstypen kloppen. In deze oefening valideren we een dictionary met attributen en hun gegevenstypen om te zien of ze correct zijn. Deze dictionary staat in de variabele validation_dict en is beschikbaar in je werkruimte.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Maak met df een lijst van tuples met attribuut en gegevenstype via dtypes, genaamd actual_dtypes_list.
  • Loop door actual_dtypes_list en controleer of de kolomnamen bestaan in de dictionary met verwachte gegevenstypen validation_dict.
  • Voor de sleutels die in de dictionary staan, controleer hun gegevenstype en print de items die overeenkomen.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)

# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
  
  # Check if column name is dictionary of expected dtypes
  col_name = attribute_tuple[____]
  if col_name in ____:

    # Compare attribute types
    col_type = attribute_tuple[____]
    if col_type == validation_dict[____]:
      print(col_name + ' has expected dtype.')
Code bewerken en uitvoeren