Gegevenstypen verifiëren
In het datatijdperk hebben we toegang tot meer attributen dan ooit. Om die allemaal te verwerken bouwen we veel automatisering, maar minimaal moeten hun gegevenstypen kloppen. In deze oefening valideren we een dictionary met attributen en hun gegevenstypen om te zien of ze correct zijn. Deze dictionary staat in de variabele validation_dict en is beschikbaar in je werkruimte.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Maak met
dfeen lijst van tuples met attribuut en gegevenstype viadtypes, genaamdactual_dtypes_list. - Loop door
actual_dtypes_listen controleer of de kolomnamen bestaan in de dictionary met verwachte gegevenstypenvalidation_dict. - Voor de sleutels die in de dictionary staan, controleer hun gegevenstype en print de items die overeenkomen.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)
# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
# Check if column name is dictionary of expected dtypes
col_name = attribute_tuple[____]
if col_name in ____:
# Compare attribute types
col_type = attribute_tuple[____]
if col_type == validation_dict[____]:
print(col_name + ' has expected dtype.')