Verifiera datatyper
I dataåldern har vi tillgång till fler attribut än någonsin tidigare. För att hantera dem alla behöver vi bygga mycket automatisering – men som ett minimum krävs att deras datatyper är korrekta. I den här övningen validerar du en ordbok med attribut och deras datatyper för att kontrollera om de stämmer. Ordboken finns lagrad i variabeln validation_dict och är tillgänglig i din arbetsyta.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Använd
dfför att skapa en lista med tupler av attribut och datatyper med hjälp avdtypes. Kalla listanactual_dtypes_list. - Iterera genom
actual_dtypes_listoch kontrollera om kolumnnamnen finns i ordboken med förväntade datatyper,validation_dict. - För de nycklar som finns i ordboken, kontrollera deras datatyper och skriv ut de som matchar.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)
# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
# Check if column name is dictionary of expected dtypes
col_name = attribute_tuple[____]
if col_name in ____:
# Compare attribute types
col_type = attribute_tuple[____]
if col_type == validation_dict[____]:
print(col_name + ' has expected dtype.')