Verifica dei DataType
Nell’era dei dati abbiamo accesso a più attributi che mai. Per gestirli tutti costruiremo molta automazione, ma è fondamentale che i relativi tipi di dato siano corretti. In questo esercizio valuteremo un dizionario di attributi e dei loro tipi di dato per verificare che siano corretti. Questo dizionario è salvato nella variabile validation_dict ed è disponibile nel tuo workspace.
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Usando
df, crea un elenco di tuple (attributo, tipo di dato) condtypeschiamatoactual_dtypes_list. - Itera su
actual_dtypes_list, verificando se i nomi delle colonne esistono nel dizionario dei tipi attesivalidation_dict. - Per le chiavi presenti nel dizionario, confronta i loro tipi di dato e stampa quelle che corrispondono.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)
# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
# Check if column name is dictionary of expected dtypes
col_name = attribute_tuple[____]
if col_name in ____:
# Compare attribute types
col_type = attribute_tuple[____]
if col_type == validation_dict[____]:
print(col_name + ' has expected dtype.')