Verificar tipos de datos
En la era de los datos tenemos acceso a más atributos que nunca. Para gestionarlos construiremos mucha automatización, pero como mínimo necesitamos que sus tipos de datos sean correctos. En este ejercicio validaremos un diccionario de atributos y sus tipos de datos para comprobar si son correctos. Este diccionario está almacenado en la variable validation_dict y está disponible en tu espacio de trabajo.
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- Con
df, crea una lista de tuplas atributo–tipo de dato usandodtypes, llamadaactual_dtypes_list. - Recorre
actual_dtypes_listy comprueba si los nombres de columna existen en el diccionario de tipos esperadosvalidation_dict. - Para las claves que existan en el diccionario, verifica sus tipos de datos e imprime las que coincidan.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)
# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
# Check if column name is dictionary of expected dtypes
col_name = attribute_tuple[____]
if col_name in ____:
# Compare attribute types
col_type = attribute_tuple[____]
if col_type == validation_dict[____]:
print(col_name + ' has expected dtype.')