Kom igångKom igång gratis

Verifiera datatyper

I dataåldern har vi tillgång till fler attribut än någonsin tidigare. För att hantera dem alla behöver vi bygga mycket automatisering – men som ett minimum krävs att deras datatyper är korrekta. I den här övningen validerar du en ordbok med attribut och deras datatyper för att kontrollera om de stämmer. Ordboken finns lagrad i variabeln validation_dict och är tillgänglig i din arbetsyta.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Använd df för att skapa en lista med tupler av attribut och datatyper med hjälp av dtypes. Kalla listan actual_dtypes_list.
  • Iterera genom actual_dtypes_list och kontrollera om kolumnnamnen finns i ordboken med förväntade datatyper, validation_dict.
  • För de nycklar som finns i ordboken, kontrollera deras datatyper och skriv ut de som matchar.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# create list of actual dtypes to check
actual_dtypes_list = df.____
print(actual_dtypes_list)

# Iterate through the list of actual dtypes tuples
for attribute_tuple in ____:
  
  # Check if column name is dictionary of expected dtypes
  col_name = attribute_tuple[____]
  if col_name in ____:

    # Compare attribute types
    col_type = attribute_tuple[____]
    if col_type == validation_dict[____]:
      print(col_name + ' has expected dtype.')
Redigera och kör kod