Začněte nyníZačněte zdarma

Odfiltrování poškozených dat

Jedním z opakujících se kroků ve fázi transformace je čištění neúplných dat. V tomto cvičení se podíváš na data o kurzech v následujícím formátu:

course_id title description programming_language
1 Some Course r

Prozkoumáš tento DataFrame a pomocí metod .isnull().sum() z knihovny pandas ověříš, že v něm nechybí žádné hodnoty. Zjistíš, že sloupec programming_language některé chybějící hodnoty obsahuje.

Dokončíš proto funkci transform_fill_programming_language() tak, aby pomocí metody .fillna() chybějící hodnoty doplnila.

Toto cvičení je součástí kurzu

Introduction to Data Engineering

Zobrazit kurz

Pokyny k cvičení

  • Vypiš počet chybějících hodnot v course_data.
  • Chybějící hodnoty ve sloupci programming_language nahraď jazykem „R".
  • Vypiš počet chybějících hodnot pro každý sloupec ještě jednou, tentokrát pro transformed.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

course_data = extract_course_data(db_engines)

# Print out the number of missing values per column
print(____.____().____())

# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
    imputed = course_data.____({"programming_language": "____"})
    return imputed

transformed = transform_fill_programming_language(course_data)

# Print out the number of missing values per column of transformed
print(____)
Upravit a spustit kód