Odfiltrování poškozených dat
Jedním z opakujících se kroků ve fázi transformace je čištění neúplných dat. V tomto cvičení se podíváš na data o kurzech v následujícím formátu:
| course_id | title | description | programming_language |
|---|---|---|---|
| 1 | Some Course | … | r |
Prozkoumáš tento DataFrame a pomocí metod .isnull().sum() z knihovny pandas ověříš, že v něm nechybí žádné hodnoty. Zjistíš, že sloupec programming_language některé chybějící hodnoty obsahuje.
Dokončíš proto funkci transform_fill_programming_language() tak, aby pomocí metody .fillna() chybějící hodnoty doplnila.
Toto cvičení je součástí kurzu
Introduction to Data Engineering
Pokyny k cvičení
- Vypiš počet chybějících hodnot v
course_data. - Chybějící hodnoty ve sloupci
programming_languagenahraď jazykem „R". - Vypiš počet chybějících hodnot pro každý sloupec ještě jednou, tentokrát pro
transformed.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
course_data = extract_course_data(db_engines)
# Print out the number of missing values per column
print(____.____().____())
# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
imputed = course_data.____({"programming_language": "____"})
return imputed
transformed = transform_fill_programming_language(course_data)
# Print out the number of missing values per column of transformed
print(____)