Odfiltruj uszkodzone dane
Jednym z często powtarzających się kroków w fazie transformacji jest czyszczenie niekompletnych danych. W tym ćwiczeniu przyjrzysz się danym o kursach, które mają następujący format:
| course_id | title | description | programming_language |
|---|---|---|---|
| 1 | Some Course | … | r |
Zbadasz ten DataFrame i upewnisz się, że nie zawiera brakujących wartości – użyjesz do tego metod .isnull().sum() dostępnych w DataFrame z biblioteki pandas. Okaże się, że kolumna programming_language zawiera pewne braki.
Dlatego uzupełnisz funkcję transform_fill_programming_language(), używając metody .fillna() do wypełnienia brakujących wartości.
To ćwiczenie jest częścią kursu
Wprowadzenie do inżynierii danych
Instrukcje do ćwiczenia
- Wyświetl liczbę brakujących wartości w
course_data. - Brakujące wartości w kolumnie
programming_languagepowinny zostać uzupełnione językiem „R". - Wyświetl ponownie liczbę brakujących wartości dla każdej kolumny, tym razem dla obiektu
transformed.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
course_data = extract_course_data(db_engines)
# Print out the number of missing values per column
print(____.____().____())
# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
imputed = course_data.____({"programming_language": "____"})
return imputed
transformed = transform_fill_programming_language(course_data)
# Print out the number of missing values per column of transformed
print(____)