Zacznij terazZacznij za darmo

Odfiltruj uszkodzone dane

Jednym z często powtarzających się kroków w fazie transformacji jest czyszczenie niekompletnych danych. W tym ćwiczeniu przyjrzysz się danym o kursach, które mają następujący format:

course_id title description programming_language
1 Some Course r

Zbadasz ten DataFrame i upewnisz się, że nie zawiera brakujących wartości – użyjesz do tego metod .isnull().sum() dostępnych w DataFrame z biblioteki pandas. Okaże się, że kolumna programming_language zawiera pewne braki.

Dlatego uzupełnisz funkcję transform_fill_programming_language(), używając metody .fillna() do wypełnienia brakujących wartości.

To ćwiczenie jest częścią kursu

Wprowadzenie do inżynierii danych

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyświetl liczbę brakujących wartości w course_data.
  • Brakujące wartości w kolumnie programming_language powinny zostać uzupełnione językiem „R".
  • Wyświetl ponownie liczbę brakujących wartości dla każdej kolumny, tym razem dla obiektu transformed.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

course_data = extract_course_data(db_engines)

# Print out the number of missing values per column
print(____.____().____())

# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
    imputed = course_data.____({"programming_language": "____"})
    return imputed

transformed = transform_fill_programming_language(course_data)

# Print out the number of missing values per column of transformed
print(____)
Edytuj i uruchom kod