Фильтрация некорректных данных
Один из часто повторяющихся шагов на этапе преобразования данных — это очистка неполных данных. В этом упражнении вы будете работать с данными о курсах в следующем формате:
| course_id | title | description | programming_language |
|---|---|---|---|
| 1 | Some Course | … | r |
Вам предстоит изучить этот DataFrame и убедиться в отсутствии пропущенных значений с помощью методов .isnull().sum() из библиотеки pandas. Вы обнаружите, что в столбце programming_language есть пропущенные значения.
Затем вы доработаете функцию transform_fill_programming_language(), используя метод .fillna() для заполнения этих пропусков.
Это упражнение является частью курса
Введение в дата-инжиниринг
Инструкции к упражнению
- Выведите количество пропущенных значений в
course_data. - Заполните пропущенные значения в столбце
programming_languageязыком "R". - Снова выведите количество пропущенных значений по каждому столбцу, на этот раз для
transformed.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
course_data = extract_course_data(db_engines)
# Print out the number of missing values per column
print(____.____().____())
# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
imputed = course_data.____({"programming_language": "____"})
return imputed
transformed = transform_fill_programming_language(course_data)
# Print out the number of missing values per column of transformed
print(____)