НачатьНачать бесплатно

Фильтрация некорректных данных

Один из часто повторяющихся шагов на этапе преобразования данных — это очистка неполных данных. В этом упражнении вы будете работать с данными о курсах в следующем формате:

course_id title description programming_language
1 Some Course r

Вам предстоит изучить этот DataFrame и убедиться в отсутствии пропущенных значений с помощью методов .isnull().sum() из библиотеки pandas. Вы обнаружите, что в столбце programming_language есть пропущенные значения.

Затем вы доработаете функцию transform_fill_programming_language(), используя метод .fillna() для заполнения этих пропусков.

Это упражнение является частью курса

Введение в дата-инжиниринг

Посмотреть курс

Инструкции к упражнению

  • Выведите количество пропущенных значений в course_data.
  • Заполните пропущенные значения в столбце programming_language языком "R".
  • Снова выведите количество пропущенных значений по каждому столбцу, на этот раз для transformed.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

course_data = extract_course_data(db_engines)

# Print out the number of missing values per column
print(____.____().____())

# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
    imputed = course_data.____({"programming_language": "____"})
    return imputed

transformed = transform_fill_programming_language(course_data)

# Print out the number of missing values per column of transformed
print(____)
Редактировать и запускать код