Відфільтруйте пошкоджені дані
Один із регулярних кроків на етапі трансформації — очищення неповних даних. У цій вправі ви працюватимете з даними про курси у такому форматі:
| course_id | title | description | programming_language |
|---|---|---|---|
| 1 | Some Course | … | r |
Ви перевірите цей датафрейм і переконаєтеся, що немає пропущених значень, використовуючи методи .isnull().sum() датафрейму pandas. Ви виявите, що у стовпці programming_language є пропущені значення.
Тому ви доповните функцію transform_fill_programming_language() методом .fillna(), щоб заповнити пропущені значення.
Ця вправа є частиною курсу
Вступ до Data Engineering
Інструкції до вправи
- Виведіть кількість пропущених значень у
course_data. - Пропущені значення в
programming_languageмають бути мовою "R". - Ще раз виведіть кількість пропущених значень по стовпцях, цього разу для
transformed.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
course_data = extract_course_data(db_engines)
# Print out the number of missing values per column
print(____.____().____())
# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
imputed = course_data.____({"programming_language": "____"})
return imputed
transformed = transform_fill_programming_language(course_data)
# Print out the number of missing values per column of transformed
print(____)