ПочатиПочніть безкоштовно

Відфільтруйте пошкоджені дані

Один із регулярних кроків на етапі трансформації — очищення неповних даних. У цій вправі ви працюватимете з даними про курси у такому форматі:

course_id title description programming_language
1 Some Course r

Ви перевірите цей датафрейм і переконаєтеся, що немає пропущених значень, використовуючи методи .isnull().sum() датафрейму pandas. Ви виявите, що у стовпці programming_language є пропущені значення.

Тому ви доповните функцію transform_fill_programming_language() методом .fillna(), щоб заповнити пропущені значення.

Ця вправа є частиною курсу

Вступ до Data Engineering

Переглянути курс

Інструкції до вправи

  • Виведіть кількість пропущених значень у course_data.
  • Пропущені значення в programming_language мають бути мовою "R".
  • Ще раз виведіть кількість пропущених значень по стовпцях, цього разу для transformed.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

course_data = extract_course_data(db_engines)

# Print out the number of missing values per column
print(____.____().____())

# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
    imputed = course_data.____({"programming_language": "____"})
    return imputed

transformed = transform_fill_programming_language(course_data)

# Print out the number of missing values per column of transformed
print(____)
Редагувати та запускати код