ПочатиПочніть безкоштовно

Виявлення пропущених значень

Перший крок перед імпутацією пропущених значень — з'ясувати, чи є пропуски в даних і, якщо є, з якої групи вони походять.

У вже знайомому вам наборі restaurant_data співробітник випадково стер чайові, залишені на 65 столах. Потрібно визначити, скільки пропущених записів припадає на столи, де були присутні курці, порівняно зі столами без курців.

Ваше завдання — згрупувати дані за змінною smoker, підрахувати кількість наявних (непропущених) значень, а потім обчислити різницю.

Ми виконуємо імпутацію чайових, щоб ви відпрацювали поняття з уроку. З етичного погляду в реальному житті не варто імпутувати фінансові дані, адже це може розцінюватися як шахрайство.

Ця вправа є частиною курсу

Ефективне програмування з pandas

Переглянути курс

Інструкції до вправи

  • Згрупуйте дані за статусом куріння.
  • Обчисліть кількість непропущених значень у кожній групі.
  • Виведіть кількість пропущених значень у кожній групі.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Group both objects according to smoke condition
restaurant_nan_grouped = restaurant_nan.____(____)

# Store the number of present values
restaurant_nan_nval = restaurant_nan_grouped['tip'].____()

# Print the group-wise missing entries
print(restaurant_nan_grouped['total_bill'].count() - ____)
Редагувати та запускати код