Виявлення пропущених значень
Перший крок перед імпутацією пропущених значень — з'ясувати, чи є пропуски в даних і, якщо є, з якої групи вони походять.
У вже знайомому вам наборі restaurant_data співробітник випадково стер чайові, залишені на 65 столах. Потрібно визначити, скільки пропущених записів припадає на столи, де були присутні курці, порівняно зі столами без курців.
Ваше завдання — згрупувати дані за змінною smoker, підрахувати кількість наявних (непропущених) значень, а потім обчислити різницю.
Ми виконуємо імпутацію чайових, щоб ви відпрацювали поняття з уроку. З етичного погляду в реальному житті не варто імпутувати фінансові дані, адже це може розцінюватися як шахрайство.
Ця вправа є частиною курсу
Ефективне програмування з pandas
Інструкції до вправи
- Згрупуйте дані за статусом куріння.
- Обчисліть кількість непропущених значень у кожній групі.
- Виведіть кількість пропущених значень у кожній групі.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Group both objects according to smoke condition
restaurant_nan_grouped = restaurant_nan.____(____)
# Store the number of present values
restaurant_nan_nval = restaurant_nan_grouped['tip'].____()
# Print the group-wise missing entries
print(restaurant_nan_grouped['total_bill'].count() - ____)