Определение пропущенных значений
Прежде чем заполнять пропущенные значения, необходимо выяснить, есть ли они в данных и из каких групп происходят.
В уже знакомом вам наборе данных restaurant_data один из сотрудников случайно удалил данные о чаевых для 65 столиков. Нужно выяснить, сколько пропущенных записей относится к столикам, за которыми курили, а сколько — к столикам для некурящих.
Ваша задача — сгруппировать оба набора данных по переменной smoker, подсчитать количество непропущенных значений в каждой группе, а затем найти разницу.
Мы заполняем пропущенные данные о чаевых исключительно в учебных целях. С этической точки зрения в реальной жизни этого делать не следует: подобные действия с финансовыми данными могут расцениваться как мошенничество.
Это упражнение является частью курса
Эффективная работа с pandas
Инструкции к упражнению
- Сгруппируйте данные по статусу курения.
- Подсчитайте количество непропущенных значений в каждой группе.
- Выведите количество пропущенных значений в каждой группе.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Group both objects according to smoke condition
restaurant_nan_grouped = restaurant_nan.____(____)
# Store the number of present values
restaurant_nan_nval = restaurant_nan_grouped['tip'].____()
# Print the group-wise missing entries
print(restaurant_nan_grouped['total_bill'].count() - ____)