НачатьНачать бесплатно

Определение пропущенных значений

Прежде чем заполнять пропущенные значения, необходимо выяснить, есть ли они в данных и из каких групп происходят.

В уже знакомом вам наборе данных restaurant_data один из сотрудников случайно удалил данные о чаевых для 65 столиков. Нужно выяснить, сколько пропущенных записей относится к столикам, за которыми курили, а сколько — к столикам для некурящих.

Ваша задача — сгруппировать оба набора данных по переменной smoker, подсчитать количество непропущенных значений в каждой группе, а затем найти разницу.

Мы заполняем пропущенные данные о чаевых исключительно в учебных целях. С этической точки зрения в реальной жизни этого делать не следует: подобные действия с финансовыми данными могут расцениваться как мошенничество.

Это упражнение является частью курса

Эффективная работа с pandas

Посмотреть курс

Инструкции к упражнению

  • Сгруппируйте данные по статусу курения.
  • Подсчитайте количество непропущенных значений в каждой группе.
  • Выведите количество пропущенных значений в каждой группе.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Group both objects according to smoke condition
restaurant_nan_grouped = restaurant_nan.____(____)

# Store the number of present values
restaurant_nan_nval = restaurant_nan_grouped['tip'].____()

# Print the group-wise missing entries
print(restaurant_nan_grouped['total_bill'].count() - ____)
Редактировать и запускать код