НачатьНачать бесплатно

Проверка качества данных

Как вы узнали из предыдущего видео, пропущенные значения могут приводить к потере важной информации и некорректным интерпретациям. Точно так же наличие ранее не встречавшихся значений способно негативно сказаться на уверенности модели.

В этом упражнении вам предстоит выяснить, содержит ли набор данных о бронировании отелей пропущенные значения, а также обнаружить любые ранее не встречавшиеся значения. Эталонный и анализируемый наборы данных уже загружены, как и библиотека nannyml.

Напоминаем: если вы не помните типы столбцов, можно легко изучить данные с помощью метода .head().

Это упражнение является частью курса

Мониторинг машинного обучения на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']

# Intialize missing values calculator
ms_calc = ____.____(
    ____=____,
    ____=____,
    timestamp_column_name='timestamp'
)

# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()
Редактировать и запускать код