Проверка качества данных
Как вы узнали из предыдущего видео, пропущенные значения могут приводить к потере важной информации и некорректным интерпретациям. Точно так же наличие ранее не встречавшихся значений способно негативно сказаться на уверенности модели.
В этом упражнении вам предстоит выяснить, содержит ли набор данных о бронировании отелей пропущенные значения, а также обнаружить любые ранее не встречавшиеся значения. Эталонный и анализируемый наборы данных уже загружены, как и библиотека nannyml.
Напоминаем: если вы не помните типы столбцов, можно легко изучить данные с помощью метода .head().
Это упражнение является частью курса
Мониторинг машинного обучения на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()