Перевірки якості даних
Як ви дізналися з попереднього відео, пропущені значення можуть призвести до втрати важливої інформації та потенційно до хибних інтерпретацій. Так само надійність вашої моделі може знижуватися через наявність нових, раніше не зустрінутих значень.
У цій вправі ваша мета — перевірити, чи містить набір даних про бронювання готелів пропущені значення, і виявити будь-які нові значення. Еталонний та аналітичний набори даних уже завантажено, так само як і бібліотеку nannyml.
Коротке нагадування: якщо ви не пам'ятаєте типи стовпців, ви можете швидко переглянути дані за допомогою методу .head().
Ця вправа є частиною курсу
Моніторинг Machine Learning у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()