ПочатиПочніть безкоштовно

Перевірки якості даних

Як ви дізналися з попереднього відео, пропущені значення можуть призвести до втрати важливої інформації та потенційно до хибних інтерпретацій. Так само надійність вашої моделі може знижуватися через наявність нових, раніше не зустрінутих значень.

У цій вправі ваша мета — перевірити, чи містить набір даних про бронювання готелів пропущені значення, і виявити будь-які нові значення. Еталонний та аналітичний набори даних уже завантажено, так само як і бібліотеку nannyml.

Коротке нагадування: якщо ви не пам'ятаєте типи стовпців, ви можете швидко переглянути дані за допомогою методу .head().

Ця вправа є частиною курсу

Моніторинг Machine Learning у Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']

# Intialize missing values calculator
ms_calc = ____.____(
    ____=____,
    ____=____,
    timestamp_column_name='timestamp'
)

# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()
Редагувати та запускати код