Kontrola kvality dat
Jak ses dozvěděl/a v předchozím videu, chybějící hodnoty mohou vést ke ztrátě cenných informací a potenciálně i k nesprávným interpretacím. Podobně může přítomnost neznámých hodnot ovlivnit spolehlivost tvého modelu.
V tomto cvičení je tvým cílem prozkoumat, zda dataset hotelových rezervací obsahuje chybějící hodnoty, a identifikovat případné neznámé hodnoty. Referenční i analytický dataset jsou již načteny spolu s knihovnou nannyml.
Rychlá připomínka: pokud si nepamatuješ typy sloupců, snadno si data prohlédneš pomocí metody .head().
Toto cvičení je součástí kurzu
Monitoring Machine Learning in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()