Začněte nyníZačněte zdarma

Kontrola kvality dat

Jak ses dozvěděl/a v předchozím videu, chybějící hodnoty mohou vést ke ztrátě cenných informací a potenciálně i k nesprávným interpretacím. Podobně může přítomnost neznámých hodnot ovlivnit spolehlivost tvého modelu.

V tomto cvičení je tvým cílem prozkoumat, zda dataset hotelových rezervací obsahuje chybějící hodnoty, a identifikovat případné neznámé hodnoty. Referenční i analytický dataset jsou již načteny spolu s knihovnou nannyml.

Rychlá připomínka: pokud si nepamatuješ typy sloupců, snadno si data prohlédneš pomocí metody .head().

Toto cvičení je součástí kurzu

Monitoring Machine Learning in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']

# Intialize missing values calculator
ms_calc = ____.____(
    ____=____,
    ____=____,
    timestamp_column_name='timestamp'
)

# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()
Upravit a spustit kód