Zacznij terazZacznij za darmo

Sprawdzanie jakości danych

Jak pokazano w poprzednim filmie, brakujące wartości mogą prowadzić do utraty cennych informacji i błędnych interpretacji. Podobnie, obecność nieznanych wartości może wpływać na pewność predykcji modelu.

W tym ćwiczeniu sprawdzisz, czy zbiór danych dotyczący rezerwacji hotelowych zawiera brakujące wartości, oraz zidentyfikujesz ewentualne nieznane wartości. Zbiory danych referencyjny i analityczny są już wczytane, podobnie jak biblioteka nannyml.

Przydatna wskazówka: jeśli nie pamiętasz typów kolumn, możesz je łatwo sprawdzić za pomocą metody .head().

To ćwiczenie jest częścią kursu

Monitorowanie uczenia maszynowego w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']

# Intialize missing values calculator
ms_calc = ____.____(
    ____=____,
    ____=____,
    timestamp_column_name='timestamp'
)

# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()
Edytuj i uruchom kod