Sprawdzanie jakości danych
Jak pokazano w poprzednim filmie, brakujące wartości mogą prowadzić do utraty cennych informacji i błędnych interpretacji. Podobnie, obecność nieznanych wartości może wpływać na pewność predykcji modelu.
W tym ćwiczeniu sprawdzisz, czy zbiór danych dotyczący rezerwacji hotelowych zawiera brakujące wartości, oraz zidentyfikujesz ewentualne nieznane wartości. Zbiory danych referencyjny i analityczny są już wczytane, podobnie jak biblioteka nannyml.
Przydatna wskazówka: jeśli nie pamiętasz typów kolumn, możesz je łatwo sprawdzić za pomocą metody .head().
To ćwiczenie jest częścią kursu
Monitorowanie uczenia maszynowego w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()