Verificări ale calității datelor
Așa cum ai învățat în videoclipul anterior, valorile lipsă pot duce la pierderea unor informații valoroase și pot genera interpretări incorecte. În mod similar, prezența valorilor nevăzute poate afecta și ea nivelul de încredere al modelului.
În acest exercițiu, scopul tău este să explorezi dacă setul de date pentru rezervările hoteliere conține valori lipsă și să identifici eventuale valori nevăzute. Seturile de date de referință și de analiză sunt deja încărcate, împreună cu biblioteca nannyml.
O scurtă reamintire: dacă nu îți amintești tipurile coloanelor, poți explora cu ușurință datele folosind metoda .head().
Acest exercițiu face parte din cursul
Monitorizarea Machine Learning în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()