Datakvalitetskontroller
Som du lärde dig i föregående video kan saknade värden leda till förlust av värdefull information och potentiellt ge felaktiga tolkningar. På samma sätt kan förekomsten av osedda värden påverka modellens tillförlitlighet.
I den här övningen ska du undersöka om hotellbokningsdatamängden innehåller saknade värden och identifiera eventuella osedda värden. Referens- och analysdatamängderna är redan inlästa, tillsammans med biblioteket nannyml.
En snabb påminnelse: om du inte kommer ihåg kolumntyperna kan du enkelt utforska datan med metoden .head().
Den här övningen är en del av kursen
Övervakning av maskininlärning i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()