資料品質檢查
就像你在前一部影片所學到的,遺漏值會導致資訊流失,甚至可能造成錯誤的解讀。同樣地,出現未見過的值也會影響模型的信心。
在這個練習中,你的目標是檢查飯店訂房資料集中是否包含遺漏值,並找出任何未見過的值。參考與分析資料集都已經載入,nannyml 套件也已可使用。
快速提醒一下,如果你不記得欄位型別,可以用 .head() 方法輕鬆瀏覽資料。
本練習屬於課程
在 Python 中監控 Machine Learning
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()