データ品質チェック
前の動画で学んだとおり、欠損値は有用な情報の損失を招き、誤った解釈につながる可能性があります。同様に、未出現値(これまでに見たことのない値)の存在もモデルの信頼性に影響します。
この演習では、ホテル予約のデータセットに欠損値が含まれているかを調べ、未出現値がないかを特定します。参照用データセットと分析用データセットはすでに読み込まれており、nannyml ライブラリも利用できます。
補足として、列の型を思い出せない場合は、.head() メソッドで簡単にデータを確認できます。
この演習はコースの一部です
Pythonで学ぶ機械学習のモニタリング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()