ホテル予約データセットの単変量ドリフト検出
前の演習では、多変量ドリフト検出メソッドを使って、1月のデータシフトが ROC AUC 指標のアラートとモデルのビジネス価値の低下を引き起こしていることを確認しました。
この演習では、単変量ドリフト検出メソッドを用いて、ドリフトの原因となっている特徴量とその理由を特定します。
reference と analysis の各セットはすでに読み込まれています。
この演習はコースの一部です
Pythonで学ぶ機械学習のモニタリング
演習の手順
- 連続値には Wasserstein と Jensen-Shannon、カテゴリ変数には L-infinity と Chi2 を指定します。
- reference に対して学習し、analysis セットで結果を計算します。
- 結果をプロットします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Intialize the univariate drift calculator
uv_calc = nannyml.UnivariateDriftCalculator(
column_names=feature_column_names,
timestamp_column_name='timestamp',
chunk_period='m',
continuous_methods=[____, ____],
categorical_methods=[____, ____],
)
# Plot the results
uv_calc.____(reference)
uv_results = uv_calc.____(analysis)
____.____().____()