Phát hiện drift univariate cho bộ dữ liệu đặt phòng khách sạn
Trong các bài trước, bạn đã dùng phương pháp phát hiện drift đa biến (multivariate) để xác định rằng sự thay đổi dữ liệu vào tháng 1 là nguyên nhân dẫn đến cảnh báo ở chỉ số ROC AUC và giá trị kinh doanh âm của mô hình.
Trong bài này, bạn sẽ dùng phương pháp phát hiện drift univariate để tìm đặc trưng (feature) và lời giải thích đằng sau hiện tượng drift.
Các tập reference và analysis đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Giám sát Machine Learning bằng Python
Hướng dẫn bài tập
- Chỉ định phương pháp Wasserstein và Jensen-Shannon cho biến liên tục, và L-inifity và Chi2 cho biến phân loại.
- Fit trên tập reference và tính kết quả trên tập analysis.
- Vẽ biểu đồ kết quả.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Intialize the univariate drift calculator
uv_calc = nannyml.UnivariateDriftCalculator(
column_names=feature_column_names,
timestamp_column_name='timestamp',
chunk_period='m',
continuous_methods=[____, ____],
categorical_methods=[____, ____],
)
# Plot the results
uv_calc.____(reference)
uv_results = uv_calc.____(analysis)
____.____().____()