Bắt đầu ngayBắt đầu miễn phí

Drift trong bộ dữ liệu đặt phòng khách sạn

Ở chương trước, bạn đã tính giá trị kinh doanh và hiệu năng ROC AUC cho một mô hình dự đoán hủy đặt phòng. Bạn đã thấy một vài cảnh báo trên các biểu đồ kết quả, vì vậy bạn cần kiểm tra xem có drift trong dữ liệu phân tích hay không.

Trong bài tập này, bạn sẽ khởi tạo phương pháp phát hiện drift đa biến và so sánh kết quả của nó với kết quả hiệu năng đã tính ở chương trước.

StandardDeviationThreshold đã được nhập sẵn cùng với giá trị kinh doanh và kết quả ROC AUC được lưu trong biến perf_results, và feature_column_names cũng đã được định nghĩa.

Bài tập này là một phần của khóa học

Giám sát Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Khởi tạo phương pháp StandardDeviationThreshold và đặt std_lower_multiplier2std_upper_multiplier1.
  • Thêm các tên đặc trưng sau: country, lead_time, parking_spaces, và hotel. Giữ nguyên thứ tự này.
  • Truyền các ngưỡng và tên đặc trưng đã định nghĩa trước đó vào DataReconstructionDriftCalculator.
  • Hiển thị biểu đồ so sánh bao gồm cả kết quả phát hiện drift đa biến (mv_results) và kết quả hiệu năng (perf_results).

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)

# Define feature columns
feature_column_names = [____, ____, ____, ____]

# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
    column_names=____,
	threshold = ____,
    timestamp_column_name='timestamp',
    chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()
Chỉnh sửa và Chạy Mã