Drift ในชุดข้อมูลการจองโรงแรม
ในบทก่อนหน้า คุณได้คำนวณมูลค่าทางธุรกิจและประสิทธิภาพ ROC AUC ของโมเดลที่ทำนายการยกเลิกการจอง และพบการแจ้งเตือนบางส่วนในกราฟที่ได้ ซึ่งทำให้ต้องตรวจสอบว่ามี drift เกิดขึ้นในข้อมูลการวิเคราะห์หรือไม่
ในแบบฝึกหัดนี้ จะได้ initialize วิธีการตรวจจับ multivariate drift และเปรียบเทียบผลลัพธ์กับผลประสิทธิภาพที่คำนวณไว้ในบทก่อนหน้า
StandardDeviationThreshold ถูก import ไว้แล้ว พร้อมกับผลลัพธ์ด้านมูลค่าทางธุรกิจและ ROC AUC ที่เก็บอยู่ในตัวแปร perf_results และ feature_column_names ที่กำหนดไว้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การติดตามตรวจสอบ Machine Learning ด้วย Python
คำแนะนำการฝึกหัด
- Initialize เมธอด
StandardDeviationThresholdและตั้งค่าพารามิเตอร์std_lower_multiplierเป็น2และstd_upper_multiplierเป็น1 - เพิ่มชื่อฟีเจอร์ต่อไปนี้ตามลำดับ:
country,lead_time,parking_spacesและhotel - ส่ง threshold และชื่อฟีเจอร์ที่กำหนดไว้ก่อนหน้าไปยัง
DataReconstructionDriftCalculator - แสดงกราฟเปรียบเทียบที่รวมทั้งผลลัพธ์การตรวจจับ multivariate drift (
mv_results) และผลลัพธ์ประสิทธิภาพ (perf_results)
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)
# Define feature columns
feature_column_names = [____, ____, ____, ____]
# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
column_names=____,
threshold = ____,
timestamp_column_name='timestamp',
chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()