การตรวจจับ Univariate Drift สำหรับชุดข้อมูลการจองโรงแรม
จากแบบฝึกหัดก่อนหน้า เราใช้วิธีตรวจจับ multivariate drift และพบว่าการเปลี่ยนแปลงของข้อมูลในเดือนมกราคมเป็นสาเหตุที่ทำให้เกิดการแจ้งเตือนในเมตริก ROC AUC และส่งผลให้โมเดลสร้างมูลค่าทางธุรกิจในเชิงลบ
ในแบบฝึกหัดนี้ จะได้ใช้วิธีตรวจจับ univariate drift เพื่อค้นหาฟีเจอร์และสาเหตุเบื้องหลังของ drift ที่เกิดขึ้น
ชุดข้อมูล reference และ analysis ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การติดตามตรวจสอบ Machine Learning ด้วย Python
คำแนะนำการฝึกหัด
- ระบุเมธอด Wasserstein และ Jensen-Shannon สำหรับตัวแปรต่อเนื่อง และ L-infinity กับ Chi2 สำหรับตัวแปรเชิงกลุ่ม
- Fit ข้อมูล reference และคำนวณผลลัพธ์บนชุดข้อมูล analysis
- พล็อตผลลัพธ์ที่ได้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Intialize the univariate drift calculator
uv_calc = nannyml.UnivariateDriftCalculator(
column_names=feature_column_names,
timestamp_column_name='timestamp',
chunk_period='m',
continuous_methods=[____, ____],
categorical_methods=[____, ____],
)
# Plot the results
uv_calc.____(reference)
uv_results = uv_calc.____(analysis)
____.____().____()