เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Drift ในชุดข้อมูลการจองโรงแรม

ในบทก่อนหน้า คุณได้คำนวณมูลค่าทางธุรกิจและประสิทธิภาพ ROC AUC ของโมเดลที่ทำนายการยกเลิกการจอง และพบการแจ้งเตือนบางส่วนในกราฟที่ได้ ซึ่งทำให้ต้องตรวจสอบว่ามี drift เกิดขึ้นในข้อมูลการวิเคราะห์หรือไม่

ในแบบฝึกหัดนี้ จะได้ initialize วิธีการตรวจจับ multivariate drift และเปรียบเทียบผลลัพธ์กับผลประสิทธิภาพที่คำนวณไว้ในบทก่อนหน้า

StandardDeviationThreshold ถูก import ไว้แล้ว พร้อมกับผลลัพธ์ด้านมูลค่าทางธุรกิจและ ROC AUC ที่เก็บอยู่ในตัวแปร perf_results และ feature_column_names ที่กำหนดไว้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การติดตามตรวจสอบ Machine Learning ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Initialize เมธอด StandardDeviationThreshold และตั้งค่าพารามิเตอร์ std_lower_multiplier เป็น 2 และ std_upper_multiplier เป็น 1
  • เพิ่มชื่อฟีเจอร์ต่อไปนี้ตามลำดับ: country, lead_time, parking_spaces และ hotel
  • ส่ง threshold และชื่อฟีเจอร์ที่กำหนดไว้ก่อนหน้าไปยัง DataReconstructionDriftCalculator
  • แสดงกราฟเปรียบเทียบที่รวมทั้งผลลัพธ์การตรวจจับ multivariate drift (mv_results) และผลลัพธ์ประสิทธิภาพ (perf_results)

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)

# Define feature columns
feature_column_names = [____, ____, ____, ____]

# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
    column_names=____,
	threshold = ____,
    timestamp_column_name='timestamp',
    chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()
แก้ไขและรันโค้ด