शुरू करेंमुफ़्त में शुरू करें

होटल बुकिंग डेटासेट में ड्रिफ्ट

पिछले अध्याय में, आपने उस मॉडल के लिए बिज़नेस वैल्यू और ROC AUC परफॉर्मेंस की गणना की थी जो बुकिंग कैंसलेशंस की भविष्यवाणी करता है. प्राप्त प्लॉट्स में आपको कुछ अलर्ट दिखाई दिए, इसलिए अब आपको विश्लेषण डेटा में ड्रिफ्ट की मौजूदगी की जाँच करनी है.

इस अभ्यास में, आप मल्टीवेरिएट ड्रिफ्ट डिटेक्शन मेथड को इनिशियलाइज़ करेंगे और इसके नतीजों की तुलना पिछले अध्याय में निकाले गए परफॉर्मेंस रिज़ल्ट्स से करेंगे.

StandardDeviationThreshold पहले से इम्पोर्ट किया गया है, साथ ही बिज़नेस वैल्यू और ROC AUC रिज़ल्ट्स perf_results वैरिएबल में स्टोर हैं और feature_column_names पहले से परिभाषित है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में मशीन लर्निंग मॉनिटरिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • StandardDeviationThreshold मेथड को इनिशियलाइज़ करें और std_lower_multiplier को 2 तथा std_upper_multiplier पैरामीटर को 1 सेट करें.
  • निम्न फीचर नाम जोड़ें: country, lead_time, parking_spaces, और hotel. इनका क्रम यथावत रखें.
  • पहले से परिभाषित thresholds और फीचर नाम DataReconstructionDriftCalculator को पास करें.
  • वह तुलना प्लॉट दिखाएँ जिसमें मल्टीवेरिएट ड्रिफ्ट डिटेक्शन के नतीजे (mv_results) और परफॉर्मेंस रिज़ल्ट्स (perf_results) दोनों शामिल हों.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)

# Define feature columns
feature_column_names = [____, ____, ____, ____]

# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
    column_names=____,
	threshold = ____,
    timestamp_column_name='timestamp',
    chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()
कोड संपादित करें और चलाएँ