शुरू करेंमुफ़्त में शुरू करें

मशीन लर्निंग मॉडल की संरचना

अब आप समझ को मजबूत करेंगे कि डेटा मॉडल के प्रदर्शन को कैसे प्रभावित करता है। आप Airbnb बुकिंग डेटासेट (फ़ाइल booking.csv में) के साथ काम करेंगे। यह डेटासेट एक क्लासिफिकेशन टास्क के लिए उपयुक्त है, जिसमें यह भविष्यवाणी करनी है कि कोई बुकिंग रद्द करेगा या नहीं। इसमें कई संख्यात्मक और श्रेणीबद्ध कॉलम हैं। आप दिए गए डेटासेट को तीन परस्पर अनन्य सैंपल्स में बाँटेंगे — train_A.csv, train_B.csv, और test.csvsplit_dataset.py स्क्रिप्ट का उपयोग करके। आगे, प्रत्येक ट्रेनिंग डेटासेट के लिए, आप डेटा प्रोसेसिंग और मॉडल ट्रेनिंग पाइपलाइन चलाएँगे ताकि एक Random Forest Classifier मॉडल ट्रेन हो, और model_training.py का उपयोग करके टेस्ट सेट पर उसके प्रदर्शन का आकलन करें। params.json में परिभाषित हाइपरपैरामीटर्स दोनों रन में समान रहेंगे।

Python स्क्रिप्ट्स कमांड लाइन आर्ग्युमेंट्स स्वीकार करने और शेल के ज़रिए चलने के लिए बनाई गई हैं। अपनी समझ बढ़ाने के लिए आप इन स्क्रिप्ट्स को बेझिझक देखें।

यह अभ्यास पाठ्यक्रम का हिस्सा है

DVC के साथ डेटा वर्ज़निंग परिचय

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें

अभ्यास शुरू करें