शुरू करेंमुफ़्त में शुरू करें

K-fold क्रॉस-वैलिडेशन

आप सबसे अधिक इस्तेमाल होने वाली K-fold क्रॉस-वैलिडेशन में हाथ आज़माकर शुरुआत करेंगे.

जिस डेटा पर आप काम करेंगे वह Kaggle प्रतियोगिता "Two sigma connect: rental listing inquiries" से है. यह प्रतियोगिता समस्या रेंटल लिस्टिंग्स को 3 क्लास में वर्गीकृत करने की मल्टी-क्लास क्लासिफिकेशन है: low interest, medium interest और high interest. तेज़ परफॉर्मेंस के लिए, आप 1,000 observations वाले एक सबसैंपल पर काम करेंगे.

आपको K-fold वैलिडेशन स्ट्रैटेजी इम्प्लीमेंट करनी है और प्राप्त प्रत्येक फोल्ड के आकार देखने हैं. train DataFrame आपके वर्कस्पेस में पहले से मौजूद है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Kaggle प्रतियोगिता जीतना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • 3 फोल्ड के साथ एक KFold ऑब्जेक्ट बनाएँ.
  • kf ऑब्जेक्ट का उपयोग करके प्रत्येक स्प्लिट पर लूप चलाएँ.
  • हर स्प्लिट के लिए train_index और test_index का उपयोग करके training और testing फोल्ड्स चुनें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import KFold
from sklearn.model_selection import KFold

# Create a KFold object
kf = ____(n_splits=____, shuffle=True, random_state=123)

# Loop through each split
fold = 0
for train_index, test_index in ____.____(train):
    # Obtain training and testing folds
    cv_train, cv_test = train.iloc[____], train.iloc[____]
    print('Fold: {}'.format(fold))
    print('CV train shape: {}'.format(cv_train.shape))
    print('Medium interest listings in CV train: {}\n'.format(sum(cv_train.interest_level == 'medium')))
    fold += 1
कोड संपादित करें और चलाएँ