शुरू करेंमुफ़्त में शुरू करें

Under/Over-fitting से होने वाली Error

Candy डेटासेट overfitting के लिए बहुत अनुकूल है। केवल 85 observations होने पर, अगर आप 20% को testing डेटासेट के लिए अलग रखते हैं, तो modeling में काम आने वाला काफ़ी ज़रूरी डेटा खो जाता है। सोचिए, यदि ज्यादातर chocolate candies training डेटा में चली जाएँ और holdout sample में बहुत कम मिलें। हमारा मॉडल शायद केवल यह देखे कि chocolate एक अहम फ़ैक्टर है, लेकिन यह समझने में चूक जाए कि अन्य attributes भी महत्वपूर्ण हैं। इस अभ्यास में, आप देखेंगे कि random forest मॉडल में बहुत अधिक features (कॉलम) लेने से कैसे overfitting हो सकती है।

एक feature बताता है कि decision tree में डेटा के कौन-से कॉलम उपयोग होते हैं। पैरामीटर max_features उपलब्ध features की संख्या को सीमित करता है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Model Validation

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Update the rfr model
rfr = RandomForestRegressor(____=25,
                            ____=1111,
                            ____=2)
rfr.fit(X_train, y_train)

# Print the training and testing accuracies 
print('The training error is {0:.2f}'.format(
  mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
  mae(y_test, rfr.predict(X_test))))
कोड संपादित करें और चलाएँ