शुरू करेंमुफ़्त में शुरू करें

Train/test distributions

किसी मशीन लर्निंग इंटरव्यू में, आप निश्चित रूप से training data और test data के साथ काम करेंगे. जैसा कि पहले चर्चा हुई, अगर training और test डेटासेट्स के distributions अलग हों, तो मॉडल का प्रदर्शन खराब हो सकता है.

इस अभ्यास में, आप sklearn.model_selection के फंक्शंस के साथ-साथ seaborn और matplotlib.pyplot का उपयोग करके loan_data को training set और test set में बाँटेंगे, और उनकी distributions को विज़ुअलाइज़ करके किसी भी असंगति को पहचानेंगे.

ध्यान दें कि seaborn और matplotlib.pyplot पहले से ही आपके workspace में इम्पोर्ट होकर क्रमशः sns और plt के रूप में एलियस किए गए हैं.

पाइपलाइन अब Train/Test split शामिल करती है:

Machine learning pipeline

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Machine Learning इंटरव्यू प्रश्नों का अभ्यास

पाठ्यक्रम देखें

अभ्यास निर्देश

  • loan_data को केवल Credit Score और Annual Income फीचर्स, और टार्गेट वैरिएबल Loan Status तक सीमित करें — उसी क्रम में.
  • loan_data का 80/20 split बनाइए और उसे loan_data_subset में असाइन कीजिए.
  • trainingSet और testSet के pairplots बनाएँ (उसी क्रम में), जहाँ hue आर्ग्युमेंट को टार्गेट वैरिएबल Loan Status पर सेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
कोड संपादित करें और चलाएँ