Train/test distributions
किसी मशीन लर्निंग इंटरव्यू में, आप निश्चित रूप से training data और test data के साथ काम करेंगे. जैसा कि पहले चर्चा हुई, अगर training और test डेटासेट्स के distributions अलग हों, तो मॉडल का प्रदर्शन खराब हो सकता है.
इस अभ्यास में, आप sklearn.model_selection के फंक्शंस के साथ-साथ seaborn और matplotlib.pyplot का उपयोग करके loan_data को training set और test set में बाँटेंगे, और उनकी distributions को विज़ुअलाइज़ करके किसी भी असंगति को पहचानेंगे.
ध्यान दें कि seaborn और matplotlib.pyplot पहले से ही आपके workspace में इम्पोर्ट होकर क्रमशः sns और plt के रूप में एलियस किए गए हैं.
पाइपलाइन अब Train/Test split शामिल करती है:

यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Machine Learning इंटरव्यू प्रश्नों का अभ्यास
अभ्यास निर्देश
loan_dataको केवलCredit ScoreऔरAnnual Incomeफीचर्स, और टार्गेट वैरिएबलLoan Statusतक सीमित करें — उसी क्रम में.loan_dataका 80/20 split बनाइए और उसेloan_data_subsetमें असाइन कीजिए.trainingSetऔरtestSetके pairplots बनाएँ (उसी क्रम में), जहाँhueआर्ग्युमेंट को टार्गेट वैरिएबलLoan Statusपर सेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()