Distribuțiile seturilor de antrenament și testare
Într-un interviu de machine learning, vei lucra cu siguranță cu date de antrenament și date de testare. Așa cum am discutat anterior, performanța slabă a modelului poate apărea atunci când distribuțiile seturilor de antrenament și testare diferă.
În acest exercițiu, vei folosi funcții din sklearn.model_selection, seaborn și matplotlib.pyplot pentru a împărți loan_data într-un set de antrenament și un set de testare, și pentru a vizualiza distribuțiile lor și a identifica eventuale discrepanțe.
Reține că seaborn și matplotlib.pyplot au fost deja importate în spațiul tău de lucru și aliasate ca sns, respectiv plt.
Pipeline-ul include acum pasul Train/Test split:

Acest exercițiu face parte din cursul
Exersează întrebări de interviu pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Selectează din
loan_datadoar caracteristicileCredit ScoreșiAnnual Income, și variabila țintăLoan Statusîn această ordine. - Creează o împărțire 80/20 a lui
loan_datași atribuie rezultatul variabileiloan_data_subset. - Creează pairplot-uri pentru
trainingSetșitestSet(în această ordine), setând argumentulhuela variabila țintăLoan Status.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()