Rozdělení dat na trénovací a testovací sadu
Na pohovoru v oblasti Machine Learning se téměř jistě setkáš s trénovacími a testovacími daty. Jak jsme si zmínili dříve, pokud se jejich rozdělení liší, může to vést ke slabému výkonu modelu.
V tomto cvičení použiješ funkce z sklearn.model_selection spolu se seaborn a matplotlib.pyplot, abys rozdělil/a loan_data na trénovací a testovací sadu a vizualizoval/a jejich rozdělení — a mohl/a tak odhalit případné nesrovnalosti.
Všimni si, že seaborn a matplotlib.pyplot jsou do tvého pracovního prostředí již naimportované s aliasy sns, resp. plt.
Pipeline teď zahrnuje krok Train/Test split:

Toto cvičení je součástí kurzu
Procvičování otázek k pohovorům z oblasti Machine Learning v Pythonu
Pokyny k cvičení
- Z
loan_datavyber pouze příznakyCredit ScoreaAnnual Incomea cílovou proměnnouLoan Status— přesně v tomto pořadí. - Rozděl
loan_datav poměru 80/20 a výsledek přiřaď doloan_data_subset. - Vytvoř pairploty pro
trainingSetatestSet(v tomto pořadí) a nastav argumenthuena cílovou proměnnouLoan Status.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()