Rozkłady danych treningowych i testowych
Na rozmowie rekrutacyjnej dotyczącej uczenia maszynowego niemal na pewno będziesz pracować z danymi treningowymi i testowymi. Jak wspominaliśmy wcześniej, jeśli rozkłady tych zbiorów się różnią, model może działać słabiej niż oczekujemy.
W tym ćwiczeniu użyjesz funkcji z biblioteki sklearn.model_selection oraz bibliotek seaborn i matplotlib.pyplot, aby podzielić zbiór loan_data na zbiór treningowy i testowy, a następnie zwizualizować ich rozkłady i sprawdzić ewentualne rozbieżności.
Zauważ, że biblioteki seaborn i matplotlib.pyplot zostały już zaimportowane do środowiska pracy i mają aliasy odpowiednio sns i plt.
Potok przetwarzania danych zawiera teraz krok Train/Test split:

To ćwiczenie jest częścią kursu
Ćwiczenie pytań rekrutacyjnych z uczenia maszynowego w Pythonie
Instrukcje do ćwiczenia
- Ogranicz zbiór
loan_datado cechCredit ScoreiAnnual Incomeoraz zmiennej docelowejLoan Status– dokładnie w tej kolejności. - Podziel zbiór
loan_dataw proporcji 80/20 i przypisz wynik do zmiennejloan_data_subset. - Utwórz pairploty dla zbiorów
trainingSetitestSet(w tej kolejności), ustawiając argumenthuena zmienną docelowąLoan Status.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()