Розподіли train/test
На співбесіді з машинного навчання ви майже напевно працюватимете з тренувальними та тестовими даними. Як уже обговорювали, низька якість моделі можлива, якщо розподіли у тренувальному та тестовому наборах даних відрізняються.
У цій вправі ви скористаєтеся функціями з sklearn.model_selection, а також з seaborn і matplotlib.pyplot, щоб розбити loan_data на тренувальну та тестову вибірки й візуалізувати їхні розподіли, щоб виявити можливі розбіжності.
Зверніть увагу, що seaborn і matplotlib.pyplot вже імпортовано у ваш робочий простір і надано псевдоніми sns і plt відповідно.
Конвеєр тепер містить етап Train/Test split:

Ця вправа є частиною курсу
Практика співбесід з Machine Learning у Python
Інструкції до вправи
- Залиште в
loan_dataлише ознакиCredit ScoreіAnnual Incomeта цільову зміннуLoan Status— у такому порядку. - Виконайте розбиття
loan_dataу пропорції 80/20 та присвойте результат доloan_data_subset. - Створіть pairplot для
trainingSetіtestSet(саме в такому порядку), встановивши аргументhueна цільову зміннуLoan Status.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()