Распределения обучающей и тестовой выборок
На собеседовании по машинному обучению вам почти наверняка придётся работать с обучающими и тестовыми данными. Как уже обсуждалось ранее, если распределения обучающей и тестовой выборок существенно различаются, качество модели может снизиться.
В этом упражнении вы воспользуетесь функциями из sklearn.model_selection, а также библиотеками seaborn и matplotlib.pyplot, чтобы разделить loan_data на обучающую и тестовую выборки и визуализировать их распределения для выявления возможных расхождений.
Обратите внимание, что seaborn и matplotlib.pyplot уже импортированы в ваше рабочее пространство под псевдонимами sns и plt соответственно.
В пайплайн добавлен шаг Train/Test split:

Это упражнение является частью курса
Практика вопросов интервью по машинному обучению на Python
Инструкции к упражнению
- Отберите из
loan_dataтолько признакиCredit ScoreиAnnual Income, а также целевую переменнуюLoan Statusименно в таком порядке. - Разделите
loan_data_subsetв соотношении 80/20 и сохраните результат в соответствующие переменные. - Постройте pairplot для
trainingSetиtestSet(в том же порядке), задав аргументhueравным целевой переменнойLoan Status.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()