НачатьНачать бесплатно

Распределения обучающей и тестовой выборок

На собеседовании по машинному обучению вам почти наверняка придётся работать с обучающими и тестовыми данными. Как уже обсуждалось ранее, если распределения обучающей и тестовой выборок существенно различаются, качество модели может снизиться.

В этом упражнении вы воспользуетесь функциями из sklearn.model_selection, а также библиотеками seaborn и matplotlib.pyplot, чтобы разделить loan_data на обучающую и тестовую выборки и визуализировать их распределения для выявления возможных расхождений.

Обратите внимание, что seaborn и matplotlib.pyplot уже импортированы в ваше рабочее пространство под псевдонимами sns и plt соответственно.

В пайплайн добавлен шаг Train/Test split:

Machine learning pipeline

Это упражнение является частью курса

Практика вопросов интервью по машинному обучению на Python

Посмотреть курс

Инструкции к упражнению

  • Отберите из loan_data только признаки Credit Score и Annual Income, а также целевую переменную Loan Status именно в таком порядке.
  • Разделите loan_data_subset в соотношении 80/20 и сохраните результат в соответствующие переменные.
  • Постройте pairplot для trainingSet и testSet (в том же порядке), задав аргумент hue равным целевой переменной Loan Status.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
Редактировать и запускать код