ПочатиПочніть безкоштовно

Розподіли train/test

На співбесіді з машинного навчання ви майже напевно працюватимете з тренувальними та тестовими даними. Як уже обговорювали, низька якість моделі можлива, якщо розподіли у тренувальному та тестовому наборах даних відрізняються.

У цій вправі ви скористаєтеся функціями з sklearn.model_selection, а також з seaborn і matplotlib.pyplot, щоб розбити loan_data на тренувальну та тестову вибірки й візуалізувати їхні розподіли, щоб виявити можливі розбіжності.

Зверніть увагу, що seaborn і matplotlib.pyplot вже імпортовано у ваш робочий простір і надано псевдоніми sns і plt відповідно.

Конвеєр тепер містить етап Train/Test split:

Machine learning pipeline

Ця вправа є частиною курсу

Практика співбесід з Machine Learning у Python

Переглянути курс

Інструкції до вправи

  • Залиште в loan_data лише ознаки Credit Score і Annual Income та цільову змінну Loan Status — у такому порядку.
  • Виконайте розбиття loan_data у пропорції 80/20 та присвойте результат до loan_data_subset.
  • Створіть pairplot для trainingSet і testSet (саме в такому порядку), встановивши аргумент hue на цільову змінну Loan Status.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
Редагувати та запускати код