Точність після зменшення розмірності
Ви зменшите перенавчання за допомогою зниження розмірності. У цьому завданні ви застосуєте доволі радикальний підхід: виберете лише один стовпець, який добре допомагає розрізняти стать. Ви повторите поділ на тренувальну й тестову вибірки, навчання моделі та передбачення, щоб порівняти точність на тестових і тренувальних даних.
Усі потрібні пакети та y вже завантажено.
Ця вправа є частиною курсу
Зменшення розмірності в Python
Інструкції до вправи
- Виберіть лише стовпець обхвату шиї (
'neckcircumferencebase') зansur_df. - Розділіть дані, створіть екземпляр класифікатора та навчіть модель. Це вже зроблено за вас.
- Ще раз обчисліть показники точності для тренувальної та тестової вибірок.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Assign just the 'neckcircumferencebase' column from ansur_df to X
X = ansur_df[[____]]
# Split the data, instantiate a classifier and fit the data
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3)
svc = SVC()
svc.fit(X_train, y_train)
# Calculate accuracy scores on both train and test data
accuracy_train = accuracy_score(____, svc.predict(____))
accuracy_test = accuracy_score(____, svc.predict(____))
print(f"{accuracy_test:.1%} accuracy on test set vs. {accuracy_train:.1%} on training set")