CommencezCommencez gratuitement

Précision après réduction de la dimensionnalité

Vous allez réduire le surapprentissage à l'aide de la réduction de la dimensionnalité. Ici, vous appliquerez une forme plutôt radicale de réduction en ne sélectionnant qu'une seule colonne qui contient suffisamment d'information pour distinguer les genres. Vous répéterez la séparation entraînement-test, l'ajustement du modèle et les prédictions afin de comparer la précision sur les données de test par rapport à l'entraînement.

Tous les modules pertinents et y ont été préchargés.

Cette activité fait partie du cours

Réduction de dimensionnalité en Python

Voir le cours

Instructions de l’exercice

  • Sélectionnez uniquement la circonférence du cou ('neckcircumferencebase') à partir de ansur_df.
  • Séparez les données, instanciez un classificateur et ajustez le modèle. Cela a été fait pour vous.
  • Calculez de nouveau les scores de précision sur l'ensemble d'entraînement et sur l'ensemble de test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Assign just the 'neckcircumferencebase' column from ansur_df to X
X = ansur_df[[____]]

# Split the data, instantiate a classifier and fit the data
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3)
svc = SVC()
svc.fit(X_train, y_train)

# Calculate accuracy scores on both train and test data
accuracy_train = accuracy_score(____, svc.predict(____))
accuracy_test = accuracy_score(____, svc.predict(____))

print(f"{accuracy_test:.1%} accuracy on test set vs. {accuracy_train:.1%} on training set")
Modifier et exécuter le code