Acuratețe după reducerea dimensionalității
Vei reduce supraadaptarea cu ajutorul reducerii dimensionalității. În acest caz, vei aplica o formă destul de drastică de reducere a dimensionalității, selectând o singură coloană care conține informații utile pentru a distinge între sexe. Vei repeta pașii de împărțire a datelor, antrenare a modelului și predicție, pentru a compara acuratețea pe setul de testare față de cel de antrenament.
Toate pachetele relevante și y au fost preîncărcate.
Acest exercițiu face parte din cursul
Reducerea dimensionalității în Python
Instrucțiuni pentru exercițiu
- Selectează doar coloana circumferinței gâtului (
'neckcircumferencebase') dinansur_df. - Împarte datele, instanțiază un clasificator și antrenează modelul. Acest pas a fost deja realizat pentru tine.
- Calculează din nou scorurile de acuratețe atât pe setul de antrenament, cât și pe cel de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Assign just the 'neckcircumferencebase' column from ansur_df to X
X = ansur_df[[____]]
# Split the data, instantiate a classifier and fit the data
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3)
svc = SVC()
svc.fit(X_train, y_train)
# Calculate accuracy scores on both train and test data
accuracy_train = accuracy_score(____, svc.predict(____))
accuracy_test = accuracy_score(____, svc.predict(____))
print(f"{accuracy_test:.1%} accuracy on test set vs. {accuracy_train:.1%} on training set")