Regresia logistică și selecția caracteristicilor
În acest exercițiu vei aplica selecția caracteristicilor pe setul de date cu recenzii de filme, folosind regularizarea L1. Caracteristicile și valorile țintă sunt deja încărcate în X_train și y_train.
Vei căuta cea mai bună valoare a lui C folosind GridSearchCV() din scikit-learn, funcție prezentată în cursul prealabil.
Acest exercițiu face parte din cursul
Clasificatori liniari în Python
Instrucțiuni pentru exercițiu
- Instanțiază un obiect de regresie logistică care utilizează regularizarea L1.
- Găsește valoarea lui
Ccare minimizează eroarea de validare încrucișată. - Afișează numărul de caracteristici selectate pentru această valoare a lui
C.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Specify L1 regularization
lr = LogisticRegression(solver='liblinear', ____)
# Instantiate the GridSearchCV object and run the search
searcher = GridSearchCV(lr, {'C':[0.001, 0.01, 0.1, 1, 10]})
searcher.fit(X_train, y_train)
# Report the best parameters
print("Best CV params", searcher.best_params_)
# Find the number of nonzero coefficients (selected features)
best_lr = searcher.best_estimator_
coefs = best_lr.____
print("Total number of features:", coefs.size)
print("Number of selected features:", np.count_nonzero(coefs))