ÎncepețiÎncepe gratuit

Regresia logistică și selecția caracteristicilor

În acest exercițiu vei aplica selecția caracteristicilor pe setul de date cu recenzii de filme, folosind regularizarea L1. Caracteristicile și valorile țintă sunt deja încărcate în X_train și y_train.

Vei căuta cea mai bună valoare a lui C folosind GridSearchCV() din scikit-learn, funcție prezentată în cursul prealabil.

Acest exercițiu face parte din cursul

Clasificatori liniari în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Instanțiază un obiect de regresie logistică care utilizează regularizarea L1.
  • Găsește valoarea lui C care minimizează eroarea de validare încrucișată.
  • Afișează numărul de caracteristici selectate pentru această valoare a lui C.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Specify L1 regularization
lr = LogisticRegression(solver='liblinear', ____)

# Instantiate the GridSearchCV object and run the search
searcher = GridSearchCV(lr, {'C':[0.001, 0.01, 0.1, 1, 10]})
searcher.fit(X_train, y_train)

# Report the best parameters
print("Best CV params", searcher.best_params_)

# Find the number of nonzero coefficients (selected features)
best_lr = searcher.best_estimator_
coefs = best_lr.____
print("Total number of features:", coefs.size)
print("Number of selected features:", np.count_nonzero(coefs))
Editează și rulează codul