Regresión logística y selección de características
En este ejercicio vamos a realizar selección de características en el conjunto de datos de sentimiento de reseñas de películas usando regularización L1. Las características y los objetivos ya están cargados para ti en X_train y y_train.
Buscaremos el mejor valor de C usando GridSearchCV() de scikit-learn, que se vio en el curso prerrequisito.
Este ejercicio forma parte del curso
Clasificadores lineales en Python
Instrucciones del ejercicio
- Instancia un objeto de regresión logística que use regularización L1.
- Encuentra el valor de
Cque minimiza el error de validación cruzada. - Imprime el número de características seleccionadas para ese valor de
C.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Specify L1 regularization
lr = LogisticRegression(solver='liblinear', ____)
# Instantiate the GridSearchCV object and run the search
searcher = GridSearchCV(lr, {'C':[0.001, 0.01, 0.1, 1, 10]})
searcher.fit(X_train, y_train)
# Report the best parameters
print("Best CV params", searcher.best_params_)
# Find the number of nonzero coefficients (selected features)
best_lr = searcher.best_estimator_
coefs = best_lr.____
print("Total number of features:", coefs.size)
print("Number of selected features:", np.count_nonzero(coefs))