Začněte nyníZačněte zdarma

Logistická regrese a výběr příznaků

V tomto cvičení provedeme výběr příznaků na datové sadě hodnocení filmových recenzí pomocí L1 regularizace. Příznaky a cílové hodnoty jsou už načtené v proměnných X_train a y_train.

Nejlepší hodnotu C budeme hledat pomocí GridSearchCV() ze scikit-learn, které jsme si ukázali v předchozím kurzu.

Toto cvičení je součástí kurzu

Linear Classifiers in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř objekt logistické regrese, který používá L1 regularizaci.
  • Najdi hodnotu C, která minimalizuje chybu při křížové validaci.
  • Vypiš počet vybraných příznaků pro tuto hodnotu C.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Specify L1 regularization
lr = LogisticRegression(solver='liblinear', ____)

# Instantiate the GridSearchCV object and run the search
searcher = GridSearchCV(lr, {'C':[0.001, 0.01, 0.1, 1, 10]})
searcher.fit(X_train, y_train)

# Report the best parameters
print("Best CV params", searcher.best_params_)

# Find the number of nonzero coefficients (selected features)
best_lr = searcher.best_estimator_
coefs = best_lr.____
print("Total number of features:", coefs.size)
print("Number of selected features:", np.count_nonzero(coefs))
Upravit a spustit kód