Wyodrębnianie parametru regresji logistycznej
Teraz przećwiczysz wyodrębnianie ważnego parametru modelu regresji logistycznej. Model ten posiada kilka innych parametrów, których tutaj nie omawiamy – możesz je sprawdzić w dokumentacji scikit-learn.org w sekcji 'Attributes' modułu LogisticRegression().
Omawiany parametr pomaga zrozumieć kierunek i siłę wpływu poszczególnych zmiennych na zmienną docelową.
W tym ćwiczeniu wyodrębnisz parametr współczynników (dostępny w atrybucie coef_), połączysz go z oryginalnymi nazwami kolumn i sprawdzisz, które zmienne miały największy dodatni wpływ na zmienną docelową.
Do dyspozycji masz:
- obiekt modelu regresji logistycznej o nazwie
log_reg_clf - DataFrame
X_train
Biblioteki sklearn i pandas zostały już zaimportowane.
To ćwiczenie jest częścią kursu
Strojenie hiperparametrów w Pythonie
Instrukcje do ćwiczenia
- Utwórz listę oryginalnych nazw kolumn użytych w zbiorze treningowym DataFrame.
- Wyodrębnij współczynniki estymatora regresji logistycznej.
- Utwórz DataFrame zawierający współczynniki i nazwy zmiennych, a następnie go wyświetl.
- Wyświetl 3 zmienne o największych dodatnich współczynnikach.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a list of original variable names from the training DataFrame
original_variables = ____
# Extract the coefficients of the logistic regression estimator
model_coefficients = ____.____[____]
# Create a dataframe of the variables and coefficients & print it out
coefficient_df = pd.DataFrame({"Variable" : ____, "Coefficient": ____})
print(coefficient_df)
# Print out the top 3 positive variables
top_three_df = coefficient_df.sort_values(by=____, axis=0, ascending=____)[0:____]
print(top_three_df)