Extrakce parametru logistické regrese
Teď si procvičíš extrakci důležitého parametru modelu logistické regrese. Logistická regrese má i několik dalších parametrů, které zde nebudeme zkoumat – najdeš je v dokumentaci na scikit-learn.org v sekci 'Attributes' u modulu LogisticRegression().
Tento parametr je klíčový pro pochopení směru a velikosti vlivu jednotlivých proměnných na cílovou proměnnou.
V tomto cvičení extrahujeme parametr koeficientů (uložený v atributu coef_), spojíme ho s původními názvy sloupců a zjistíme, které proměnné měly největší kladný vliv na cílovou proměnnou.
Budeš mít k dispozici:
- Objekt modelu logistické regrese pojmenovaný
log_reg_clf - DataFrame
X_train
sklearn a pandas jsou již naimportovány.
Toto cvičení je součástí kurzu
Hyperparameter Tuning in Python
Pokyny k cvičení
- Vytvoř seznam původních názvů sloupců použitých v trénovacím DataFrame.
- Extrahuj koeficienty estimátoru logistické regrese.
- Vytvoř DataFrame z koeficientů a názvů proměnných a zobraz ho.
- Vypiš 3 nejvýznamnější 'kladné' proměnné podle velikosti koeficientu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a list of original variable names from the training DataFrame
original_variables = ____
# Extract the coefficients of the logistic regression estimator
model_coefficients = ____.____[____]
# Create a dataframe of the variables and coefficients & print it out
coefficient_df = pd.DataFrame({"Variable" : ____, "Coefficient": ____})
print(coefficient_df)
# Print out the top 3 positive variables
top_three_df = coefficient_df.sort_values(by=____, axis=0, ascending=____)[0:____]
print(top_three_df)