Wielowymiarowa regresja logistyczna
Zazwyczaj do przewidywania prawdopodobieństwa niewywiązania się ze spłaty nie używa się wyłącznie loan_int_rate. Warto wykorzystać wszystkie dostępne dane, aby uzyskać jak najlepsze prognozy.
Mając to na uwadze, spróbuj wytrenować nowy model, korzystając z różnych kolumn – zwanych cechami – ze zbioru danych cr_loan_clean. Czy ten model będzie się różnić od poprzedniego? Łatwo to sprawdzić, porównując wartość .intercept_ regresji logistycznej. Pamiętaj, że jest to punkt przecięcia funkcji z osią Y oraz ogólny log-odds braku niewywiązania się ze spłaty.
Zbiór danych cr_loan_clean został wczytany do środowiska pracy wraz z poprzednim modelem clf_logistic_single.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w Pythonie
Instrukcje do ćwiczenia
- Utwórz nowy zbiór danych
Xz kolumnamiloan_int_rateiperson_emp_length. Zapisz go jakoX_multi. - Utwórz zbiór danych
yzawierający tylko kolumnęloan_status. - Utwórz model
LogisticRegression()i dopasuj go do nowego zbioruXza pomocą metody.fit(). Zapisz model jakoclf_logistic_multi. - Wyświetl wartość
.intercept_modelu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create X data for the model
X_multi = ____[[____,____]]
# Create a set of y data for training
y = ____[[____]]
# Create and train a new logistic regression
clf_logistic_multi = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the intercept of the model
print(____.____)