Tworzenie zbiorów treningowego i testowego
Udało ci się wytrenować modele LogisticRegression() na różnych kolumnach.
Wiesz już, że dane należy podzielić na zbiór treningowy i testowy. Funkcja test_train_split() pozwala utworzyć oba zbiory jednocześnie. Zbiór treningowy służy do uczenia modelu, a testowy – do jego oceny. Bez ewaluacji nie ma możliwości sprawdzenia, jak dobrze model poradzi sobie z nowymi danymi kredytowymi.
Oprócz atrybutu intercept_ modele LogisticRegression() mają również atrybut .coef_. Pokazuje on, jak duży wpływ na przewidywanie prawdopodobieństwa niewykonania zobowiązania ma każda z kolumn treningowych.
Zbiór danych cr_loan_clean jest już wczytany do obszaru roboczego.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w Pythonie
Instrukcje do ćwiczenia
- Utwórz zbiór
Xz kolumnami: stopa procentowa, staż zatrudnienia i dochód. Utwórz zbióryz kolumną statusu kredytu. - Użyj funkcji
train_test_split(), aby podzielićXiyna zbiory treningowy i testowy. - Utwórz i wytrenuj model
LogisticRegression(), zapisując go jakoclf_logistic. - Wyświetl współczynniki modelu za pomocą
.coef_.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]
# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)
# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the models coefficients
print(____.coef_)