Vytvoření trénovací a testovací sady
Právě jsi trénoval/a modely LogisticRegression() na různých sloupcích.
Data by měla být rozdělena na trénovací a testovací sadu. Funkce test_train_split() vytvoří obě najednou. Trénovací sada slouží k učení modelu, zatímco testovací sada se používá k jeho vyhodnocení. Bez vyhodnocení nelze říct, jak dobře bude model fungovat na nových úvěrových datech.
Kromě atributu intercept_ mají modely LogisticRegression() také atribut .coef_. Ten ukazuje, jak důležitý je každý trénovací sloupec pro předpověď pravděpodobnosti nesplácení.
Dataset cr_loan_clean je již načten v pracovním prostředí.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Vytvoř dataset
Xs použitím úrokové sazby, délky zaměstnání a příjmu. Datasetyvytvoř ze stavu úvěru. - Pomocí
train_test_split()vytvoř trénovací a testovací sady zXay. - Vytvoř a natrénuj model
LogisticRegression()a ulož ho jakoclf_logistic. - Vypiš koeficienty modelu pomocí
.coef_.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]
# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)
# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the models coefficients
print(____.coef_)