Crearea seturilor de antrenament și de testare
Tocmai ai antrenat modele LogisticRegression() pe diferite coloane.
Știi că datele trebuie împărțite în seturi de antrenament și de testare. train_test_split() este folosit pentru a le crea pe ambele simultan. Setul de antrenament este utilizat pentru a face predicții, în timp ce setul de testare este folosit pentru evaluare. Fără evaluarea modelului, nu ai cum să știi cât de bine va performa pe date noi de creditare.
Pe lângă intercept_, care este un atribut al modelului, modelele LogisticRegression() au și atributul .coef_. Acesta arată cât de importantă este fiecare coloană de antrenament pentru predicția probabilității de nerambursare.
Setul de date cr_loan_clean este deja încărcat în spațiul de lucru.
Acest exercițiu face parte din cursul
Modelarea Riscului de Credit în Python
Instrucțiuni pentru exercițiu
- Creează setul de date
Xfolosind rata dobânzii, durata angajării și venitul. Creează setulyfolosind statusul creditului. - Folosește
train_test_split()pentru a crea seturile de antrenament și de testare dinXșiy. - Creează și antrenează un model
LogisticRegression()și stochează-l caclf_logistic. - Afișează coeficienții modelului folosind
.coef_.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]
# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)
# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the models coefficients
print(____.coef_)