ÎncepețiÎncepe gratuit

Crearea seturilor de antrenament și de testare

Tocmai ai antrenat modele LogisticRegression() pe diferite coloane.

Știi că datele trebuie împărțite în seturi de antrenament și de testare. train_test_split() este folosit pentru a le crea pe ambele simultan. Setul de antrenament este utilizat pentru a face predicții, în timp ce setul de testare este folosit pentru evaluare. Fără evaluarea modelului, nu ai cum să știi cât de bine va performa pe date noi de creditare.

Pe lângă intercept_, care este un atribut al modelului, modelele LogisticRegression() au și atributul .coef_. Acesta arată cât de importantă este fiecare coloană de antrenament pentru predicția probabilității de nerambursare.

Setul de date cr_loan_clean este deja încărcat în spațiul de lucru.

Acest exercițiu face parte din cursul

Modelarea Riscului de Credit în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează setul de date X folosind rata dobânzii, durata angajării și venitul. Creează setul y folosind statusul creditului.
  • Folosește train_test_split() pentru a crea seturile de antrenament și de testare din X și y.
  • Creează și antrenează un model LogisticRegression() și stochează-l ca clf_logistic.
  • Afișează coeficienții modelului folosind .coef_.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]

# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)

# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))

# Print the models coefficients
print(____.coef_)
Editează și rulează codul