Začněte nyníZačněte zdarma

Vytvoření trénovací a testovací sady

Právě jsi trénoval/a modely LogisticRegression() na různých sloupcích.

Data by měla být rozdělena na trénovací a testovací sadu. Funkce test_train_split() vytvoří obě najednou. Trénovací sada slouží k učení modelu, zatímco testovací sada se používá k jeho vyhodnocení. Bez vyhodnocení nelze říct, jak dobře bude model fungovat na nových úvěrových datech.

Kromě atributu intercept_ mají modely LogisticRegression() také atribut .coef_. Ten ukazuje, jak důležitý je každý trénovací sloupec pro předpověď pravděpodobnosti nesplácení.

Dataset cr_loan_clean je již načten v pracovním prostředí.

Toto cvičení je součástí kurzu

Credit Risk Modeling in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř dataset X s použitím úrokové sazby, délky zaměstnání a příjmu. Dataset y vytvoř ze stavu úvěru.
  • Pomocí train_test_split() vytvoř trénovací a testovací sady z X a y.
  • Vytvoř a natrénuj model LogisticRegression() a ulož ho jako clf_logistic.
  • Vypiš koeficienty modelu pomocí .coef_.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]

# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)

# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))

# Print the models coefficients
print(____.coef_)
Upravit a spustit kód