Inizia subitoInizia gratis

Classificatore baseline con regressione logistica

Nelle ultime 2 lezioni hai visto quanto sia preziosa la selezione delle feature durante i colloqui di machine learning. Un altro gruppo di domande frequenti riguarda il feature engineering e come possa migliorare le prestazioni del modello.

In questo esercizio creerai una nuova feature sul dataset loan_data del Capitolo 1, confronterai l'accuracy di modelli di Regressione Logistica sul dataset prima e dopo il feature engineering, confrontando le etichette di test con i valori previsti della variabile target Loan Status.

Tutti i pacchetti pertinenti sono già stati importati per te: matplotlib.pyplot come plt, seaborn come sns, LogisticRegression da sklearn.linear_model, train_test_split da sklearn.model_selection e accuracy_score da sklearn.metrics.

Il feature engineering è considerato una fase di pre-processing prima del modelling: Machine learning pipeline

Questo esercizio fa parte del corso

Esercitarsi con le domande di colloquio di Machine Learning in Python

Visualizza corso

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)

# Instantiate
logistic = ____()

# Fit
logistic.____(____, ____)

# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))
Modifica ed esegui il codice