Classificatore baseline con regressione logistica
Nelle ultime 2 lezioni hai visto quanto sia preziosa la selezione delle feature durante i colloqui di machine learning. Un altro gruppo di domande frequenti riguarda il feature engineering e come possa migliorare le prestazioni del modello.
In questo esercizio creerai una nuova feature sul dataset loan_data del Capitolo 1, confronterai l'accuracy di modelli di Regressione Logistica sul dataset prima e dopo il feature engineering, confrontando le etichette di test con i valori previsti della variabile target Loan Status.
Tutti i pacchetti pertinenti sono già stati importati per te: matplotlib.pyplot come plt, seaborn come sns, LogisticRegression da sklearn.linear_model, train_test_split da sklearn.model_selection e accuracy_score da sklearn.metrics.
Il feature engineering è considerato una fase di pre-processing prima del modelling:

Questo esercizio fa parte del corso
Esercitarsi con le domande di colloquio di Machine Learning in Python
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]
# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)
# Instantiate
logistic = ____()
# Fit
logistic.____(____, ____)
# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))