Classifieur de base en régression logistique
Dans les 2 dernières leçons, vous avez vu à quel point la sélection d'attributs est utile dans le contexte des entrevues en Machine Learning. Un autre ensemble de questions fréquentes porte sur l'ingénierie des variables et sur la façon dont elle aide à améliorer la performance des modèles.
Dans cet exercice, vous allez créer une nouvelle variable dans le jeu de données loan_data du chapitre 1, puis comparer le score de justesse de modèles de régression logistique sur le jeu de données avant et après l'ingénierie de variables, en comparant les étiquettes de test aux valeurs prédites de la variable cible Loan Status.
Tous les modules pertinents ont déjà été importés pour vous : matplotlib.pyplot sous le nom plt, seaborn sous le nom sns, LogisticRegression de sklearn.linear_model, train_test_split de sklearn.model_selection, et accuracy_score de sklearn.metrics.
L'ingénierie des variables est considérée comme une étape de prétraitement avant la modélisation :

Cette activité fait partie du cours
S'exercer aux questions d'entrevue en Machine Learning avec Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]
# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)
# Instantiate
logistic = ____()
# Fit
logistic.____(____, ____)
# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))