Créer des variables indicatrices à partir d'une variable à nombreuses catégories
Vous disposez d'un basetable avec une variable prédictive « country ». Assurez-vous que « country » puisse être utilisée comme variable prédictive dans un modèle de régression logistique en créant des variables indicatrices pour celle-ci.
Cette activité fait partie du cours
Analytique prédictive intermédiaire en Python
Instructions de l’exercice
- Créez un dataframe pandas
dummies_countryqui contient les variables indicatrices pour « country ». Assurez-vous d'éviter la multicolinéarité. - Ajoutez ces variables indicatrices au
basetableoriginal. - Retirez la variable originale « country » du
basetable.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create the dummy variable
dummies_country = ____.____(____["____"], ____=____)
# Add the dummy variable to the basetable
basetable = ____.____([____, ____], ____=____)
# Delete the original variable from the basetable
____ ____["____"]
print(basetable.head())