Encodage one-hot et variables fictives
Pour utiliser des variables catégorielles dans un modèle de Machine Learning, vous devez d'abord les représenter de façon quantitative. Les deux approches les plus courantes sont l'encodage one-hot et l'utilisation de variables fictives (dummy variables). Dans cet exercice, vous allez créer ces deux types d'encodage et comparer les ensembles de colonnes obtenus. Nous continuons avec le même DataFrame du cours précédent, chargé dans so_survey_df, en nous concentrant sur sa colonne Country.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Convert the Country column to a one hot encoded Data Frame
one_hot_encoded = ____(____, ____=['Country'], prefix='OH')
# Print the columns names
print(one_hot_encoded.columns)