CommencezCommencez gratuitement

Encodage one-hot et variables fictives

Pour utiliser des variables catégorielles dans un modèle de Machine Learning, vous devez d'abord les représenter de façon quantitative. Les deux approches les plus courantes sont l'encodage one-hot et l'utilisation de variables fictives (dummy variables). Dans cet exercice, vous allez créer ces deux types d'encodage et comparer les ensembles de colonnes obtenus. Nous continuons avec le même DataFrame du cours précédent, chargé dans so_survey_df, en nous concentrant sur sa colonne Country.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Convert the Country column to a one hot encoded Data Frame
one_hot_encoded = ____(____, ____=['Country'], prefix='OH')

# Print the columns names
print(one_hot_encoded.columns)
Modifier et exécuter le code