Préparer les vecteurs d'étiquettes
Dans la vidéo, vous avez vu les différences entre la classification binaire et la classification multiclasse. Vous avez appris qu'il faut apporter quelques modifications à la préparation des données avant d'entraîner les modèles.
Dans cet exercice, vous allez préparer un jeu de données brut dont les étiquettes sont données sous forme de texte. Les données sont fournies dans un pandas.DataFrame nommé df, avec deux colonnes : text pour les textes et label pour les noms d'étiquettes. Votre tâche consiste à appliquer toutes les transformations nécessaires aux étiquettes : convertir les chaînes en nombres puis effectuer un encodage one-hot.
Le module pandas sous l'alias pd et la fonction to_categorical() de keras.utils.np_utils sont déjà chargés dans l'environnement, et les premières lignes du jeu de données sont affichées dans la console pour que vous puissiez les consulter.
Cette activité fait partie du cours
Réseaux de neurones récurrents (RNN) pour la modélisation du langage avec Keras
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Get the numerical ids of column label
numerical_ids = df.label.____
# Print initial shape
print(numerical_ids.____)