CommencezCommencez gratuitement

Compter les mots (I)

Une fois l'information de haut niveau consignée, vous pouvez commencer à créer des caractéristiques à partir du contenu réel de chaque texte. Une façon de procéder consiste à s'y prendre un peu comme vous l'avez fait avec les variables catégorielles dans les leçons précédentes.

  • Pour chaque mot unique dans l'ensemble de données, on crée une colonne.
  • Pour chaque entrée, on compte le nombre d'occurrences de ce mot et on inscrit cette valeur dans la colonne correspondante.

Ces colonnes de « count » peuvent ensuite servir à entraîner des modèles de Machine Learning.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Importez CountVectorizer à partir de sklearn.feature_extraction.text.
  • Instanciez CountVectorizer et assignez-le à cv.
  • Ajustez le vectoriseur à la colonne text_clean.
  • Affichez les noms de caractéristiques générés par le vectoriseur.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
Modifier et exécuter le code