Compter les mots (I)
Une fois l'information de haut niveau consignée, vous pouvez commencer à créer des caractéristiques à partir du contenu réel de chaque texte. Une façon de procéder consiste à s'y prendre un peu comme vous l'avez fait avec les variables catégorielles dans les leçons précédentes.
- Pour chaque mot unique dans l'ensemble de données, on crée une colonne.
- Pour chaque entrée, on compte le nombre d'occurrences de ce mot et on inscrit cette valeur dans la colonne correspondante.
Ces colonnes de « count » peuvent ensuite servir à entraîner des modèles de Machine Learning.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Instructions de l’exercice
- Importez
CountVectorizerà partir desklearn.feature_extraction.text. - Instanciez
CountVectorizeret assignez-le àcv. - Ajustez le vectoriseur à la colonne
text_clean. - Affichez les noms de caractéristiques générés par le vectoriseur.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)