CommencezCommencez gratuitement

Modèle BoW pour des accroches de films

Dans cet exercice, on vous fournit un corpus de plus de 7 000 accroches publicitaires de films. Votre tâche est de générer la représentation sac de mots bow_matrix pour ces accroches. Pour cet exercice, nous allons ignorer l'étape de prétraitement du texte et générer directement bow_matrix.

Nous allons aussi examiner la forme (shape) de la bow_matrix obtenue. Les cinq premières accroches du corpus ont été affichées dans la console pour que vous puissiez les examiner.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le NLP en Python

Voir le cours

Instructions de l’exercice

  • Importez la classe CountVectorizer depuis sklearn.
  • Instanciez un objet CountVectorizer. Nommez-le vectorizer.
  • À l'aide de fit_transform(), générez bow_matrix pour corpus.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
Modifier et exécuter le code