CommencezCommencez gratuitement

Analyser la dimensionnalité et le prétraitement

Dans cet exercice, on vous fournit un lem_corpus qui contient les versions prétraitées des slogans de films de l'exercice précédent. Autrement dit, les slogans ont été mis en minuscules, lemmatisés et les mots vides ont été retirés.

Votre tâche est de générer la représentation sac de mots bow_lem_matrix pour ces slogans lemmatisés et d'en comparer la forme avec celle de bow_matrix obtenue à l'exercice précédent. Les cinq premiers slogans lemmatisés de lem_corpus ont été affichés dans la console pour que vous puissiez les examiner.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le NLP en Python

Voir le cours

Instructions de l’exercice

  • Importez la classe CountVectorizer depuis sklearn.
  • Instanciez un objet CountVectorizer. Nommez-le vectorizer.
  • À l'aide de fit_transform(), générez bow_lem_matrix pour lem_corpus.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
Modifier et exécuter le code