CommencezCommencez gratuitement

Modèles d'n-grammes pour des accroches de films

Dans cet exercice, on vous fournit un corpus de plus de 9 000 accroches publicitaires de films. Votre tâche est de générer des modèles d'n-grammes avec n allant jusqu'à 1, jusqu'à 2, puis jusqu'à 3 pour ces données et de déterminer le nombre de caractéristiques pour chaque modèle.

Nous comparerons ensuite le nombre de caractéristiques générées pour chaque modèle.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le NLP en Python

Voir le cours

Instructions de l’exercice

  • Générez un modèle d'n-grammes avec des n-grammes jusqu'à n=1. Nommez-le ng1.
  • Générez un modèle d'n-grammes avec des n-grammes jusqu'à n=2. Nommez-le ng2.
  • Générez un modèle d'n-grammes avec des n-grammes jusqu'à n=3. Nommez-le ng3.
  • Affichez le nombre de caractéristiques pour chaque modèle.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)

# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)

# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)

# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))
Modifier et exécuter le code