Modèles d'n-grammes pour des accroches de films
Dans cet exercice, on vous fournit un corpus de plus de 9 000 accroches publicitaires de films. Votre tâche est de générer des modèles d'n-grammes avec n allant jusqu'à 1, jusqu'à 2, puis jusqu'à 3 pour ces données et de déterminer le nombre de caractéristiques pour chaque modèle.
Nous comparerons ensuite le nombre de caractéristiques générées pour chaque modèle.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Instructions de l’exercice
- Générez un modèle d'n-grammes avec des n-grammes jusqu'à n=1. Nommez-le
ng1. - Générez un modèle d'n-grammes avec des n-grammes jusqu'à n=2. Nommez-le
ng2. - Générez un modèle d'n-grammes avec des n-grammes jusqu'à n=3. Nommez-le
ng3. - Affichez le nombre de caractéristiques pour chaque modèle.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)
# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)
# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)
# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))