n-Gram-Modelle für Film-Taglines
In dieser Übung bekommst du ein corpus mit mehr als 9000 Film-Taglines. Deine Aufgabe ist es, n-Gram-Modelle bis n gleich 1, n gleich 2 und n gleich 3 für diese Daten zu erzeugen und die Anzahl der Features für jedes Modell zu ermitteln.
Anschließend vergleichen wir die Anzahl der erzeugten Features der einzelnen Modelle.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering für NLP in Python</Kurs>Übungsanweisungen
- Erzeuge ein n-Gram-Modell mit n-Grams bis n=1. Nenne es
ng1. - Erzeuge ein n-Gram-Modell mit n-Grams bis n=2. Nenne es
ng2. - Erzeuge ein n-Gram-Modell mit n-Grams bis n=3. Nenne es
ng3. - Gib die Anzahl der Features für jedes Modell aus.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)
# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)
# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)
# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))