Modele n-gramów dla tagline'ów filmowych
W tym ćwiczeniu masz do dyspozycji corpus zawierający ponad 9000 tagline'ów filmowych. Twoim zadaniem jest wygenerowanie modeli n-gramów dla n=1, n=2 oraz n=3 i sprawdzenie, ile cech zawiera każdy z modeli.
Na koniec porównasz liczbę cech wygenerowanych przez poszczególne modele.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Wygeneruj model n-gramów dla n-gramów do n=1. Nazwij go
ng1. - Wygeneruj model n-gramów dla n-gramów do n=2. Nazwij go
ng2. - Wygeneruj model n-gramów dla n-gramów do n=3. Nazwij go
ng3. - Wyświetl liczbę cech dla każdego modelu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)
# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)
# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)
# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))