N-gramové modely pro filmové slogany
V tomto cvičení máš k dispozici corpus s více než 9 000 filmovými slogany. Tvým úkolem je pro tato data vytvořit n-gramové modely pro n rovné 1, n rovné 2 a n rovné 3 a zjistit počet příznaků každého modelu.
Poté porovnáš počty příznaků vygenerovaných jednotlivými modely.
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Pokyny k cvičení
- Vytvoř n-gramový model s n-gramy pro n=1. Pojmenuj ho
ng1. - Vytvoř n-gramový model s n-gramy pro n=2. Pojmenuj ho
ng2. - Vytvoř n-gramový model s n-gramy pro n=3. Pojmenuj ho
ng3. - Vypiš počet příznaků pro každý model.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)
# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)
# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)
# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))