Začněte nyníZačněte zdarma

N-gramové modely pro filmové slogany

V tomto cvičení máš k dispozici corpus s více než 9 000 filmovými slogany. Tvým úkolem je pro tato data vytvořit n-gramové modely pro n rovné 1, n rovné 2 a n rovné 3 a zjistit počet příznaků každého modelu.

Poté porovnáš počty příznaků vygenerovaných jednotlivými modely.

Toto cvičení je součástí kurzu

Feature Engineering for NLP in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř n-gramový model s n-gramy pro n=1. Pojmenuj ho ng1.
  • Vytvoř n-gramový model s n-gramy pro n=2. Pojmenuj ho ng2.
  • Vytvoř n-gramový model s n-gramy pro n=3. Pojmenuj ho ng3.
  • Vypiš počet příznaků pro každý model.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)

# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)

# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)

# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))
Upravit a spustit kód