Zacznij terazZacznij za darmo

Modele n-gramów dla tagline'ów filmowych

W tym ćwiczeniu masz do dyspozycji corpus zawierający ponad 9000 tagline'ów filmowych. Twoim zadaniem jest wygenerowanie modeli n-gramów dla n=1, n=2 oraz n=3 i sprawdzenie, ile cech zawiera każdy z modeli.

Na koniec porównasz liczbę cech wygenerowanych przez poszczególne modele.

To ćwiczenie jest częścią kursu

Inżynieria cech dla NLP w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wygeneruj model n-gramów dla n-gramów do n=1. Nazwij go ng1.
  • Wygeneruj model n-gramów dla n-gramów do n=2. Nazwij go ng2.
  • Wygeneruj model n-gramów dla n-gramów do n=3. Nazwij go ng3.
  • Wyświetl liczbę cech dla każdego modelu.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)

# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)

# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)

# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))
Edytuj i uruchom kod