ÎncepețiÎncepe gratuit

Modele n-gram pentru sloganurile filmelor

În acest exercițiu, ai la dispoziție un corpus cu peste 9.000 de sloganuri de film. Sarcina ta este să generezi modele n-gram până la n egal cu 1, n egal cu 2 și n egal cu 3 pentru aceste date și să descoperi numărul de caracteristici al fiecărui model.

Vei compara apoi numărul de caracteristici generat de fiecare model.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Generează un model n-gram cu n-grame până la n=1. Numește-l ng1.
  • Generează un model n-gram cu n-grame până la n=2. Numește-l ng2.
  • Generează un model n-gram cu n-grame până la n=3. Numește-l ng3.
  • Afișează numărul de caracteristici pentru fiecare model.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)

# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)

# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)

# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))
Editează și rulează codul