ПочатиПочніть безкоштовно

Моделі n-gram для слоганів фільмів

У цій вправі надано corpus з понад 9 000 слоганів фільмів. Ваше завдання — згенерувати моделі n-gram до n, що дорівнює 1; до n, що дорівнює 2; і до n, що дорівнює 3 для цих даних та визначити кількість ознак для кожної моделі.

Потім ми порівняємо кількість ознак, згенерованих для кожної моделі.

Ця вправа є частиною курсу

Інженерія ознак для NLP у Python

Переглянути курс

Інструкції до вправи

  • Згенеруйте модель n-gram з n-ґрамами до n=1. Назвіть її ng1.
  • Згенеруйте модель n-gram з n-ґрамами до n=2. Назвіть її ng2.
  • Згенеруйте модель n-gram з n-ґрамами до n=3. Назвіть її ng3.
  • Виведіть кількість ознак для кожної моделі.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)

# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)

# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)

# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))
Редагувати та запускати код