Моделі n-gram для слоганів фільмів
У цій вправі надано corpus з понад 9 000 слоганів фільмів. Ваше завдання — згенерувати моделі n-gram до n, що дорівнює 1; до n, що дорівнює 2; і до n, що дорівнює 3 для цих даних та визначити кількість ознак для кожної моделі.
Потім ми порівняємо кількість ознак, згенерованих для кожної моделі.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Згенеруйте модель n-gram з n-ґрамами до n=1. Назвіть її
ng1. - Згенеруйте модель n-gram з n-ґрамами до n=2. Назвіть її
ng2. - Згенеруйте модель n-gram з n-ґрамами до n=3. Назвіть її
ng3. - Виведіть кількість ознак для кожної моделі.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Generate n-grams upto n=1
vectorizer_ng1 = CountVectorizer(ngram_range=(1,1))
ng1 = vectorizer_ng1.____(corpus)
# Generate n-grams upto n=2
vectorizer_ng2 = CountVectorizer(ngram_range=(1,2))
ng2 = vectorizer_ng2.____(corpus)
# Generate n-grams upto n=3
vectorizer_ng3 = CountVectorizer(ngram_range=(____, ____))
ng3 = vectorizer_ng3.fit_transform(corpus)
# Print the number of features for each model
print("ng1, ng2 and ng3 have %i, %i and %i features respectively" % (ng1.____[1], ng2.____[1], ng3.____[1]))