ПочатиПочніть безкоштовно

BOW з n-грамами та розміром словника

У цій вправі ви ще раз потренуєтеся будувати bag-of-words, використовуючи набір даних reviews з відгуками про товари на Amazon. Ваше основне завдання — обмежити розмір словника та задати довжину послідовності токенів.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте векторизатор із sklearn.
  • Побудуйте векторизатор і обовʼязково вкажіть такі параметри: розмір словника має бути обмежений 1000, включайте лише біграми та ігноруйте терміни, що з'являються більш ніж у 500 документах.
  • Навчіть (fit) векторизатор на стовпці review.
  • Створіть датафрейм із подання BOW.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
Редагувати та запускати код