BOW з n-грамами та розміром словника
У цій вправі ви ще раз потренуєтеся будувати bag-of-words, використовуючи набір даних reviews з відгуками про товари на Amazon. Ваше основне завдання — обмежити розмір словника та задати довжину послідовності токенів.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Імпортуйте векторизатор із
sklearn. - Побудуйте векторизатор і обовʼязково вкажіть такі параметри: розмір словника має бути обмежений 1000, включайте лише біграми та ігноруйте терміни, що з'являються більш ніж у 500 документах.
- Навчіть (fit) векторизатор на стовпці
review. - Створіть датафрейм із подання BOW.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())