Задайте довжину послідовності токенів у BOW
У відео ми побачили, що, задаючи різну довжину токенів — так звані n-грами, — ми краще вловлюємо контекст, а це може бути дуже важливо.
У цій вправі ви працюватимете із вибіркою відгуків про товари з Amazon. Ваше завдання — побудувати словник BOW, використовуючи стовпець review, і задати довжину послідовності токенів.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Побудуйте векторизатор, задавши довжину послідовності токенів як уні- та біграми.
- Виконайте fit векторизатора.
- Виконайте transform для навченого векторизатора.
- У датафреймі не забудьте коректно вказати назви стовпців.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())