ПочатиПочніть безкоштовно

Задайте довжину послідовності токенів у BOW

У відео ми побачили, що, задаючи різну довжину токенів — так звані n-грами, — ми краще вловлюємо контекст, а це може бути дуже важливо.

У цій вправі ви працюватимете із вибіркою відгуків про товари з Amazon. Ваше завдання — побудувати словник BOW, використовуючи стовпець review, і задати довжину послідовності токенів.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Побудуйте векторизатор, задавши довжину послідовності токенів як уні- та біграми.
  • Виконайте fit векторизатора.
  • Виконайте transform для навченого векторизатора.
  • У датафреймі не забудьте коректно вказати назви стовпців.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
Редагувати та запускати код