НачатьНачать бесплатно

Настройка длины последовательности токенов с помощью BOW

В видео мы рассмотрели, как задание различной длины последовательностей токенов — так называемых n-граммов — помогает лучше улавливать контекст, что зачастую очень важно.

В этом упражнении вы будете работать с выборкой из набора отзывов на товары Amazon. Ваша задача — построить словарь BOW на основе столбца review и задать длину последовательности токенов.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте векторизатор, указав длину последовательности токенов: уни- и биграммы.
  • Обучите векторизатор.
  • Примените обученный векторизатор для преобразования данных.
  • В DataFrame убедитесь, что названия столбцов указаны правильно.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
Редактировать и запускать код