Настройка длины последовательности токенов с помощью BOW
В видео мы рассмотрели, как задание различной длины последовательностей токенов — так называемых n-граммов — помогает лучше улавливать контекст, что зачастую очень важно.
В этом упражнении вы будете работать с выборкой из набора отзывов на товары Amazon. Ваша задача — построить словарь BOW на основе столбца review и задать длину последовательности токенов.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Создайте векторизатор, указав длину последовательности токенов: уни- и биграммы.
- Обучите векторизатор.
- Примените обученный векторизатор для преобразования данных.
- В DataFrame убедитесь, что названия столбцов указаны правильно.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())