НачатьНачать бесплатно

Мешок слов с n-граммами и ограничением словаря

В этом упражнении вы снова попрактикуетесь в построении мешка слов — на этот раз с использованием набора данных reviews с отзывами о товарах Amazon. Ваша основная задача — ограничить размер словаря и задать длину последовательности токенов.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте векторизатор из библиотеки sklearn.
  • Создайте векторизатор со следующими параметрами: размер словаря не должен превышать 1000, используйте только биграммы, игнорируйте термины, встречающиеся более чем в 500 документах.
  • Примените векторизатор к столбцу review.
  • Создайте DataFrame на основе представления в виде мешка слов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
Редактировать и запускать код