НачатьНачать бесплатно

Мешок слов на основе отзывов о товарах

Вы уже попрактиковались в построении мешка слов на небольшом наборе данных. Теперь применим этот подход к выборке отзывов об Amazon-товарах. Данные уже загружены и доступны под именем reviews. Набор содержит два столбца. Первый — score — принимает значение 0 для отрицательного отзыва и 1 для положительного. Второй столбец — review — содержит текст отзыва, оставленного покупателем. Вы можете изучить данные в оболочке IPython.

Ваша задача — построить словарь мешка слов, используя столбец review.

Напомним, что для получения списка всех элементов словаря можно вызвать метод .get_feature_names() на объекте векторайзера.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте объект CountVectorizer, указав максимальное количество признаков.
  • Обучите векторайзер.
  • Примените обученный векторайзер для преобразования данных.
  • Создайте DataFrame, преобразовав разреженную матрицу в плотный массив, и укажите корректные названия столбцов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify max features 
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())
Редактировать и запускать код