Мешок слов на основе отзывов о товарах
Вы уже попрактиковались в построении мешка слов на небольшом наборе данных. Теперь применим этот подход к выборке отзывов об Amazon-товарах. Данные уже загружены и доступны под именем reviews. Набор содержит два столбца. Первый — score — принимает значение 0 для отрицательного отзыва и 1 для положительного. Второй столбец — review — содержит текст отзыва, оставленного покупателем. Вы можете изучить данные в оболочке IPython.
Ваша задача — построить словарь мешка слов, используя столбец review.
Напомним, что для получения списка всех элементов словаря можно вызвать метод .get_feature_names() на объекте векторайзера.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Создайте объект CountVectorizer, указав максимальное количество признаков.
- Обучите векторайзер.
- Примените обученный векторайзер для преобразования данных.
- Создайте DataFrame, преобразовав разреженную матрицу в плотный массив, и укажите корректные названия столбцов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify max features
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())