ПочатиПочніть безкоштовно

BOW на відгуках про товари

Ви попрактикувалися з BOW на невеликому наборі даних. Тепер застосуєте його до вибірки відгуків про товари з Amazon. Дані вже імпортовано під назвою reviews. Є два стовпці. Перший — score: він дорівнює 0, якщо відгук негативний, і 1, якщо позитивний. Другий стовпець — review, він містить текст відгуку, який залишив клієнт. За бажанням дослідіть дані в оболонці IPython.

Ваше завдання — побудувати словник BOW, використовуючи стовпець review.

Пам'ятайте, що можна викликати метод .get_feature_names() у векторизаторі, щоб отримати список усіх елементів словника.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Створіть об'єкт CountVectorizer, вказавши максимальну кількість ознак.
  • Виконайте fit для векторизатора.
  • Застосуйте transform до навченого векторизатора.
  • Створіть DataFrame, перетворивши розріджену матрицю на щільний масив, і переконайтеся, що правильно задали назви стовпців.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify max features 
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())
Редагувати та запускати код