ПочатиПочніть безкоштовно

Вектори BoW для оглядів фільмів

У цій вправі ви маєте дві Series з pandas — X_train і X_test, які містять огляди фільмів. Вони відповідають тренувальним і тестовим даним оглядів. Ваше завдання — попередньо опрацювати тексти та згенерувати вектори BoW для цих двох наборів за допомогою CountVectorizer.

Коли ми отримаємо матриці векторів BoW X_train_bow і X_test_bow, ми будемо в дуже добрій позиції, щоб застосувати до них модель машинного навчання та виконати аналіз тональності.

Ця вправа є частиною курсу

Інженерія ознак для NLP у Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте CountVectorizer з бібліотеки sklearn.
  • Створіть об'єкт CountVectorizer з назвою vectorizer. Переконайтеся, що всі слова перетворюються на нижній регістр, а стоп-слова english видаляються.
  • Використовуючи X_train, навчіть vectorizer, а потім трансформуйте X_train, щоб отримати набір векторів BoW X_train_bow.
  • Трансформуйте X_test за допомогою vectorizer, щоб отримати набір векторів BoW X_test_bow.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
Редагувати та запускати код