Вектори BoW для оглядів фільмів
У цій вправі ви маєте дві Series з pandas — X_train і X_test, які містять огляди фільмів. Вони відповідають тренувальним і тестовим даним оглядів. Ваше завдання — попередньо опрацювати тексти та згенерувати вектори BoW для цих двох наборів за допомогою CountVectorizer.
Коли ми отримаємо матриці векторів BoW X_train_bow і X_test_bow, ми будемо в дуже добрій позиції, щоб застосувати до них модель машинного навчання та виконати аналіз тональності.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Імпортуйте
CountVectorizerз бібліотекиsklearn. - Створіть об'єкт
CountVectorizerз назвоюvectorizer. Переконайтеся, що всі слова перетворюються на нижній регістр, а стоп-словаenglishвидаляються. - Використовуючи
X_train, навчітьvectorizer, а потім трансформуйтеX_train, щоб отримати набір векторів BoWX_train_bow. - Трансформуйте
X_testза допомогоюvectorizer, щоб отримати набір векторів BoWX_test_bow.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)