Bag-of-words для назв книжок
PyBooks має список назв книжок, які потрібно закодувати для подальшого аналізу. Команда даних вважає, що модель Bag of Words (BoW) може бути найкращим підходом.
Для вас уже імпортовано такі пакети: torch, torchtext.
Ця вправа є частиною курсу
Глибоке навчання для тексту з PyTorch
Інструкції до вправи
- Імпортуйте клас
CountVectorizerдля реалізації bag-of-words. - Ініціалізуйте об'єкт імпортованого класу, а потім використайте його, щоб перетворити
titlesна матричне подання. - Витягніть і відобразьте перші п'ять назв ознак і закодованих заголовків за допомогою методу
get_feature_names_out().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import from sklearn
from sklearn.feature_extraction.text import ____
titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']
# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)
# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])