ПочатиПочніть безкоштовно

Bag-of-words для назв книжок

PyBooks має список назв книжок, які потрібно закодувати для подальшого аналізу. Команда даних вважає, що модель Bag of Words (BoW) може бути найкращим підходом.

Для вас уже імпортовано такі пакети: torch, torchtext.

Ця вправа є частиною курсу

Глибоке навчання для тексту з PyTorch

Переглянути курс

Інструкції до вправи

  • Імпортуйте клас CountVectorizer для реалізації bag-of-words.
  • Ініціалізуйте об'єкт імпортованого класу, а потім використайте його, щоб перетворити titles на матричне подання.
  • Витягніть і відобразьте перші п'ять назв ознак і закодованих заголовків за допомогою методу get_feature_names_out().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Редагувати та запускати код