НачатьНачать бесплатно

Метод «мешка слов» для названий книг

У PyBooks появился список названий книг, которые необходимо закодировать для дальнейшего анализа. Команда по работе с данными считает, что модель «мешка слов» (Bag of Words, BoW) — наиболее подходящий подход.

Следующие пакеты уже импортированы для вас: torch, torchtext.

Это упражнение является частью курса

Глубокое обучение для работы с текстом на PyTorch

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс CountVectorizer для реализации метода «мешка слов».
  • Создайте объект импортированного класса, затем используйте его для преобразования titles в матричное представление.
  • Извлеките и выведите первые пять названий признаков и закодированных заголовков с помощью метода get_feature_names_out().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Редактировать и запускать код