Метод «мешка слов» для названий книг
У PyBooks появился список названий книг, которые необходимо закодировать для дальнейшего анализа. Команда по работе с данными считает, что модель «мешка слов» (Bag of Words, BoW) — наиболее подходящий подход.
Следующие пакеты уже импортированы для вас: torch, torchtext.
Это упражнение является частью курса
Глубокое обучение для работы с текстом на PyTorch
Инструкции к упражнению
- Импортируйте класс
CountVectorizerдля реализации метода «мешка слов». - Создайте объект импортированного класса, затем используйте его для преобразования
titlesв матричное представление. - Извлеките и выведите первые пять названий признаков и закодированных заголовков с помощью метода
get_feature_names_out().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import from sklearn
from sklearn.feature_extraction.text import ____
titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']
# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)
# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])