Применение TF-IDF к описаниям книг
Компания PyBooks собрала несколько описаний книг и хочет выделить в них ключевые слова с помощью метода кодирования TF-IDF. Это поможет лучше понять уникальные характеристики каждой книги и улучшить систему рекомендаций.
Следующие пакеты уже импортированы: torch, torchtext.
Это упражнение является частью курса
Глубокое обучение для работы с текстом на PyTorch
Инструкции к упражнению
- Импортируйте класс
TfidfVectorizerизsklearn.feature_extraction.text— он преобразует коллекцию документов в матрицу признаков TF-IDF. - Создайте экземпляр этого класса, затем используйте его для кодирования
descriptionsв матрицу векторов TF-IDF. - Получите и выведите первые пять названий признаков из
vectorizerи закодированные векторы изtfidf_encoded_descriptions.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)
# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])