НачатьНачать бесплатно

Применение TF-IDF к описаниям книг

Компания PyBooks собрала несколько описаний книг и хочет выделить в них ключевые слова с помощью метода кодирования TF-IDF. Это поможет лучше понять уникальные характеристики каждой книги и улучшить систему рекомендаций.

Следующие пакеты уже импортированы: torch, torchtext.

Это упражнение является частью курса

Глубокое обучение для работы с текстом на PyTorch

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс TfidfVectorizer из sklearn.feature_extraction.text — он преобразует коллекцию документов в матрицу признаков TF-IDF.
  • Создайте экземпляр этого класса, затем используйте его для кодирования descriptions в матрицу векторов TF-IDF.
  • Получите и выведите первые пять названий признаков из vectorizer и закодированные векторы из tfidf_encoded_descriptions.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
Редактировать и запускать код