ПочатиПочніть безкоштовно

Застосування TF-IDF до описів книжок

PyBooks зібрала кілька описів книжок і хоче визначити в них важливі слова за допомогою техніки кодування TF-IDF. Так вони сподіваються краще зрозуміти унікальні характеристики кожної книжки, щоб удосконалити систему рекомендацій.

Наступні пакети вже імпортовано: torch, torchtext.

Ця вправа є частиною курсу

Глибоке навчання для тексту з PyTorch

Переглянути курс

Інструкції до вправи

  • Імпортуйте клас TfidfVectorizer з sklearn.feature_extraction.text, який перетворює колекцію сирих документів на матрицю ознак TF-IDF.
  • Створіть екземпляр цього класу, потім використайте його, щоб закодувати descriptions у TF-IDF-матрицю векторів.
  • Отримайте й відобразьте перші п'ять назв ознак з vectorizer та закодовані вектори з tfidf_encoded_descriptions.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
Редагувати та запускати код