Zacznij terazZacznij za darmo

Stosowanie TF-IDF do opisów książek

Firma PyBooks zebrała opisy kilku książek i chce zidentyfikować w nich ważne słowa za pomocą techniki kodowania TF-IDF. Dzięki temu ma nadzieję lepiej poznać unikalne cechy każdej książki i usprawnić swój system rekomendacji.

Następujące pakiety zostały już zaimportowane: torch, torchtext.

To ćwiczenie jest częścią kursu

Uczenie głębokie dla tekstu z PyTorch

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj klasę TfidfVectorizer z modułu sklearn.feature_extraction.text – przekształca ona zbiór surowych dokumentów na macierz cech TF-IDF.
  • Utwórz instancję tej klasy, a następnie użyj jej do zakodowania zmiennej descriptions w macierz wektorów TF-IDF.
  • Pobierz i wyświetl pierwsze pięć nazw cech z obiektu vectorizer oraz pierwsze pięć zakodowanych wektorów z tfidf_encoded_descriptions.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
Edytuj i uruchom kod