Kom igångKom igång gratis

Tillämpa TF-IDF på bokbeskrivningar

PyBooks har samlat in ett antal bokbeskrivningar och vill identifiera viktiga ord i dem med hjälp av TF-IDF-kodningstekniken. Målet är att få bättre förståelse för varje boks unika egenskaper och därigenom förbättra sitt bokrekommen­dationssystem.

Följande paket har redan importerats: torch, torchtext.

Den här övningen är en del av kursen

Djupinlärning för text med PyTorch

Visa kurs

Övningsinstruktioner

  • Importera klassen TfidfVectorizer från sklearn.feature_extraction.text, som omvandlar en samling råa dokument till en matris av TF-IDF-särdrag.
  • Skapa en instans av klassen och använd sedan den instansen för att koda descriptions till en TF-IDF-matris av vektorer.
  • Hämta och visa de fem första särdragsnamnen från vectorizer och de kodade vektorerna från tfidf_encoded_descriptions.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
Redigera och kör kod