Kom igångKom igång gratis

Bag-of-words för boktitlar

PyBooks har nu en lista med boktitlar som behöver kodas för vidare analys. Datateamet bedömer att modellen Bag of Words (BoW) kan vara det bästa tillvägagångssättet.

Följande paket har redan importerats: torch, torchtext.

Den här övningen är en del av kursen

Djupinlärning för text med PyTorch

Visa kurs

Övningsinstruktioner

  • Importera klassen CountVectorizer för att implementera bag-of-words.
  • Skapa ett objekt av den importerade klassen och använd sedan objektet för att omvandla titles till en matrisrepresentation.
  • Extrahera och visa de fem första särdragsnamnen och de kodade titlarna med metoden get_feature_names_out().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Redigera och kör kod