Bag-of-words för boktitlar
PyBooks har nu en lista med boktitlar som behöver kodas för vidare analys. Datateamet bedömer att modellen Bag of Words (BoW) kan vara det bästa tillvägagångssättet.
Följande paket har redan importerats: torch, torchtext.
Den här övningen är en del av kursen
Djupinlärning för text med PyTorch
Övningsinstruktioner
- Importera klassen
CountVectorizerför att implementera bag-of-words. - Skapa ett objekt av den importerade klassen och använd sedan objektet för att omvandla
titlestill en matrisrepresentation. - Extrahera och visa de fem första särdragsnamnen och de kodade titlarna med metoden
get_feature_names_out().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import from sklearn
from sklearn.feature_extraction.text import ____
titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']
# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)
# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])