Bag-of-words pentru titluri de cărți
PyBooks are acum o listă de titluri de cărți care trebuie codificate pentru analize ulterioare. Echipa de date consideră că modelul Bag of Words (BoW) ar putea fi cea mai bună abordare.
Următoarele pachete au fost importate pentru tine: torch, torchtext.
Acest exercițiu face parte din cursul
Deep Learning pentru text cu PyTorch
Instrucțiuni pentru exercițiu
- Importă clasa
CountVectorizerpentru implementarea bag-of-words. - Inițializează un obiect al clasei importate, apoi folosește-l pentru a transforma
titlesîntr-o reprezentare matriceală. - Extrage și afișează primele cinci nume de caracteristici și titlurile codificate cu metoda
get_feature_names_out().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import from sklearn
from sklearn.feature_extraction.text import ____
titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']
# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)
# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])