ÎncepețiÎncepe gratuit

Bag-of-words pentru titluri de cărți

PyBooks are acum o listă de titluri de cărți care trebuie codificate pentru analize ulterioare. Echipa de date consideră că modelul Bag of Words (BoW) ar putea fi cea mai bună abordare.

Următoarele pachete au fost importate pentru tine: torch, torchtext.

Acest exercițiu face parte din cursul

Deep Learning pentru text cu PyTorch

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă clasa CountVectorizer pentru implementarea bag-of-words.
  • Inițializează un obiect al clasei importate, apoi folosește-l pentru a transforma titles într-o reprezentare matriceală.
  • Extrage și afișează primele cinci nume de caracteristici și titlurile codificate cu metoda get_feature_names_out().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Editează și rulează codul