Začněte nyníZačněte zdarma

Bag-of-words pro názvy knih

PyBooks má teď k dispozici seznam názvů knih, které je potřeba zakódovat pro další analýzu. Datový tým se domnívá, že model Bag of Words (BoW) by mohl být tím správným přístupem.

Následující balíčky už jsou naimportované: torch, torchtext.

Toto cvičení je součástí kurzu

Deep Learning for Text with PyTorch

Zobrazit kurz

Pokyny k cvičení

  • Importuj třídu CountVectorizer pro implementaci bag-of-words.
  • Vytvoř instanci importované třídy a pomocí ní převeď titles do maticové reprezentace.
  • Extrahuj a zobraz prvních pět názvů příznaků a zakódovaných titulů pomocí metody get_feature_names_out().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Upravit a spustit kód