Bag-of-words pro názvy knih
PyBooks má teď k dispozici seznam názvů knih, které je potřeba zakódovat pro další analýzu. Datový tým se domnívá, že model Bag of Words (BoW) by mohl být tím správným přístupem.
Následující balíčky už jsou naimportované: torch, torchtext.
Toto cvičení je součástí kurzu
Deep Learning for Text with PyTorch
Pokyny k cvičení
- Importuj třídu
CountVectorizerpro implementaci bag-of-words. - Vytvoř instanci importované třídy a pomocí ní převeď
titlesdo maticové reprezentace. - Extrahuj a zobraz prvních pět názvů příznaků a zakódovaných titulů pomocí metody
get_feature_names_out().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import from sklearn
from sklearn.feature_extraction.text import ____
titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']
# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)
# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])