Pipeline pro předzpracování shakespearovského textu
Tým v PyBooks chce zpracovat rozsáhlou knihovnu shakespearovských textů pro další analýzu. Nejefektivnější způsob, jak to udělat, je pomocí pipeline pro zpracování textu – začínáme kroky předzpracování.
Následující knihovny a moduly jsou už načtené:
torch, nltk, stopwords, PorterStemmer, get_tokenizer.
Shakespearovská textová data jsou uložena v proměnné shakespeare a věty už byly extrahovány.
Toto cvičení je součástí kurzu
Deep Learning for Text with PyTorch
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a list of stopwords
stop_words = set(____(____))