Förbehandlingspipeline för shakespearianskt språk
På PyBooks vill teamet bearbeta ett stort bibliotek med shakespeariansk textdata för vidare analys. Det effektivaste sättet att göra detta är med en textbehandlingspipeline som börjar med förbehandlingsstegen.
Följande har laddats åt dig:
torch, nltk, stopwords, PorterStemmer, get_tokenizer.
Den shakespearianska textdatan är sparad som shakespeare och meningarna har redan extraherats.
Den här övningen är en del av kursen
Djupinlärning för text med PyTorch
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a list of stopwords
stop_words = set(____(____))