Pipeline do przetwarzania języka Szekspira
Zespół PyBooks chce przetworzyć obszerną bibliotekę tekstów Szekspira do dalszej analizy. Najefektywniejszym sposobem jest zbudowanie potoku przetwarzania tekstu, zaczynając od kroków wstępnego przetwarzania.
Następujące elementy zostały już załadowane:
torch, nltk, stopwords, PorterStemmer, get_tokenizer.
Dane tekstowe Szekspira są zapisane jako shakespeare, a zdania zostały już wyodrębnione.
To ćwiczenie jest częścią kursu
Uczenie głębokie dla tekstu z PyTorch
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a list of stopwords
stop_words = set(____(____))