Конвейер предобработки текстов Шекспира
Команда PyBooks хочет подготовить обширную библиотеку шекспировских текстов для дальнейшего анализа. Наиболее эффективный способ сделать это — построить конвейер обработки текста, начиная с этапов предобработки.
Для вас уже загружены следующие компоненты:
torch, nltk, stopwords, PorterStemmer, get_tokenizer.
Текстовые данные Шекспира сохранены в переменной shakespeare, предложения из них уже извлечены.
Это упражнение является частью курса
Глубокое обучение для работы с текстом на PyTorch
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a list of stopwords
stop_words = set(____(____))