НачатьНачать бесплатно

Конвейер предобработки текстов Шекспира

Команда PyBooks хочет подготовить обширную библиотеку шекспировских текстов для дальнейшего анализа. Наиболее эффективный способ сделать это — построить конвейер обработки текста, начиная с этапов предобработки.

Для вас уже загружены следующие компоненты: torch, nltk, stopwords, PorterStemmer, get_tokenizer.

Текстовые данные Шекспира сохранены в переменной shakespeare, предложения из них уже извлечены.

Это упражнение является частью курса

Глубокое обучение для работы с текстом на PyTorch

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a list of stopwords
stop_words = set(____(____))
Редактировать и запускать код