Pipeline de prétraitement du langage shakespearien
Chez PyBooks, l'équipe veut transformer une vaste bibliothèque de textes shakespeariens pour une analyse plus poussée. La façon la plus efficace d'y arriver est d'utiliser un pipeline de traitement de texte, en commençant par les étapes de prétraitement.
Les éléments suivants ont été chargés pour vous :
torch, nltk, stopwords, PorterStemmer, get_tokenizer.
Les textes shakespeariens sont enregistrés dans shakespeare et les phrases ont déjà été extraites.
Cette activité fait partie du cours
Apprentissage profond pour le texte avec PyTorch
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a list of stopwords
stop_words = set(____(____))