Förbehandling av text
Oavsett om du bygger ett rekommendationssystem eller en annan modell behöver texten förbehandlas först.
Här läses ett textstycke från Sherlock Holmes in. Förbehandla texten med hjälp av de tekniker som presenterades i videon, så att den är redo för vidare analys.
Variabeln text är ett utdrag ur The Hound of the Baskervilles av Arthur Conan Doyle.
Följande paket och funktioner har redan importerats:
nltk, torch, get_tokenizer, PorterStemmer, stopwords.
Den här övningen är en del av kursen
Djupinlärning för text med PyTorch
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Initialize and tokenize the text
tokenizer = ____("basic_english")
tokens = ____(____)
print(tokens)