テキストの前処理
レコメンデーションシステムなどのモデルを構築するには、まずテキストの前処理が必要です。
ここではシャーロック・ホームズの一節が読み込まれています。動画で紹介したさまざまな手法を使ってこのテキストを前処理し、以降の分析に備えましょう。
変数 text には、Arthur Conan Doyle の The Hound of the Baskervilles(バスカヴィル家の犬)からの抜粋が入っています。
次のパッケージと関数はあらかじめ読み込まれています:
nltk、torch、get_tokenizer、PorterStemmer、stopwords。
この演習はコースの一部です
PyTorch で学ぶテキストの Deep Learning
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Initialize and tokenize the text
tokenizer = ____("basic_english")
tokens = ____(____)
print(tokens)