シェイクスピア風テキストのエンコーダー
前処理済みのシェイクスピア風テキストを数値表現にエンコードしていきます。まずはパイプラインを組み立てる前に、エンコードの手順を定義しましょう。大量のデータを扱い、エンコードを効率よく実行するために、PyTorch の Dataset と DataLoader を使ってデータのバッチ化とシャッフルを行います。
次のモジュールが読み込まれています:
torch、nltk、stopwords、PorterStemmer、get_tokenizer、CountVectorizer、Dataset、DataLoader、preprocess_sentences。
シェイクスピア風テキストから得た processed_shakespeare も利用できます。
この演習はコースの一部です
PyTorch で学ぶテキストの Deep Learning
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Define your Dataset class
class ____(Dataset):
def __init__(self, data):
self.data = ____
def __len__(self):
return len(self.data)
def __getitem__(self, idx):
return self.____[____]