始める無料で始める

シェイクスピア風テキストのエンコーダー

前処理済みのシェイクスピア風テキストを数値表現にエンコードしていきます。まずはパイプラインを組み立てる前に、エンコードの手順を定義しましょう。大量のデータを扱い、エンコードを効率よく実行するために、PyTorch の Dataset と DataLoader を使ってデータのバッチ化とシャッフルを行います。

次のモジュールが読み込まれています: torchnltkstopwordsPorterStemmerget_tokenizerCountVectorizerDatasetDataLoaderpreprocess_sentences

シェイクスピア風テキストから得た processed_shakespeare も利用できます。

この演習はコースの一部です

PyTorch で学ぶテキストの Deep Learning

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Define your Dataset class
class ____(Dataset):
    def __init__(self, data):
        self.data = ____
    def __len__(self):
        return len(self.data)
    def __getitem__(self, idx):
        return self.____[____]
コードを編集して実行