データの前処理
マルチクラス分類におけるデータ前処理の違いを学びました。ここでは、シンプルなマルチクラス分類モデルの作成を見据えて、前処理を実践しましょう。
データセットは変数 news_dataset に読み込まれており、次の属性を持ちます。
news_dataset.data: テキストの配列news_dataset.target: 目的カテゴリを数値インデックスで表した配列
サンプルデータには 5,000 件の観測が含まれます。
この演習はコースの一部です
Kerasで学ぶ言語モデリングのためのRecurrent Neural Networks (RNNs)
演習の手順
Tokenizerクラスをtokenizer変数でインスタンス化します。- テキストデータに対して
tokenizerをフィットします。 - テキストデータに
.texts_to_sequences()メソッドを適用します。 - 目的インデックスを準備するために
to_categorical()関数を使用します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)