始める無料で始める

データの前処理

マルチクラス分類におけるデータ前処理の違いを学びました。ここでは、シンプルなマルチクラス分類モデルの作成を見据えて、前処理を実践しましょう。

データセットは変数 news_dataset に読み込まれており、次の属性を持ちます。

  • news_dataset.data: テキストの配列
  • news_dataset.target: 目的カテゴリを数値インデックスで表した配列

サンプルデータには 5,000 件の観測が含まれます。

この演習はコースの一部です

Kerasで学ぶ言語モデリングのためのRecurrent Neural Networks (RNNs)

コースを見る

演習の手順

  • Tokenizer クラスを tokenizer 変数でインスタンス化します。
  • テキストデータに対して tokenizer をフィットします。
  • テキストデータに .texts_to_sequences() メソッドを適用します。
  • 目的インデックスを準備するために to_categorical() 関数を使用します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
コードを編集して実行