始める無料で始める

Keras で文をトークン化する

ここでは Keras の Tokenizer を実際に使ってみます。Keras の Tokenizer は、数行のコードで重要なテキスト前処理を行える便利なユーティリティです。たとえば、Keras の Tokenizer は、たった1回の関数呼び出しで語彙中の単語を ID に自動でマッピングしてくれます。ここでは、その詳細を学びます。

Keras の Tokenizer オブジェクトを作成し、いくつかのテキストに適合させます。これにより、Tokenizer は単語とその対応する ID の辞書を構築できます。Tokenizer の学習に使うテキストは、Udacity Github Repo から取得したものです。

この演習はコースの一部です

Kerasで学ぶMachine Translation

コースを見る

演習の手順

  • Keras の Tokenizer オブジェクトを定義します。
  • en_text に対してトークナイザを適合させます。
  • 与えられたリスト ["january", "apples", "summer"] の各単語 w の単語 ID を取得します。
  • 単語とその対応する ID を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
コードを編集して実行