Keras で文をトークン化する
ここでは Keras の Tokenizer を実際に使ってみます。Keras の Tokenizer は、数行のコードで重要なテキスト前処理を行える便利なユーティリティです。たとえば、Keras の Tokenizer は、たった1回の関数呼び出しで語彙中の単語を ID に自動でマッピングしてくれます。ここでは、その詳細を学びます。
Keras の Tokenizer オブジェクトを作成し、いくつかのテキストに適合させます。これにより、Tokenizer は単語とその対応する ID の辞書を構築できます。Tokenizer の学習に使うテキストは、Udacity Github Repo から取得したものです。
この演習はコースの一部です
Kerasで学ぶMachine Translation
演習の手順
- Keras の Tokenizer オブジェクトを定義します。
en_textに対してトークナイザを適合させます。- 与えられたリスト
["january", "apples", "summer"]の各単語wの単語 ID を取得します。 - 単語とその対応する ID を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)