使用 Keras 進行句子分詞
這個練習要帶你實作 Keras 的 Tokenizer。Keras 的 Tokenizer 能用少量程式碼處理關鍵的文字前處理工作。例如,只要呼叫一個函式,Keras 的 Tokenizer 就會自動把詞彙表中的單字對應到 ID。這裡會更詳細地帶你了解它的用法。
你會建立一個 Keras Tokenizer 物件並在一些文字上進行訓練,讓 Tokenizer 建立單字與其對應 ID 的字典。用來訓練 Tokenizer 的文字取自 Udacity Github Repo。
本練習屬於課程
使用 Keras 進行機器翻譯
練習說明
- 建立一個 Keras 的 Tokenizer 物件。
- 在
en_text上訓練分詞器。 - 取得給定清單
["january", "apples", "summer"]中每個單字w的 ID。 - 列印單字以及它對應的 ID。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)