開始使用免費開始

使用 Keras 進行句子分詞

這個練習要帶你實作 Keras 的 Tokenizer。Keras 的 Tokenizer 能用少量程式碼處理關鍵的文字前處理工作。例如,只要呼叫一個函式,Keras 的 Tokenizer 就會自動把詞彙表中的單字對應到 ID。這裡會更詳細地帶你了解它的用法。

你會建立一個 Keras Tokenizer 物件並在一些文字上進行訓練,讓 Tokenizer 建立單字與其對應 ID 的字典。用來訓練 Tokenizer 的文字取自 Udacity Github Repo

本練習屬於課程

使用 Keras 進行機器翻譯

檢視課程

練習說明

  • 建立一個 Keras 的 Tokenizer 物件。
  • en_text 上訓練分詞器。
  • 取得給定清單 ["january", "apples", "summer"] 中每個單字 w 的 ID。
  • 列印單字以及它對應的 ID。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
編輯並執行程式碼