使用 Keras 对句子进行分词
现在让我们动手实践 Keras 的 Tokenizer。Keras 的 Tokenizer 是非常实用的工具,只需几行代码就能完成关键的文本处理。例如,Tokenizer 可以通过一次函数调用,自动将词汇表中的单词映射为 ID。这里,您将更详细地学习这一点。
您将创建一个 Keras Tokenizer 对象,并在一些文本上进行拟合,让 Tokenizer 构建由单词及其对应 ID 组成的词典。用于训练 Tokenizer 的文本来自 Udacity Github Repo。
本练习是课程的一部分
使用 Keras 的机器翻译
练习说明
- 定义一个 Keras Tokenizer 对象。
- 在
en_text上拟合该分词器。 - 获取给定列表
["january", "apples", "summer"]中每个单词w的 ID。 - 打印该单词及其对应的 ID。
交互式实操练习
通过完成这段示例代码来试试这个练习。
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)