开始使用免费开始使用

使用 Keras 对句子进行分词

现在让我们动手实践 Keras 的 Tokenizer。Keras 的 Tokenizer 是非常实用的工具,只需几行代码就能完成关键的文本处理。例如,Tokenizer 可以通过一次函数调用,自动将词汇表中的单词映射为 ID。这里,您将更详细地学习这一点。

您将创建一个 Keras Tokenizer 对象,并在一些文本上进行拟合,让 Tokenizer 构建由单词及其对应 ID 组成的词典。用于训练 Tokenizer 的文本来自 Udacity Github Repo

本练习是课程的一部分

使用 Keras 的机器翻译

查看课程

练习说明

  • 定义一个 Keras Tokenizer 对象。
  • en_text 上拟合该分词器。
  • 获取给定列表 ["january", "apples", "summer"] 中每个单词 w 的 ID。
  • 打印该单词及其对应的 ID。

交互式实操练习

通过完成这段示例代码来试试这个练习。

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
编辑并运行代码