开始使用免费开始使用

预处理数据

您已经学习了在多分类任务中进行数据预处理的差异。现在请动手实操,预处理数据,为构建一个简单的多分类模型做准备。

数据集已加载到变量 news_dataset 中,包含以下属性:

  • news_dataset.data:文本数组
  • news_dataset.target:以数值索引表示的目标类别数组

示例数据包含 5,000 条观测。

本练习是课程的一部分

使用 Keras 构建语言建模的循环神经网络(RNN)

查看课程

练习说明

  • 在变量 tokenizer 上实例化 Tokenizer 类。
  • 在文本数据上拟合 tokenizer 变量。
  • 在文本数据上使用 .texts_to_sequences() 方法。
  • 使用 to_categorical() 函数来准备目标索引。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
编辑并运行代码