预处理数据
您已经学习了在多分类任务中进行数据预处理的差异。现在请动手实操,预处理数据,为构建一个简单的多分类模型做准备。
数据集已加载到变量 news_dataset 中,包含以下属性:
news_dataset.data:文本数组news_dataset.target:以数值索引表示的目标类别数组
示例数据包含 5,000 条观测。
本练习是课程的一部分
使用 Keras 构建语言建模的循环神经网络(RNN)
练习说明
- 在变量
tokenizer上实例化Tokenizer类。 - 在文本数据上拟合
tokenizer变量。 - 在文本数据上使用
.texts_to_sequences()方法。 - 使用
to_categorical()函数来准备目标索引。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)