第 2 部分:探索数据集
现在,您将探索数据集的一些属性。具体来说,您将计算所有句子的平均长度(即词数)以及英文数据集的词汇表大小。
在本练习中,已为您提供包含英文句子列表的英文数据集 en_text。本练习将使用一个与 Python 列表相关的函数 <list>.extend(),它与函数 <list>.append() 不同。我们通过一个例子来理解差异。设 a=[1,2,3] 且 b=[4,5]。执行 a.append(b) 会得到列表 [1,2,3,[4,5]],而 a.extend(b) 会得到 [1,2,3,4,5]。
本练习是课程的一部分
使用 Keras 的机器翻译
练习说明
- 在遍历
en_text时,使用split()和len()计算每个句子的长度。 - 使用
numpy计算句子平均长度。 - 在 for 循环体中,先对句子分词,再将出现的所有单词加入列表
all_words。 - 将列表
all_words转换为set对象,并计算该 set 的长度/大小。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)