第 2 部分:探索資料集
現在你要探索資料集的一些屬性。你將計算所有句子的平均長度(也就是單字數),以及英文資料集的詞彙表大小。
在這個練習中,已提供包含英文句子清單的英文資料集 en_text。你會使用一個與 Python 清單相關的函式 <list>.extend(),它和 <list>.append() 是不同的變體。我們用例子來理解差異。假設 a=[1,2,3],b=[4,5]。a.append(b) 會得到清單 [1,2,3,[4,5]],而 a.extend(b) 會得到 [1,2,3,4,5]。
本練習屬於課程
使用 Keras 進行機器翻譯
練習說明
- 使用
split()與len()搭配迭代en_text,計算每個句子的長度。 - 使用
numpy計算句子長度的平均值。 - 在 for 迴圈本體中,將斷詞後的所有單字加入清單
all_words。 - 將清單
all_words轉成set物件,並計算該 set 的長度/大小。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)