開始使用免費開始

第 2 部分:探索資料集

現在你要探索資料集的一些屬性。你將計算所有句子的平均長度(也就是單字數),以及英文資料集的詞彙表大小。

在這個練習中,已提供包含英文句子清單的英文資料集 en_text。你會使用一個與 Python 清單相關的函式 <list>.extend(),它和 <list>.append() 是不同的變體。我們用例子來理解差異。假設 a=[1,2,3]b=[4,5]a.append(b) 會得到清單 [1,2,3,[4,5]],而 a.extend(b) 會得到 [1,2,3,4,5]

本練習屬於課程

使用 Keras 進行機器翻譯

檢視課程

練習說明

  • 使用 split()len() 搭配迭代 en_text,計算每個句子的長度。
  • 使用 numpy 計算句子長度的平均值。
  • 在 for 迴圈本體中,將斷詞後的所有單字加入清單 all_words
  • 將清單 all_words 轉成 set 物件,並計算該 set 的長度/大小。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
編輯並執行程式碼