ส่วนที่ 2: สำรวจชุดข้อมูล
ในแบบฝึกหัดนี้ จะได้สำรวจคุณลักษณะบางอย่างของชุดข้อมูล โดยเฉพาะอย่างยิ่ง จะหาความยาวเฉลี่ย (คือจำนวนคำ) ของประโยคทั้งหมด และขนาดของคลังคำศัพท์สำหรับชุดข้อมูลภาษาอังกฤษ
สำหรับแบบฝึกหัดนี้ ชุดข้อมูลภาษาอังกฤษ en_text ที่มีลิสต์ของประโยคภาษาอังกฤษได้ถูกเตรียมไว้ให้แล้ว นอกจากนี้ยังจะใช้ฟังก์ชัน <list>.extend() ซึ่งเป็นตัวแปรที่แตกต่างจากฟังก์ชัน <list>.append() มาดูความแตกต่างผ่านตัวอย่าง: สมมติว่า a=[1,2,3] และ b=[4,5] การใช้ a.append(b) จะได้ผลลัพธ์เป็นลิสต์ [1,2,3,[4,5]] ในขณะที่ a.extend(b) จะได้ผลลัพธ์เป็น [1,2,3,4,5]
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Translation ด้วย Keras
คำแนะนำการฝึกหัด
- คำนวณความยาวของแต่ละประโยคโดยใช้ฟังก์ชัน
split()และฟังก์ชันlen()ขณะวนซ้ำผ่านen_text - คำนวณความยาวเฉลี่ยของประโยคโดยใช้
numpy - เติมข้อมูลในลิสต์
all_wordsภายในส่วนของ for loop โดยเพิ่มคำทั้งหมดที่พบในประโยคหลังจากแบ่งคำแล้ว - แปลงลิสต์
all_wordsเป็นออบเจ็กต์ประเภทsetและคำนวณขนาดของ set
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)