เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ส่วนที่ 2: สำรวจชุดข้อมูล

ในแบบฝึกหัดนี้ จะได้สำรวจคุณลักษณะบางอย่างของชุดข้อมูล โดยเฉพาะอย่างยิ่ง จะหาความยาวเฉลี่ย (คือจำนวนคำ) ของประโยคทั้งหมด และขนาดของคลังคำศัพท์สำหรับชุดข้อมูลภาษาอังกฤษ

สำหรับแบบฝึกหัดนี้ ชุดข้อมูลภาษาอังกฤษ en_text ที่มีลิสต์ของประโยคภาษาอังกฤษได้ถูกเตรียมไว้ให้แล้ว นอกจากนี้ยังจะใช้ฟังก์ชัน <list>.extend() ซึ่งเป็นตัวแปรที่แตกต่างจากฟังก์ชัน <list>.append() มาดูความแตกต่างผ่านตัวอย่าง: สมมติว่า a=[1,2,3] และ b=[4,5] การใช้ a.append(b) จะได้ผลลัพธ์เป็นลิสต์ [1,2,3,[4,5]] ในขณะที่ a.extend(b) จะได้ผลลัพธ์เป็น [1,2,3,4,5]

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Translation ด้วย Keras

ดูคอร์ส

คำแนะนำการฝึกหัด

  • คำนวณความยาวของแต่ละประโยคโดยใช้ฟังก์ชัน split() และฟังก์ชัน len() ขณะวนซ้ำผ่าน en_text
  • คำนวณความยาวเฉลี่ยของประโยคโดยใช้ numpy
  • เติมข้อมูลในลิสต์ all_words ภายในส่วนของ for loop โดยเพิ่มคำทั้งหมดที่พบในประโยคหลังจากแบ่งคำแล้ว
  • แปลงลิสต์ all_words เป็นออบเจ็กต์ประเภท set และคำนวณขนาดของ set

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
แก้ไขและรันโค้ด