เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ส่วนที่ 1: สำรวจชุดข้อมูล

ในแบบฝึกหัดนี้ เราจะมาสำรวจชุดข้อมูลกันสักเล็กน้อย โดยเริ่มจากการทำความเข้าใจว่าข้อมูลมีหน้าตาเป็นอย่างไร จากนั้นจะลองพิมพ์ข้อมูลบางส่วนและเรียนรู้วิธีแบ่งประโยคในข้อมูลออกเป็นคำแต่ละคำ (tokenization) สำหรับภาษาอังกฤษ การแบ่งคำดูเหมือนเป็นเรื่องง่าย แต่บางภาษา เช่น ภาษาญี่ปุ่น ไม่ได้มีขอบเขตคำที่ชัดเจนเหมือนภาษาอังกฤษ

สำหรับแบบฝึกหัดนี้ มีชุดข้อมูลให้ 2 ชุด ได้แก่ en_text และ fr_text โดย en_text เก็บรายการประโยคภาษาอังกฤษ และ fr_text เก็บรายการประโยคภาษาฝรั่งเศสที่สอดคล้องกัน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Translation ด้วย Keras

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เขียนฟังก์ชัน zip() เพื่อวนซ้ำผ่าน 5 ประโยคแรกของประโยคภาษาอังกฤษ (en_text) และประโยคภาษาฝรั่งเศส (fr_text)
  • ดึงประโยคแรกจาก en_text
  • แบ่งคำในประโยคที่ได้โดยใช้ฟังก์ชัน split() กับอักขระเว้นวรรค แล้วกำหนดผลลัพธ์ให้กับตัวแปร first_words
  • พิมพ์คำที่แบ่งได้ออกมา

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):  
  print("English: ", en_sent)
  print("\tFrench: ", fr_sent)

# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)
แก้ไขและรันโค้ด