ส่วนที่ 1: สำรวจชุดข้อมูล
ในแบบฝึกหัดนี้ เราจะมาสำรวจชุดข้อมูลกันสักเล็กน้อย โดยเริ่มจากการทำความเข้าใจว่าข้อมูลมีหน้าตาเป็นอย่างไร จากนั้นจะลองพิมพ์ข้อมูลบางส่วนและเรียนรู้วิธีแบ่งประโยคในข้อมูลออกเป็นคำแต่ละคำ (tokenization) สำหรับภาษาอังกฤษ การแบ่งคำดูเหมือนเป็นเรื่องง่าย แต่บางภาษา เช่น ภาษาญี่ปุ่น ไม่ได้มีขอบเขตคำที่ชัดเจนเหมือนภาษาอังกฤษ
สำหรับแบบฝึกหัดนี้ มีชุดข้อมูลให้ 2 ชุด ได้แก่ en_text และ fr_text โดย en_text เก็บรายการประโยคภาษาอังกฤษ และ fr_text เก็บรายการประโยคภาษาฝรั่งเศสที่สอดคล้องกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Translation ด้วย Keras
คำแนะนำการฝึกหัด
- เขียนฟังก์ชัน
zip()เพื่อวนซ้ำผ่าน 5 ประโยคแรกของประโยคภาษาอังกฤษ (en_text) และประโยคภาษาฝรั่งเศส (fr_text) - ดึงประโยคแรกจาก
en_text - แบ่งคำในประโยคที่ได้โดยใช้ฟังก์ชัน
split()กับอักขระเว้นวรรค แล้วกำหนดผลลัพธ์ให้กับตัวแปรfirst_words - พิมพ์คำที่แบ่งได้ออกมา
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)