การ Tokenize ประโยคด้วย Keras
ในแบบฝึกหัดนี้ จะได้ลงมือใช้งาน Tokenizer ของ Keras กันจริง ๆ Tokenizer ของ Keras เป็นเครื่องมือที่มีประโยชน์มาก ช่วยให้ประมวลผลข้อความที่สำคัญได้ด้วยโค้ดเพียงไม่กี่บรรทัด ตัวอย่างเช่น Tokenizer ของ Keras สามารถแมปคำในคลังคำศัพท์ให้เป็น ID ได้โดยอัตโนมัติด้วยการเรียกฟังก์ชันเพียงครั้งเดียว ในแบบฝึกหัดนี้จะได้เรียนรู้เรื่องนี้อย่างละเอียดมากขึ้น
จะได้สร้างออบเจ็กต์ Tokenizer ของ Keras และ fit กับข้อความที่กำหนด ซึ่งจะช่วยให้ Tokenizer สร้างพจนานุกรมของคำและ ID ที่สอดคล้องกันได้ ข้อความที่ใช้ฝึก Tokenizer นี้ได้มาจาก Udacity Github Repo
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Translation ด้วย Keras
คำแนะนำการฝึกหัด
- กำหนดออบเจ็กต์ Keras Tokenizer
- Fit tokenizer กับ
en_text - ดึง word ID ของแต่ละคำ
wในลิสต์["january", "apples", "summer"] - พิมพ์คำและ ID ที่สอดคล้องกัน
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)