เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การ Tokenize ประโยคด้วย Keras

ในแบบฝึกหัดนี้ จะได้ลงมือใช้งาน Tokenizer ของ Keras กันจริง ๆ Tokenizer ของ Keras เป็นเครื่องมือที่มีประโยชน์มาก ช่วยให้ประมวลผลข้อความที่สำคัญได้ด้วยโค้ดเพียงไม่กี่บรรทัด ตัวอย่างเช่น Tokenizer ของ Keras สามารถแมปคำในคลังคำศัพท์ให้เป็น ID ได้โดยอัตโนมัติด้วยการเรียกฟังก์ชันเพียงครั้งเดียว ในแบบฝึกหัดนี้จะได้เรียนรู้เรื่องนี้อย่างละเอียดมากขึ้น

จะได้สร้างออบเจ็กต์ Tokenizer ของ Keras และ fit กับข้อความที่กำหนด ซึ่งจะช่วยให้ Tokenizer สร้างพจนานุกรมของคำและ ID ที่สอดคล้องกันได้ ข้อความที่ใช้ฝึก Tokenizer นี้ได้มาจาก Udacity Github Repo

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Translation ด้วย Keras

ดูคอร์ส

คำแนะนำการฝึกหัด

  • กำหนดออบเจ็กต์ Keras Tokenizer
  • Fit tokenizer กับ en_text
  • ดึง word ID ของแต่ละคำ w ในลิสต์ ["january", "apples", "summer"]
  • พิมพ์คำและ ID ที่สอดคล้องกัน

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
แก้ไขและรันโค้ด