เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Lemmatization ด้วย spaCy

ในแบบฝึกหัดนี้ จะได้ฝึกใช้งาน lemmatization ซึ่งช่วยให้ได้รูปฐานของคำที่มีการผันรูปต่าง ๆ กล่าวคือ สำหรับประโยคใด ๆ จำนวน lemma จะน้อยกว่าหรือเท่ากับจำนวน token เสมอ

รีวิวอาหาร Amazon รายการแรกถูกเก็บไว้ในตัวแปร string ชื่อ text โดยโหลด en_core_web_sm ไว้เป็น nlp และประมวลผล text แล้ว ได้เป็น document ซึ่งเป็น Doc container สำหรับข้อความนั้น

tokens คือ list ที่เก็บ token ทั้งหมดของ text และถูกโหลดไว้พร้อมใช้งานแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติด้วย spaCy

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เพิ่ม lemma ของ token ทุกตัวใน document เข้าไปใน list จากนั้นพิมพ์ lemmas ออกมา
  • พิมพ์ tokens list และสังเกตความแตกต่างระหว่าง tokens กับ lemmas

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
แก้ไขและรันโค้ด