Lemmatization ด้วย spaCy
ในแบบฝึกหัดนี้ จะได้ฝึกใช้งาน lemmatization ซึ่งช่วยให้ได้รูปฐานของคำที่มีการผันรูปต่าง ๆ กล่าวคือ สำหรับประโยคใด ๆ จำนวน lemma จะน้อยกว่าหรือเท่ากับจำนวน token เสมอ
รีวิวอาหาร Amazon รายการแรกถูกเก็บไว้ในตัวแปร string ชื่อ text โดยโหลด en_core_web_sm ไว้เป็น nlp และประมวลผล text แล้ว ได้เป็น document ซึ่งเป็น Doc container สำหรับข้อความนั้น
tokens คือ list ที่เก็บ token ทั้งหมดของ text และถูกโหลดไว้พร้อมใช้งานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติด้วย spaCy
คำแนะนำการฝึกหัด
- เพิ่ม lemma ของ token ทุกตัวใน
documentเข้าไปใน list จากนั้นพิมพ์lemmasออกมา - พิมพ์
tokenslist และสังเกตความแตกต่างระหว่างtokensกับlemmas
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)