เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Stemming

หลังจากที่ทำความสะอาดข้อความใน review และลบ stop words กับเครื่องหมายวรรคตอนออกแล้ว ขั้นตอนต่อไปคือการ normalize คำที่เหลือด้วย stemming เพื่อลดคำให้เหลือรูปรากศัพท์ วิธีนี้ช่วยจัดกลุ่มคำที่มีความหมายใกล้เคียงกันไว้ด้วยกัน ทำให้การวิเคราะห์มีความสอดคล้องและมีประสิทธิภาพมากขึ้น

มีการเตรียม class PorterStemmer และรายการ clean_tokens ไว้ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง instance ของ PorterStemmer()
  • ใช้ list comprehension เพื่อทำ stemming กับแต่ละ token ใน clean_tokens

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']

# Create stemmer
stemmer = ____()

# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]

print(stemmed_tokens)
แก้ไขและรันโค้ด