Stemming
หลังจากที่ทำความสะอาดข้อความใน review และลบ stop words กับเครื่องหมายวรรคตอนออกแล้ว ขั้นตอนต่อไปคือการ normalize คำที่เหลือด้วย stemming เพื่อลดคำให้เหลือรูปรากศัพท์ วิธีนี้ช่วยจัดกลุ่มคำที่มีความหมายใกล้เคียงกันไว้ด้วยกัน ทำให้การวิเคราะห์มีความสอดคล้องและมีประสิทธิภาพมากขึ้น
มีการเตรียม class PorterStemmer และรายการ clean_tokens ไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python
คำแนะนำการฝึกหัด
- สร้าง instance ของ
PorterStemmer() - ใช้ list comprehension เพื่อทำ stemming กับแต่ละ token ใน
clean_tokens
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']
# Create stemmer
stemmer = ____()
# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]
print(stemmed_tokens)