Lemmatization
ระหว่างวิเคราะห์รีวิวของผู้ใช้ต่อไป คุณสังเกตว่า stemming บางครั้งให้คำที่ไม่ได้มาตรฐาน เช่น "fli" จาก "flying" ซึ่งทำให้อ่านและตีความได้ยากขึ้น เพื่อแก้ปัญหานี้ จะใช้ lemmatization แทน เนื่องจากให้ผลลัพธ์เป็นคำที่ถูกต้องตามพจนานุกรม ช่วยให้การวิเคราะห์ชัดเจนและแม่นยำยิ่งขึ้น
ได้นำเข้า WordNetLemmatizer แล้ว, กำหนด stop_words แล้ว และดาวน์โหลด NLTK resources ที่จำเป็นแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python
คำแนะนำการฝึกหัด
- สร้าง instance ชื่อ
lemmatizerจากคลาสWordNetLemmatizer() - ใช้
lemmatizerเพื่อทำ lemmatization กับlower_tokens
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']
# Create lemmatizer
lemmatizer = ____()
# Lemmatize each token
lemmatized_tokens = [____.____(____) for ____ in clean_tokens]
print(lemmatized_tokens)