เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Lemmatization

ระหว่างวิเคราะห์รีวิวของผู้ใช้ต่อไป คุณสังเกตว่า stemming บางครั้งให้คำที่ไม่ได้มาตรฐาน เช่น "fli" จาก "flying" ซึ่งทำให้อ่านและตีความได้ยากขึ้น เพื่อแก้ปัญหานี้ จะใช้ lemmatization แทน เนื่องจากให้ผลลัพธ์เป็นคำที่ถูกต้องตามพจนานุกรม ช่วยให้การวิเคราะห์ชัดเจนและแม่นยำยิ่งขึ้น

ได้นำเข้า WordNetLemmatizer แล้ว, กำหนด stop_words แล้ว และดาวน์โหลด NLTK resources ที่จำเป็นแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง instance ชื่อ lemmatizer จากคลาส WordNetLemmatizer()
  • ใช้ lemmatizer เพื่อทำ lemmatization กับ lower_tokens

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']

# Create lemmatizer
lemmatizer = ____()

# Lemmatize each token
lemmatized_tokens = [____.____(____) for ____ in clean_tokens]

print(lemmatized_tokens)
แก้ไขและรันโค้ด