การลบ stop words
คุณกำลังทำโปรเจกต์ที่มีเป้าหมายจำแนกความคิดเห็นของผู้ใช้งานออกเป็นหมวดหมู่ต่าง ๆ เช่น "ปัญหาเกี่ยวกับสินค้า" "ปัญหาเกี่ยวกับบริการ" และ "ข้อเสนอแนะ" โดยทั่วไป stop words มักไม่ได้ช่วยในการแยกแยะหมวดหมู่มากนัก งานของคุณคือการลบ stop words เหล่านี้ออก เพื่อให้โมเดลสามารถโฟกัสกับคำที่มีความหมายสำคัญในการจัดกลุ่มความคิดเห็นได้อย่างถูกต้อง
ฟังก์ชัน word_tokenize จาก nltk.tokenize และ stopwords.words จาก nltk.corpus ได้ถูก import ไว้ให้แล้ว นอกจากนี้ ยังได้ดาวน์โหลด NLTK resources อย่าง punkt_tab และ stopwords เรียบร้อยแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python
คำแนะนำการฝึกหัด
- Tokenize ความคิดเห็นที่กำหนดให้ในระดับคำ
- ดึงรายการ stop words ภาษาอังกฤษ
- ลบ stop words ภาษาอังกฤษออก แล้วบันทึกผลลัพธ์ไว้ใน
filtered_tokens
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)