เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การลบ stop words

คุณกำลังทำโปรเจกต์ที่มีเป้าหมายจำแนกความคิดเห็นของผู้ใช้งานออกเป็นหมวดหมู่ต่าง ๆ เช่น "ปัญหาเกี่ยวกับสินค้า" "ปัญหาเกี่ยวกับบริการ" และ "ข้อเสนอแนะ" โดยทั่วไป stop words มักไม่ได้ช่วยในการแยกแยะหมวดหมู่มากนัก งานของคุณคือการลบ stop words เหล่านี้ออก เพื่อให้โมเดลสามารถโฟกัสกับคำที่มีความหมายสำคัญในการจัดกลุ่มความคิดเห็นได้อย่างถูกต้อง

ฟังก์ชัน word_tokenize จาก nltk.tokenize และ stopwords.words จาก nltk.corpus ได้ถูก import ไว้ให้แล้ว นอกจากนี้ ยังได้ดาวน์โหลด NLTK resources อย่าง punkt_tab และ stopwords เรียบร้อยแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Tokenize ความคิดเห็นที่กำหนดให้ในระดับคำ
  • ดึงรายการ stop words ภาษาอังกฤษ
  • ลบ stop words ภาษาอังกฤษออก แล้วบันทึกผลลัพธ์ไว้ใน filtered_tokens

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"

# Tokenize the text
tokens = word_tokenize(____)

# Get the list of English stop words
stop_words = stopwords.____('____')

# Remove stop words 
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]

print(filtered_tokens)
แก้ไขและรันโค้ด