เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแปลงเป็นตัวพิมพ์เล็ก

สมมติว่ากำลังวิเคราะห์รีวิวจากผู้ใช้งานเว็บไซต์ท่องเที่ยว ซึ่งมักมีการใช้ตัวพิมพ์ใหญ่-เล็กไม่สม่ำเสมอ เช่น "TRAVEL" และ "travel" เพื่อเตรียมข้อความสำหรับการวิเคราะห์ความรู้สึกและการดึงหัวข้อ จะต้องแปลงคำทั้งหมดให้เป็นตัวพิมพ์เล็กก่อน จากนั้นจึง tokenize และกำจัด stop words กับเครื่องหมายวรรคตอนออก

ฟังก์ชัน word_tokenize() และรายการ stop_words ได้เตรียมไว้ให้แล้ว และดาวน์โหลด resource ของ NLTK เรียบร้อยแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แปลง review ที่กำหนดให้เป็นตัวพิมพ์เล็กทั้งหมด
  • Tokenize lower_text ให้เป็นคำ
  • ใช้ list comprehension เพื่อกำจัด stop words และเครื่องหมายวรรคตอนโดยอ้างอิงจาก stop_words และ string.punctuation

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"

# Lowercase the review
lower_text = ____

# Tokenize the lower_text into words
tokens = ____

# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]

print(clean_tokens)
แก้ไขและรันโค้ด