การลบ Stopwords
ในแบบฝึกหัดต่อไปนี้ คุณจะทำความสะอาดอีเมล Enron เพื่อเตรียมข้อมูลสำหรับใช้กับ topic model การทำความสะอาดข้อความอาจมีความซับซ้อน ดังนั้นจะได้เรียนรู้ขั้นตอนต่าง ๆ ที่ช่วยให้ทำได้อย่างมีประสิทธิภาพ โดย dataframe ที่เก็บอีเมลไว้ในตัวแปร df พร้อมใช้งานแล้ว ในขั้นตอนแรก ต้องกำหนดรายการ stopwords และเครื่องหมายวรรคตอนที่จะนำออกจากข้อความในแบบฝึกหัดถัดไป มาลองทำกันเลย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
- นำเข้า stopwords จาก
ntlk - กำหนดคำภาษา 'english' เพื่อใช้เป็น stopwords ในตัวแปร
stop - ดึงชุดเครื่องหมายวรรคตอนจากแพ็กเกจ
stringแล้วกำหนดค่าให้กับexclude
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)