ทำความสะอาดบทความบล็อก
ในแบบฝึกหัดนี้ มีข้อความที่ตัดมาจากบทความบล็อกให้ งานของคุณคือทำความสะอาดข้อความนี้ให้อยู่ในรูปแบบที่เครื่องประมวลผลได้ง่ายขึ้น ซึ่งได้แก่ การแปลงเป็นตัวพิมพ์เล็ก การทำ lemmatization และการลบ stopwords เครื่องหมายวรรคตอน รวมถึงอักขระที่ไม่ใช่ตัวอักษร
ข้อความดังกล่าวอยู่ในตัวแปร blog ชนิด string และได้แสดงผลใน console แล้ว รายการ stopwords อยู่ในตัวแปร stopwords
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
คำแนะนำการฝึกหัด
- ใช้ list comprehension วนลูปผ่าน
docเพื่อดึงค่าlemma_ของแต่ละ token - ลบ stopwords และ token ที่ไม่ใช่ตัวอักษรออก โดยใช้
stopwordsและisalpha()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))