เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ทำความสะอาดบทความบล็อก

ในแบบฝึกหัดนี้ มีข้อความที่ตัดมาจากบทความบล็อกให้ งานของคุณคือทำความสะอาดข้อความนี้ให้อยู่ในรูปแบบที่เครื่องประมวลผลได้ง่ายขึ้น ซึ่งได้แก่ การแปลงเป็นตัวพิมพ์เล็ก การทำ lemmatization และการลบ stopwords เครื่องหมายวรรคตอน รวมถึงอักขระที่ไม่ใช่ตัวอักษร

ข้อความดังกล่าวอยู่ในตัวแปร blog ชนิด string และได้แสดงผลใน console แล้ว รายการ stopwords อยู่ในตัวแปร stopwords

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering for NLP in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใช้ list comprehension วนลูปผ่าน doc เพื่อดึงค่า lemma_ ของแต่ละ token
  • ลบ stopwords และ token ที่ไม่ใช่ตัวอักษรออก โดยใช้ stopwords และ isalpha()

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
แก้ไขและรันโค้ด