การแบ่งประโยคด้วย spaCy
ในแบบฝึกหัดนี้ จะได้ฝึกการแบ่งประโยค (sentence segmentation) ซึ่งเป็นการดำเนินการพื้นฐานที่มีประโยชน์ใน NLP การแบ่งเอกสารออกเป็นประโยค ๆ ถือเป็นหนึ่งในขั้นตอนแรกของงาน NLP ที่ซับซ้อนกว่า เช่น การตรวจจับ named entities นอกจากนี้ การนับจำนวนประโยคยังช่วยให้เข้าใจปริมาณข้อมูลที่ข้อความนั้นให้ไว้ได้อีกด้วย
สามารถเข้าถึงรีวิวอาหารทั้ง 10 รายการได้จากลิสต์ชื่อ texts
โมเดล en_core_web_sm ถูกโหลดไว้ให้แล้วในชื่อ nlp และ .
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติด้วย spaCy
คำแนะนำการฝึกหัด
- รันโมเดล
spaCyกับแต่ละ item ในtextsเพื่อสร้างdocumentsซึ่งเป็นลิสต์ของDoccontainers ทั้งหมด - ดึงประโยคจาก
doccontainer แต่ละตัวโดยวนซ้ำผ่านลิสต์documentsแล้ว append เข้าไปในลิสต์ชื่อsentences - นับจำนวนประโยคใน
doccontainer แต่ละตัวโดยใช้ลิสต์sentences
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])