เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแบ่งประโยคด้วย spaCy

ในแบบฝึกหัดนี้ จะได้ฝึกการแบ่งประโยค (sentence segmentation) ซึ่งเป็นการดำเนินการพื้นฐานที่มีประโยชน์ใน NLP การแบ่งเอกสารออกเป็นประโยค ๆ ถือเป็นหนึ่งในขั้นตอนแรกของงาน NLP ที่ซับซ้อนกว่า เช่น การตรวจจับ named entities นอกจากนี้ การนับจำนวนประโยคยังช่วยให้เข้าใจปริมาณข้อมูลที่ข้อความนั้นให้ไว้ได้อีกด้วย

สามารถเข้าถึงรีวิวอาหารทั้ง 10 รายการได้จากลิสต์ชื่อ texts

โมเดล en_core_web_sm ถูกโหลดไว้ให้แล้วในชื่อ nlp และ .

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติด้วย spaCy

ดูคอร์ส

คำแนะนำการฝึกหัด

  • รันโมเดล spaCy กับแต่ละ item ใน texts เพื่อสร้าง documents ซึ่งเป็นลิสต์ของ Doc containers ทั้งหมด
  • ดึงประโยคจาก doc container แต่ละตัวโดยวนซ้ำผ่านลิสต์ documents แล้ว append เข้าไปในลิสต์ชื่อ sentences
  • นับจำนวนประโยคใน doc container แต่ละตัวโดยใช้ลิสต์ sentences

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]

# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
  sentences.append([s for s in ____.____])
  
# Find number of sentences per each doc container
print([len(____) for s in sentences])
แก้ไขและรันโค้ด