เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การประมวลผลข้อความด้วย spaCy

แอปพลิเคชัน NLP ทุกตัวประกอบด้วยขั้นตอนการประมวลผลข้อความหลายขั้นตอน คุณได้เรียนรู้ขั้นตอนบางส่วนไปแล้ว เช่น การแบ่งโทเค็น (tokenization), การทำ lemmatization, การแบ่งประโยค และการรู้จำชื่อเฉพาะ (named entity recognition)

spaCy NLP Pipeline

ในแบบฝึกหัดนี้ จะได้ฝึกใช้ขั้นตอนการประมวลผลข้อความใน spaCy ต่อ ทั้งการแบ่งข้อความเป็นประโยคและการดึงชื่อเฉพาะออกมา โดยใช้รีวิวอาหาร 5 รายการแรกจากชุดข้อมูล Amazon Fine Food Reviews ซึ่งเข้าถึงได้ผ่านออบเจกต์ texts

โมเดล en_core_web_sm ถูกโหลดไว้ให้แล้ว เข้าถึงได้ผ่าน nlp และรายการ Doc containers สำหรับแต่ละรายการใน texts ก็ถูกโหลดไว้ล่วงหน้าแล้วเช่นกัน เข้าถึงได้ที่ documents

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติด้วย spaCy

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]

# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)
แก้ไขและรันโค้ด