การประมวลผลข้อความด้วย spaCy
แอปพลิเคชัน NLP ทุกตัวประกอบด้วยขั้นตอนการประมวลผลข้อความหลายขั้นตอน คุณได้เรียนรู้ขั้นตอนบางส่วนไปแล้ว เช่น การแบ่งโทเค็น (tokenization), การทำ lemmatization, การแบ่งประโยค และการรู้จำชื่อเฉพาะ (named entity recognition)
ในแบบฝึกหัดนี้ จะได้ฝึกใช้ขั้นตอนการประมวลผลข้อความใน spaCy ต่อ ทั้งการแบ่งข้อความเป็นประโยคและการดึงชื่อเฉพาะออกมา โดยใช้รีวิวอาหาร 5 รายการแรกจากชุดข้อมูล Amazon Fine Food Reviews ซึ่งเข้าถึงได้ผ่านออบเจกต์ texts
โมเดล en_core_web_sm ถูกโหลดไว้ให้แล้ว เข้าถึงได้ผ่าน nlp และรายการ Doc containers สำหรับแต่ละรายการใน texts ก็ถูกโหลดไว้ล่วงหน้าแล้วเช่นกัน เข้าถึงได้ที่ documents
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติด้วย spaCy
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)