ไปป์ไลน์การประมวลผลข้อความภาษาเชกสเปียร์
ทีมงาน PyBooks ต้องการแปลงข้อมูลข้อความจากวรรณกรรมเชกสเปียร์จำนวนมากเพื่อนำไปวิเคราะห์ต่อ วิธีที่มีประสิทธิภาพที่สุดคือการสร้างไปป์ไลน์การประมวลผลข้อความ โดยเริ่มจากขั้นตอนการเตรียมข้อมูล
ไลบรารีต่อไปนี้ถูกโหลดไว้ให้แล้ว:
torch, nltk, stopwords, PorterStemmer, get_tokenizer.
ข้อมูลข้อความเชกสเปียร์ถูกบันทึกไว้ในตัวแปร shakespeare และมีการแยกประโยคออกมาแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Deep Learning สำหรับข้อความด้วย PyTorch
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a list of stopwords
stop_words = set(____(____))