การ Tokenize คำปราศรัย Gettysburg Address
ในแบบฝึกหัดนี้ คุณจะได้ทำ tokenization กับหนึ่งในสุนทรพจน์ที่โด่งดังที่สุดตลอดกาล นั่นคือ Gettysburg Address ที่ประธานาธิบดีอับราฮัม ลินคอล์นกล่าวไว้ในช่วงสงครามกลางเมืองอเมริกา
สุนทรพจน์ทั้งหมดอยู่ในรูปแบบ string ชื่อ gettysburg
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
คำแนะนำการฝึกหัด
- โหลดโมเดล
en_core_web_smโดยใช้spacy.load() - สร้าง Doc object ชื่อ
docสำหรับ stringgettysburg - ใช้ list comprehension วนลูปผ่าน
docเพื่อดึงข้อความของแต่ละ token
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
import spacy
# Load the en_core_web_sm model
nlp = ____.____(____)
# Create a Doc object
doc = ____(____)
# Generate the tokens
tokens = [token.____ for token in ____]
print(tokens)