การแบ่งโทเค็นระดับประโยคและคำ
การแบ่งโทเค็น (tokenization) เป็นขั้นตอนแรกที่สำคัญใน NLP ซึ่งเป็นการแบ่งข้อความออกเป็นหน่วยย่อยที่เรียกว่าโทเค็น อันเป็นพื้นฐานสำคัญของการทำงานกับข้อมูลภาษา ในแบบฝึกหัดนี้ให้แบ่งข้อความตัดตอนจากบทความข่าวออกเป็นทั้งประโยคและคำ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import nltk
____
# Download the punkt_tab package
____
text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""
# Tokenize the text into sentences
sentences = ____
print(sentences)