เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแบ่งโทเค็นระดับประโยคและคำ

การแบ่งโทเค็น (tokenization) เป็นขั้นตอนแรกที่สำคัญใน NLP ซึ่งเป็นการแบ่งข้อความออกเป็นหน่วยย่อยที่เรียกว่าโทเค็น อันเป็นพื้นฐานสำคัญของการทำงานกับข้อมูลภาษา ในแบบฝึกหัดนี้ให้แบ่งข้อความตัดตอนจากบทความข่าวออกเป็นทั้งประโยคและคำ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import nltk
____
# Download the punkt_tab package 
____

text = """
The stock market saw a significant dip today. Experts believe the downturn may continue.
However, many investors are optimistic about future growth.
"""

# Tokenize the text into sentences
sentences = ____
print(sentences)
แก้ไขและรันโค้ด