เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การทำ Tokenization ด้วย spaCy

ในแบบฝึกหัดนี้ จะได้ฝึกการทำ tokenization กับข้อความ โดยใช้รีวิวแรกจากชุดข้อมูล Amazon Fine Food Reviews ซึ่งเข้าถึงได้ผ่านออบเจ็กต์ text ที่เตรียมไว้ให้

โมเดล en_core_web_sm โหลดไว้ให้เรียบร้อยแล้ว และสามารถเรียกใช้งานได้ผ่าน nlp() นอกจากนี้ยังสามารถใช้ list comprehension เพื่อสร้าง list ของผลลัพธ์ได้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติด้วย spaCy

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เก็บ Doc container ของรีวิวที่โหลดไว้ล่วงหน้าไว้ในออบเจ็กต์ชื่อ document
  • เก็บและตรวจสอบข้อความของ token ทั้งหมดใน document โดยบันทึกลงในตัวแปร first_text_tokens

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
แก้ไขและรันโค้ด