การทำ Tokenization ด้วย spaCy
ในแบบฝึกหัดนี้ จะได้ฝึกการทำ tokenization กับข้อความ โดยใช้รีวิวแรกจากชุดข้อมูล Amazon Fine Food Reviews ซึ่งเข้าถึงได้ผ่านออบเจ็กต์ text ที่เตรียมไว้ให้
โมเดล en_core_web_sm โหลดไว้ให้เรียบร้อยแล้ว และสามารถเรียกใช้งานได้ผ่าน nlp() นอกจากนี้ยังสามารถใช้ list comprehension เพื่อสร้าง list ของผลลัพธ์ได้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติด้วย spaCy
คำแนะนำการฝึกหัด
- เก็บ Doc container ของรีวิวที่โหลดไว้ล่วงหน้าไว้ในออบเจ็กต์ชื่อ
document - เก็บและตรวจสอบข้อความของ token ทั้งหมดใน
documentโดยบันทึกลงในตัวแปรfirst_text_tokens
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")