เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแยกโทเค็น

ขั้นตอนถัดไปคือการแยกโทเค็นจากข้อความในทวีต Tokenization คือกระบวนการแบ่งสตริงออกเป็นหน่วยคำ หรือพูดให้ง่ายขึ้นก็คือการแบ่งออกเป็นคำๆ นั่นเอง แต่ก่อนอื่น ต้องลบแฮชแท็กออกก่อนเพื่อไม่ให้รบกวนกระบวนการ แฮชแท็กจะเริ่มต้นด้วยสัญลักษณ์ # และประกอบด้วยตัวอักษรกับตัวเลข แต่ไม่มีช่องว่าง จากนั้นจึงแบ่งข้อความที่ตำแหน่งช่องว่างเพื่อดึงโทเค็นออกมา

ใช้รายการตัวกำหนดจำนวนต่อไปนี้เป็นตัวช่วย: * ศูนย์ครั้งขึ้นไป, + หนึ่งครั้งขึ้นไป, ? ศูนย์หรือหนึ่งครั้ง, {n, m} ขั้นต่ำ n ครั้ง สูงสุด m ครั้ง

ตัวแปร sentiment_analysis ที่เก็บข้อความของทวีตหนึ่งรายการ รวมถึงโมดูล re ถูกโหลดไว้ในเซสชันแล้ว สามารถใช้ print(sentiment_analysis) เพื่อดูข้อความใน IPython Shell ได้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Regular Expressions ใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Write a regex matching the hashtag pattern
regex = r"____"
แก้ไขและรันโค้ด