ทำความสะอาดข้อมูลให้เรียบร้อย
กลับมาที่โปรเจกต์วิเคราะห์ความรู้สึกจาก Twitter กันอีกครั้ง! ในทวีตมักมีสตริงหลายประเภทที่ทำให้การวิเคราะห์ความรู้สึกซับซ้อนขึ้น และไม่ได้ให้ข้อมูลที่เป็นประโยชน์ใดๆ ในแง่ของความรู้สึก เช่น ลิงก์และการกล่าวถึงผู้ใช้งาน
ก่อนจะทำความสะอาดทวีต เราจะดึงตัวอย่างออกมาดูก่อน โดยทั่วไปแล้ว ลิงก์มักขึ้นต้นด้วย http และไม่มีช่องว่าง เช่น https://www.datacamp.com ส่วนการกล่าวถึงผู้ใช้งานจะขึ้นต้นด้วย @ และมีได้เฉพาะตัวอักษรและตัวเลขเท่านั้น เช่น @johnsmith3
ตัวดำเนินการเชิงปริมาณที่เป็นประโยชน์มีดังนี้: * หมายถึงศูนย์ครั้งขึ้นไป, + หมายถึงหนึ่งครั้งขึ้นไป, ? หมายถึงศูนย์หรือหนึ่งครั้ง
ลิสต์ sentiment_analysis ที่มีข้อความของทวีตสามรายการถูกโหลดไว้ในเซสชันแล้ว สามารถใช้ print() เพื่อดูข้อมูลใน IPython Shell ได้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Regular Expressions ใน Python
คำแนะนำการฝึกหัด
- Import โมดูล
re - เขียน regex เพื่อค้นหาการจับคู่ทั้งหมดของลิงก์
httpที่ปรากฏในแต่ละtweetในsentiment_analysisแล้วพิมพ์ผลลัพธ์ - เขียน regex เพื่อค้นหาการจับคู่ทั้งหมดของการกล่าวถึงผู้ใช้งานที่ปรากฏในแต่ละ
tweetในsentiment_analysisแล้วพิมพ์ผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))