เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ทำความสะอาดข้อมูลให้เรียบร้อย

กลับมาที่โปรเจกต์วิเคราะห์ความรู้สึกจาก Twitter กันอีกครั้ง! ในทวีตมักมีสตริงหลายประเภทที่ทำให้การวิเคราะห์ความรู้สึกซับซ้อนขึ้น และไม่ได้ให้ข้อมูลที่เป็นประโยชน์ใดๆ ในแง่ของความรู้สึก เช่น ลิงก์และการกล่าวถึงผู้ใช้งาน

ก่อนจะทำความสะอาดทวีต เราจะดึงตัวอย่างออกมาดูก่อน โดยทั่วไปแล้ว ลิงก์มักขึ้นต้นด้วย http และไม่มีช่องว่าง เช่น https://www.datacamp.com ส่วนการกล่าวถึงผู้ใช้งานจะขึ้นต้นด้วย @ และมีได้เฉพาะตัวอักษรและตัวเลขเท่านั้น เช่น @johnsmith3

ตัวดำเนินการเชิงปริมาณที่เป็นประโยชน์มีดังนี้: * หมายถึงศูนย์ครั้งขึ้นไป, + หมายถึงหนึ่งครั้งขึ้นไป, ? หมายถึงศูนย์หรือหนึ่งครั้ง

ลิสต์ sentiment_analysis ที่มีข้อความของทวีตสามรายการถูกโหลดไว้ในเซสชันแล้ว สามารถใช้ print() เพื่อดูข้อมูลใน IPython Shell ได้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Regular Expressions ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import โมดูล re
  • เขียน regex เพื่อค้นหาการจับคู่ทั้งหมดของลิงก์ http ที่ปรากฏในแต่ละ tweet ใน sentiment_analysis แล้วพิมพ์ผลลัพธ์
  • เขียน regex เพื่อค้นหาการจับคู่ทั้งหมดของการกล่าวถึงผู้ใช้งานที่ปรากฏในแต่ละ tweet ใน sentiment_analysis แล้วพิมพ์ผลลัพธ์

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
แก้ไขและรันโค้ด