เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ค้นหาไฟล์

คุณยังไม่พอใจกับการทำความสะอาดชุดข้อมูลทวีต เพราะยังมีสตริงที่ไม่มีประโยชน์ต่อการวิเคราะห์ความรู้สึกหลงเหลืออยู่ หนึ่งในนั้นคือสตริงที่อ้างอิงถึงชื่อไฟล์ข้อความ

คุณพบวิธีระบุสตริงเหล่านี้ได้ดังนี้:

  • ปรากฏที่จุดเริ่มต้นของสตริง
  • ขึ้นต้นด้วยลำดับสระ (a e i o u) ตัวพิมพ์ใหญ่หรือเล็ก 2 หรือ 3 ตัวเสมอ
  • ลงท้ายด้วย txt เสมอ

คุณยังไม่แน่ใจว่าควรลบสตริงเหล่านี้ทิ้งทันทีหรือไม่ จึงเขียนสคริปต์เพื่อค้นหาและจัดเก็บสตริงเหล่านั้นไว้ในชุดข้อมูลแยกต่างหาก

เมตาแคแรกเตอร์ที่จะใช้ประกอบด้วย: ^ ยึดตำแหน่งที่จุดเริ่มต้น และ . จับคู่กับตัวอักษรใดก็ได้

ตัวแปร sentiment_analysis ที่เก็บข้อความทวีต 2 รายการ รวมถึงโมดูล re ได้ถูกโหลดไว้ในเซสชันแล้ว สามารถใช้ print() เพื่อดูข้อมูลใน IPython Shell ได้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Regular Expressions ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เขียน regex ที่จับคู่กับรูปแบบชื่อไฟล์ข้อความ เช่น aemyfile.txt
  • ค้นหาทุกรายการที่ตรงกับ regex ในองค์ประกอบของ sentiment_analysis แล้วพิมพ์ผลลัพธ์
  • แทนที่ทุกรายการที่ตรงกับ regex ด้วยสตริงว่าง "" แล้วพิมพ์ผลลัพธ์

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
แก้ไขและรันโค้ด