ค้นหาไฟล์
คุณยังไม่พอใจกับการทำความสะอาดชุดข้อมูลทวีต เพราะยังมีสตริงที่ไม่มีประโยชน์ต่อการวิเคราะห์ความรู้สึกหลงเหลืออยู่ หนึ่งในนั้นคือสตริงที่อ้างอิงถึงชื่อไฟล์ข้อความ
คุณพบวิธีระบุสตริงเหล่านี้ได้ดังนี้:
- ปรากฏที่จุดเริ่มต้นของสตริง
- ขึ้นต้นด้วยลำดับสระ (a e i o u) ตัวพิมพ์ใหญ่หรือเล็ก 2 หรือ 3 ตัวเสมอ
- ลงท้ายด้วย
txtเสมอ
คุณยังไม่แน่ใจว่าควรลบสตริงเหล่านี้ทิ้งทันทีหรือไม่ จึงเขียนสคริปต์เพื่อค้นหาและจัดเก็บสตริงเหล่านั้นไว้ในชุดข้อมูลแยกต่างหาก
เมตาแคแรกเตอร์ที่จะใช้ประกอบด้วย: ^ ยึดตำแหน่งที่จุดเริ่มต้น และ . จับคู่กับตัวอักษรใดก็ได้
ตัวแปร sentiment_analysis ที่เก็บข้อความทวีต 2 รายการ รวมถึงโมดูล re ได้ถูกโหลดไว้ในเซสชันแล้ว สามารถใช้ print() เพื่อดูข้อมูลใน IPython Shell ได้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Regular Expressions ใน Python
คำแนะนำการฝึกหัด
- เขียน regex ที่จับคู่กับรูปแบบชื่อไฟล์ข้อความ เช่น
aemyfile.txt - ค้นหาทุกรายการที่ตรงกับ regex ในองค์ประกอบของ
sentiment_analysisแล้วพิมพ์ผลลัพธ์ - แทนที่ทุกรายการที่ตรงกับ regex ด้วยสตริงว่าง
""แล้วพิมพ์ผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))