ทำความเข้าใจความแตกต่าง
ยังคงต้องทำงานต่อกับการทำความสะอาดชุดข้อมูลทวีต และพบว่ามี HTML tag ปะปนอยู่ จึงต้องลบออก แต่ยังคงเนื้อหาภายในไว้เพราะมีประโยชน์สำหรับการวิเคราะห์
ลองดูตัวอย่างประโยคที่มี HTML tag:
I want to see that <strong>amazing show</strong> again!
เพื่อดึง HTML tag ออกมา ต้องจับอักขระทุกตัวที่อยู่ภายในวงเล็บมุม < > แต่ปัญหาสำคัญคือ closing tag มีโครงสร้างเหมือนกัน หากจับข้อมูลมากเกินไปจะเผลอลบข้อมูลสำคัญออกไปด้วย จึงต้องตัดสินใจว่าจะใช้ greedy หรือ lazy quantifier
โหลดสตริงไว้เป็นตัวแปร string ในเซสชันแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Regular Expressions ใน Python
คำแนะนำการฝึกหัด
- นำเข้าโมดูล
re - เขียน
regexเพื่อแทนที่ HTML tag ด้วยสตริงว่าง - แสดงผลลัพธ์ออกมา
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____