เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ทำความเข้าใจความแตกต่าง

ยังคงต้องทำงานต่อกับการทำความสะอาดชุดข้อมูลทวีต และพบว่ามี HTML tag ปะปนอยู่ จึงต้องลบออก แต่ยังคงเนื้อหาภายในไว้เพราะมีประโยชน์สำหรับการวิเคราะห์

ลองดูตัวอย่างประโยคที่มี HTML tag:

I want to see that <strong>amazing show</strong> again!

เพื่อดึง HTML tag ออกมา ต้องจับอักขระทุกตัวที่อยู่ภายในวงเล็บมุม < > แต่ปัญหาสำคัญคือ closing tag มีโครงสร้างเหมือนกัน หากจับข้อมูลมากเกินไปจะเผลอลบข้อมูลสำคัญออกไปด้วย จึงต้องตัดสินใจว่าจะใช้ greedy หรือ lazy quantifier

โหลดสตริงไว้เป็นตัวแปร string ในเซสชันแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Regular Expressions ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้าโมดูล re
  • เขียน regex เพื่อแทนที่ HTML tag ด้วยสตริงว่าง
  • แสดงผลลัพธ์ออกมา

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
แก้ไขและรันโค้ด