理解兩者的差異
你需要持續清理 tweets 資料集。你注意到裡面出現了一些 HTML 標籤。你必須移除這些標籤,但要保留其中的內容,因為那些內容對分析很有用。
來看一下這句含有 HTML 標籤的範例:
I want to see that <strong>amazing show</strong> again!。
你知道要抓到 HTML 標籤,需要比對位在尖括號 < > 之間的任何內容。不過最大的問題是,結束標籤的結構也一樣。如果你比對得太多,就會把關鍵資訊一起刪掉。所以你必須決定要用貪婪量詞還是懶惰量詞。
這個字串已經以 string 載入到你的工作階段中。
本練習屬於課程
Python 中的正規表示法
練習說明
- 匯入
re模組。 - 撰寫
regex表達式,將「HTML 標籤」取代成空字串。 - 列印輸出結果。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____