開始使用免費開始

理解兩者的差異

你需要持續清理 tweets 資料集。你注意到裡面出現了一些 HTML 標籤。你必須移除這些標籤,但要保留其中的內容,因為那些內容對分析很有用。

來看一下這句含有 HTML 標籤的範例:

I want to see that <strong>amazing show</strong> again!

你知道要抓到 HTML 標籤,需要比對位在尖括號 < > 之間的任何內容。不過最大的問題是,結束標籤的結構也一樣。如果你比對得太多,就會把關鍵資訊一起刪掉。所以你必須決定要用貪婪量詞還是懶惰量詞。

這個字串已經以 string 載入到你的工作階段中。

本練習屬於課程

Python 中的正規表示法

檢視課程

練習說明

  • 匯入 re 模組。
  • 撰寫 regex 表達式,將「HTML 標籤」取代成空字串。
  • 列印輸出結果。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
編輯並執行程式碼