全部清理
回到你的 Twitter 情緒分析專案!有幾種字串會讓情緒分析變得更複雜,但這些字串其實不提供任何有用的情緒資訊。其中包含連結與使用者提及。
為了清理推文,你想先把一些例子抓出來。你知道多數連結會以 http 開頭,且不包含任何空白字元,例如 https://www.datacamp.com。使用者提及則以 @ 開頭,且只能包含英文字母與數字,例如 @johnsmith3。
你也記下了一些有用的量詞:* 出現 0 次或更多次、+ 出現 1 次或更多次、? 出現 0 次或 1 次。
清單 sentiment_analysis(包含 3 則推文的文字)已載入到你的工作階段。你可以在 IPython Shell 中使用 print() 檢視資料。
本練習屬於課程
Python 中的正規表示法
練習說明
- 匯入
re模組。 - 撰寫一個正則表示式,在
sentiment_analysis中針對每則tweet找出所有出現的http連結相符項目。將結果列印出來。 - 撰寫一個正則表示式,在
sentiment_analysis中針對每則tweet找出所有出現的使用者提及相符項目。將結果列印出來。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))