開始使用免費開始

全部清理

回到你的 Twitter 情緒分析專案!有幾種字串會讓情緒分析變得更複雜,但這些字串其實不提供任何有用的情緒資訊。其中包含連結與使用者提及。

為了清理推文,你想先把一些例子抓出來。你知道多數連結會以 http 開頭,且不包含任何空白字元,例如 https://www.datacamp.com。使用者提及則以 @ 開頭,且只能包含英文字母與數字,例如 @johnsmith3

你也記下了一些有用的量詞:* 出現 0 次或更多次、+ 出現 1 次或更多次、? 出現 0 次或 1 次。

清單 sentiment_analysis(包含 3 則推文的文字)已載入到你的工作階段。你可以在 IPython Shell 中使用 print() 檢視資料。

本練習屬於課程

Python 中的正規表示法

檢視課程

練習說明

  • 匯入 re 模組。
  • 撰寫一個正則表示式,在 sentiment_analysis 中針對每則 tweet 找出所有出現的 http 連結相符項目。將結果列印出來。
  • 撰寫一個正則表示式,在 sentiment_analysis 中針對每則 tweet 找出所有出現的使用者提及相符項目。將結果列印出來。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
編輯並執行程式碼