開始使用免費開始

取得 tokens

下一步要把推文做斷詞(tokenize)。斷詞是把字串切成語詞單位,簡單說就是切成一個個單字。不過在此之前,你需要先移除主題標籤(hashtag),以免影響處理。你知道主題標籤以 # 開頭,後面只有英數字,且不包含空白。之後,你會在空白的比對位置切開文字,取得各個 token。

以下是你手邊的量詞清單可供參考:* 出現 0 次或多次,+ 出現 1 次或多次,? 出現 0 次或 1 次,{n, m} 最少 n 次、最多 m 次。

變數 sentiment_analysis(包含一則推文的文字)以及 re 模組已載入到你的工作階段。你可以在 IPython Shell 使用 print(sentiment_analysis) 檢視內容。

本練習屬於課程

Python 中的正規表示法

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Write a regex matching the hashtag pattern
regex = r"____"
編輯並執行程式碼