获取标记
下一步是对推文文本进行分词(tokenize)。分词是把字符串拆分为词法单元,简单说就是拆成单词。在此之前,先去掉话题标签(hashtag),以免干扰处理。您知道话题标签以 # 开头,后面包含字母和数字,但不会包含空白字符。之后,计划按空白匹配来拆分文本,得到各个标记。
请参考量词列表辅助您完成:* 表示重复 0 次或多次,+ 表示重复 1 次或多次,? 表示重复 0 次或 1 次,{n, m} 表示最少 n 次、最多 m 次。
变量 sentiment_analysis(包含一条推文的文本)以及模块 re 已在您的会话中加载。您可以在 IPython Shell 中使用 print(sentiment_analysis) 查看其内容。
本练习是课程的一部分