创建语料库
您已经创建了一个名为 russian_tweets 的 tibble,其中包含大约 20,000 条在 2016 年美国大选周期中由机器人自动生成的推文,以便进行文本分析。您在比较可用的分析方案后,认为 tm 包是最省力的选择。为开展分析,您需要先创建一个语料库,并附加可能有用的元数据。
请注意:这些数据来自 Twitter,可能包含粗俗或其他冒犯性内容(本练习以及任何后续使用真实 Twitter 数据的练习均可能如此)。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 使用
russian_tweets的content列创建一个语料库。 - 将
following和followers两列作为元数据附加到tweet_corpus。 - 打印元数据表的前几行。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))
# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___
# Review the meta data
head(meta(___))