开始使用免费开始使用

创建语料库

您已经创建了一个名为 russian_tweets 的 tibble,其中包含大约 20,000 条在 2016 年美国大选周期中由机器人自动生成的推文,以便进行文本分析。您在比较可用的分析方案后,认为 tm 包是最省力的选择。为开展分析,您需要先创建一个语料库,并附加可能有用的元数据。

请注意:这些数据来自 Twitter,可能包含粗俗或其他冒犯性内容(本练习以及任何后续使用真实 Twitter 数据的练习均可能如此)。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • 使用 russian_tweetscontent 列创建一个语料库。
  • followingfollowers 两列作为元数据附加到 tweet_corpus
  • 打印元数据表的前几行。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))

# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___

# Review the meta data
head(meta(___))
编辑并运行代码