开始使用免费开始使用

加载一些文本

文本挖掘首先要将文本数据加载到 R 中,我们将使用 read.csv() 函数来完成。

一个最佳实践是检查读入的对象,确认哪些列是关键。str() 函数可以高效地完成这项工作。

如果数据框包含非文本的列,您可以只使用正确的文本列创建一个新对象(例如,some_object$column_name)。

请注意:这些是来自 Twitter 的真实数据,因此可能含有粗俗或令人反感的内容(本练习以及任何后续也使用真实 Twitter 数据的练习均有此风险)。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

数据已为您加载,可通过 coffee_data_file 获取。

  • 使用 read.csv() 读取 coffee_data_file(其中包含提到 coffee 的推文),创建新对象 tweets
  • 使用 str() 检查 tweets 对象,确定哪一列包含您要分析的文本。
  • 仅使用上一步识别的文本列创建新的 coffee_tweets 对象。为此,请使用 $ 运算符和列名。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import text data from CSV, no factors
tweets <- ___

# View the structure of tweets
___

# Isolate text from tweets
coffee_tweets <- ___
编辑并运行代码