加载一些文本
文本挖掘首先要将文本数据加载到 R 中,我们将使用 read.csv() 函数来完成。
一个最佳实践是检查读入的对象,确认哪些列是关键。str() 函数可以高效地完成这项工作。
如果数据框包含非文本的列,您可以只使用正确的文本列创建一个新对象(例如,some_object$column_name)。
请注意:这些是来自 Twitter 的真实数据,因此可能含有粗俗或令人反感的内容(本练习以及任何后续也使用真实 Twitter 数据的练习均有此风险)。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
数据已为您加载,可通过 coffee_data_file 获取。
- 使用
read.csv()读取coffee_data_file(其中包含提到 coffee 的推文),创建新对象tweets。 - 使用
str()检查tweets对象,确定哪一列包含您要分析的文本。 - 仅使用上一步识别的文本列创建新的
coffee_tweets对象。为此,请使用$运算符和列名。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import text data from CSV, no factors
tweets <- ___
# View the structure of tweets
___
# Isolate text from tweets
coffee_tweets <- ___