h2o 实践
R 中有多种机器学习库可用。不过,h2o 库上手简单,并且提供了 word2vec 的实现。h2o 还可用于多种其他机器学习任务。但要使用 h2o 库,您需要先对数据进行一些额外的预处理。这里有一个名为 left_right 的数据集,包含 2016 年美国大选期间自动发布的推文。
这一次,不要为其他文本分析技术做准备,而是将该数据集整理为可用于 h2o 库的格式。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 导入库并初始化一个
h2o会话。 - 创建一个
h2o对象。 - 对存储在
content列中的推文进行分词。 - 将词转换为小写,并移除所有停用词。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Initialize an h2o session
library(___)
___.init()
# Create an h2o object for left_right
h2o_object = as.___(left_right)
# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")
# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words