开始使用免费开始使用

h2o 实践

R 中有多种机器学习库可用。不过,h2o 库上手简单,并且提供了 word2vec 的实现。h2o 还可用于多种其他机器学习任务。但要使用 h2o 库,您需要先对数据进行一些额外的预处理。这里有一个名为 left_right 的数据集,包含 2016 年美国大选期间自动发布的推文。

这一次,不要为其他文本分析技术做准备,而是将该数据集整理为可用于 h2o 库的格式。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • 导入库并初始化一个 h2o 会话。
  • 创建一个 h2o 对象。
  • 对存储在 content 列中的推文进行分词。
  • 将词转换为小写,并移除所有停用词。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
编辑并运行代码