word2vec
您已经从互联网上抓取了大量职位名称,但还不确定是否需要继续抓取更多以便进行分析。目前,您在名为 job_titles 的数据集中已经收集了超过 13,000 条职位名称。您读到过,若要让 word2vec 效果更好,模型需要足够的数据进行充分训练;如果某些词在数据中出现频率过低,模型的效果可能会不理想。
在本练习中,您将通过运行模型 3 次来测试增加数据的帮助程度;每次运行都会使用更多的数据。
本练习是课程的一部分
R 自然语言处理入门
交互式实操练习
通过完成这段示例代码来试试这个练习。
library(h2o)
h2o.init()
set.seed(1111)
# Use 33% of the available data
sample_size <- floor(___ * nrow(job_titles))
sample_data <- sample(nrow(job_titles), size = sample_size)
h2o_object = as.h2o(job_titles[sample_data, ])
words <- h2o.tokenize(h2o_object$jobtitle, "\\\\W+")
words <- h2o.tolower(words)
words = words[is.na(words) || (!words %in% stop_words$word),]
word2vec_model <- h2o.word2vec(words, min_word_freq=5, epochs = 10)
# Find synonyms for the word "teacher"
___.___(word2vec_model, "teacher", count=10)