開始使用免費開始

word2vec

你已經從網路上大量擷取職稱,但還不確定是否需要再擷取更多職稱來做分析。目前你在名為 job_titles 的資料集中已經收集了超過 13,000 筆職稱。你讀到 word2vec 通常在有足夠資料進行適當訓練時表現較好;如果某些詞在你的資料中出現次數不足,模型可能就不夠有用。

在本練習中,你會透過執行模型 3 次來測試加入更多資料是否有幫助;每次執行都會使用更多的資料。

本練習屬於課程

R 的自然語言處理入門

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

library(h2o)
h2o.init()

set.seed(1111)
# Use 33% of the available data
sample_size <- floor(___ * nrow(job_titles))
sample_data <- sample(nrow(job_titles), size = sample_size)

h2o_object = as.h2o(job_titles[sample_data, ])
words <- h2o.tokenize(h2o_object$jobtitle, "\\\\W+")
words <- h2o.tolower(words)
words = words[is.na(words) || (!words %in% stop_words$word),]

word2vec_model <- h2o.word2vec(words, min_word_freq=5, epochs = 10)
# Find synonyms for the word "teacher"
___.___(word2vec_model, "teacher", count=10)
編輯並執行程式碼