word2vec
Du har skrapat ett stort antal jobbtitlar från internet och är osäker på om du behöver samla in fler för din analys. Hittills har du samlat in över 13 000 jobbtitlar i en datamängd som heter job_titles. Du har läst att word2vec generellt presterar bäst när modellen har tillräckligt med data för att tränas ordentligt, och att modellen riskerar att bli missvisande om ord förekommer för sällan i datan.
I den här övningen testar du hur mycket ytterligare data hjälper genom att köra modellen 3 gånger – varje körning använder en större del av datamängden.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
library(h2o)
h2o.init()
set.seed(1111)
# Use 33% of the available data
sample_size <- floor(___ * nrow(job_titles))
sample_data <- sample(nrow(job_titles), size = sample_size)
h2o_object = as.h2o(job_titles[sample_data, ])
words <- h2o.tokenize(h2o_object$jobtitle, "\\\\W+")
words <- h2o.tolower(words)
words = words[is.na(words) || (!words %in% stop_words$word),]
word2vec_model <- h2o.word2vec(words, min_word_freq=5, epochs = 10)
# Find synonyms for the word "teacher"
___.___(word2vec_model, "teacher", count=10)