ÎncepețiÎncepe gratuit

word2vec

Ai extras prin web scraping o mulțime de titluri de joburi de pe internet și nu ești sigur dacă trebuie să colectezi și altele pentru analiză. Până acum, ai adunat peste 13.000 de titluri de joburi într-un set de date numit job_titles. Ai citit că word2vec funcționează cel mai bine atunci când modelul dispune de suficiente date pentru antrenament, iar dacă anumite cuvinte apar prea rar în datele tale, modelul s-ar putea să nu fie util.

În acest exercițiu vei testa cât de folositoare sunt datele suplimentare rulând modelul de 3 ori, de fiecare dată cu mai multe date.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

library(h2o)
h2o.init()

set.seed(1111)
# Use 33% of the available data
sample_size <- floor(___ * nrow(job_titles))
sample_data <- sample(nrow(job_titles), size = sample_size)

h2o_object = as.h2o(job_titles[sample_data, ])
words <- h2o.tokenize(h2o_object$jobtitle, "\\\\W+")
words <- h2o.tolower(words)
words = words[is.na(words) || (!words %in% stop_words$word),]

word2vec_model <- h2o.word2vec(words, min_word_freq=5, epochs = 10)
# Find synonyms for the word "teacher"
___.___(word2vec_model, "teacher", count=10)
Editează și rulează codul