Začněte nyníZačněte zdarma

word2vec

Na internetu jsi nasbíral/a spoustu pracovních pozic a nejsi si jistý/á, jestli potřebuješ pro svou analýzu získat další. Zatím máš v datasetu job_titles přes 13 000 pozic. Četl/a jsi, že word2vec funguje nejlépe, když má model dostatek dat pro správné trénování – pokud se určitá slova v datech vyskytují jen zřídka, model nemusí být příliš užitečný.

V tomto cvičení otestuješ, jak moc přidání dalších dat pomáhá – model spustíš třikrát, přičemž pokaždé použiješ větší část dat.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

library(h2o)
h2o.init()

set.seed(1111)
# Use 33% of the available data
sample_size <- floor(___ * nrow(job_titles))
sample_data <- sample(nrow(job_titles), size = sample_size)

h2o_object = as.h2o(job_titles[sample_data, ])
words <- h2o.tokenize(h2o_object$jobtitle, "\\\\W+")
words <- h2o.tolower(words)
words = words[is.na(words) || (!words %in% stop_words$word),]

word2vec_model <- h2o.word2vec(words, min_word_freq=5, epochs = 10)
# Find synonyms for the word "teacher"
___.___(word2vec_model, "teacher", count=10)
Upravit a spustit kód