Zacznij terazZacznij za darmo

word2vec

Zebrałeś(-aś) dużą liczbę tytułów stanowisk z internetu i zastanawiasz się, czy potrzebujesz ich jeszcze więcej do analizy. Do tej pory udało się zebrać ponad 13 000 tytułów stanowisk w zbiorze danych o nazwie job_titles. Wiesz, że word2vec działa najlepiej, gdy model ma wystarczająco dużo danych do trenowania – jeśli dane słowa pojawiają się zbyt rzadko, model może nie dawać użytecznych wyników.

W tym ćwiczeniu sprawdzisz, jak pomocne są dodatkowe dane, uruchamiając model 3 razy – za każdym razem z większą ilością danych.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

library(h2o)
h2o.init()

set.seed(1111)
# Use 33% of the available data
sample_size <- floor(___ * nrow(job_titles))
sample_data <- sample(nrow(job_titles), size = sample_size)

h2o_object = as.h2o(job_titles[sample_data, ])
words <- h2o.tokenize(h2o_object$jobtitle, "\\\\W+")
words <- h2o.tolower(words)
words = words[is.na(words) || (!words %in% stop_words$word),]

word2vec_model <- h2o.word2vec(words, min_word_freq=5, epochs = 10)
# Find synonyms for the word "teacher"
___.___(word2vec_model, "teacher", count=10)
Edytuj i uruchom kod