word2vec
Vous avez extrait sur le Web un grand nombre de titres d'emploi et vous ne savez pas si vous devez en extraire d'autres pour votre analyse. Jusqu'ici, vous avez recueilli plus de 13 000 titres d'emploi dans un jeu de données appelé job_titles. Vous avez lu que word2vec donne généralement de meilleurs résultats lorsque le modèle dispose de suffisamment de données pour bien s'entraîner et que, si certains mots sont trop peu fréquents dans vos données, le modèle pourrait être peu utile.
Dans cet exercice, vous allez évaluer l'utilité d'ajouter des données en exécutant votre modèle 3 fois; chaque exécution utilisera davantage de données.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(h2o)
h2o.init()
set.seed(1111)
# Use 33% of the available data
sample_size <- floor(___ * nrow(job_titles))
sample_data <- sample(nrow(job_titles), size = sample_size)
h2o_object = as.h2o(job_titles[sample_data, ])
words <- h2o.tokenize(h2o_object$jobtitle, "\\\\W+")
words <- h2o.tolower(words)
words = words[is.na(words) || (!words %in% stop_words$word),]
word2vec_model <- h2o.word2vec(words, min_word_freq=5, epochs = 10)
# Find synonyms for the word "teacher"
___.___(word2vec_model, "teacher", count=10)