CommencerCommencez gratuitement

word2vec

Vous avez beaucoup extrait des intitulés de poste sur Internet et vous hésitez à en collecter davantage pour votre analyse. À ce stade, vous avez rassemblé plus de 13 000 intitulés dans un jeu de données appelé job_titles. Vous avez lu que word2vec donne généralement de meilleurs résultats lorsque le modèle dispose de suffisamment de données pour être correctement entraîné, et que si certains mots sont trop peu présents, le modèle risque d’être peu utile.

Dans cet exercice, vous allez évaluer l’intérêt d’ajouter des données en exécutant votre modèle 3 fois ; à chaque exécution, vous utiliserez davantage de données.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

library(h2o)
h2o.init()

set.seed(1111)
# Use 33% of the available data
sample_size <- floor(___ * nrow(job_titles))
sample_data <- sample(nrow(job_titles), size = sample_size)

h2o_object = as.h2o(job_titles[sample_data, ])
words <- h2o.tokenize(h2o_object$jobtitle, "\\\\W+")
words <- h2o.tolower(words)
words = words[is.na(words) || (!words %in% stop_words$word),]

word2vec_model <- h2o.word2vec(words, min_word_freq=5, epochs = 10)
# Find synonyms for the word "teacher"
___.___(word2vec_model, "teacher", count=10)
Modifier et exécuter le code