Pratique avec h2o
Il existe plusieurs bibliothèques de Machine Learning disponibles en R. Cependant, la bibliothèque h2o est simple à utiliser et propose une implémentation de word2vec. h2o peut aussi servir à de nombreuses autres tâches de Machine Learning. Pour utiliser la bibliothèque h2o, vous devez toutefois effectuer des étapes de prétraitement supplémentaires sur vos données. Vous disposez d’un jeu de données appelé left_right qui contient des tweets publiés automatiquement pendant la campagne de l’élection américaine de 2016.
Au lieu de préparer vos données pour d’autres techniques d’analyse de texte, préparez ce jeu de données pour une utilisation avec la bibliothèque h2o.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Importez la bibliothèque et initialisez une session
h2o. - Créez un objet
h2o. - Tokenisez les tweets qui se trouvent dans la colonne
content. - Mettez tous les mots en minuscules et supprimez tous les mots vides.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Initialize an h2o session
library(___)
___.init()
# Create an h2o object for left_right
h2o_object = as.___(left_right)
# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")
# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words