Exercices avec h2o
Il existe plusieurs bibliothèques de Machine Learning en R. Toutefois, la bibliothèque h2o est simple à utiliser et offre une implémentation de word2vec. h2o peut aussi servir à plusieurs autres tâches de Machine Learning. Pour utiliser la bibliothèque h2o, vous devez cependant effectuer des étapes supplémentaires de prétraitement sur vos données. Vous avez un jeu de données nommé left_right qui contient des tweets publiés automatiquement durant la campagne électorale américaine de 2016.
Plutôt que de préparer vos données pour d'autres techniques d'analyse de texte, préparez ce jeu de données pour l'utiliser avec la bibliothèque h2o.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Instructions de l’exercice
- Importez la bibliothèque et initialisez une session
h2o. - Créez un objet
h2o. - Tokenisez les tweets qui se trouvent dans la colonne
content. - Mettez les mots en minuscules et supprimez tous les mots vides.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Initialize an h2o session
library(___)
___.init()
# Create an h2o object for left_right
h2o_object = as.___(left_right)
# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")
# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words