CommencerCommencez gratuitement

Pratique avec h2o

Il existe plusieurs bibliothèques de Machine Learning disponibles en R. Cependant, la bibliothèque h2o est simple à utiliser et propose une implémentation de word2vec. h2o peut aussi servir à de nombreuses autres tâches de Machine Learning. Pour utiliser la bibliothèque h2o, vous devez toutefois effectuer des étapes de prétraitement supplémentaires sur vos données. Vous disposez d’un jeu de données appelé left_right qui contient des tweets publiés automatiquement pendant la campagne de l’élection américaine de 2016.

Au lieu de préparer vos données pour d’autres techniques d’analyse de texte, préparez ce jeu de données pour une utilisation avec la bibliothèque h2o.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Importez la bibliothèque et initialisez une session h2o.
  • Créez un objet h2o.
  • Tokenisez les tweets qui se trouvent dans la colonne content.
  • Mettez tous les mots en minuscules et supprimez tous les mots vides.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
Modifier et exécuter le code