CommencezCommencez gratuitement

Exercices avec h2o

Il existe plusieurs bibliothèques de Machine Learning en R. Toutefois, la bibliothèque h2o est simple à utiliser et offre une implémentation de word2vec. h2o peut aussi servir à plusieurs autres tâches de Machine Learning. Pour utiliser la bibliothèque h2o, vous devez cependant effectuer des étapes supplémentaires de prétraitement sur vos données. Vous avez un jeu de données nommé left_right qui contient des tweets publiés automatiquement durant la campagne électorale américaine de 2016.

Plutôt que de préparer vos données pour d'autres techniques d'analyse de texte, préparez ce jeu de données pour l'utiliser avec la bibliothèque h2o.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Importez la bibliothèque et initialisez une session h2o.
  • Créez un objet h2o.
  • Tokenisez les tweets qui se trouvent dans la colonne content.
  • Mettez les mots en minuscules et supprimez tous les mots vides.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
Modifier et exécuter le code