Kom igångKom igång gratis

Öva med h2o

Det finns flera maskininlärningsbibliotek tillgängliga i R. Biblioteket h2o är dock enkelt att använda och erbjuder en word2vec-implementation. h2o kan även användas för flera andra maskininlärningsuppgifter. För att använda h2o-biblioteket behöver du dock utföra ytterligare förbehandlingssteg på dina data. Du har en datamängd kallad left_right som innehåller tweets som publicerades automatiskt under den amerikanska valkampanjen 2016.

Istället för att förbereda dina data för andra textanalystekniker ska du förbereda den här datamängden för användning med h2o-biblioteket.

Den här övningen är en del av kursen

Introduktion till naturlig språkbehandling i R

Visa kurs

Övningsinstruktioner

  • Importera biblioteket och initiera en h2o-session.
  • Skapa ett h2o-objekt.
  • Tokenisera tweets som lagras i kolumnen content.
  • Konvertera orden till gemener och ta bort alla stoppord.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
Redigera och kör kod