Zacznij terazZacznij za darmo

Ćwiczenie z h2o

W R dostępnych jest wiele bibliotek do uczenia maszynowego. Biblioteka h2o jest jednak wyjątkowo prosta w użyciu i oferuje implementację word2vec. Można jej również używać do wielu innych zadań z zakresu uczenia maszynowego. Aby jednak skorzystać z biblioteki h2o, musisz wykonać dodatkowe kroki wstępnego przetwarzania danych. Masz do dyspozycji zbiór danych o nazwie left_right, który zawiera tweety automatycznie opublikowane podczas kampanii wyborczej w USA w 2016 roku.

Zamiast przygotowywać dane pod inne techniki analizy tekstu, przygotuj ten zbiór danych do użycia z biblioteką h2o.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj bibliotekę, a następnie zainicjuj sesję h2o.
  • Utwórz obiekt h2o.
  • Dokonaj tokenizacji tweetów zapisanych w kolumnie content.
  • Przekształć słowa na małe litery i usuń wszystkie słowa stopowe.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
Edytuj i uruchom kod