Ćwiczenie z h2o
W R dostępnych jest wiele bibliotek do uczenia maszynowego. Biblioteka h2o jest jednak wyjątkowo prosta w użyciu i oferuje implementację word2vec. Można jej również używać do wielu innych zadań z zakresu uczenia maszynowego. Aby jednak skorzystać z biblioteki h2o, musisz wykonać dodatkowe kroki wstępnego przetwarzania danych. Masz do dyspozycji zbiór danych o nazwie left_right, który zawiera tweety automatycznie opublikowane podczas kampanii wyborczej w USA w 2016 roku.
Zamiast przygotowywać dane pod inne techniki analizy tekstu, przygotuj ten zbiór danych do użycia z biblioteką h2o.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Zaimportuj bibliotekę, a następnie zainicjuj sesję
h2o. - Utwórz obiekt
h2o. - Dokonaj tokenizacji tweetów zapisanych w kolumnie
content. - Przekształć słowa na małe litery i usuń wszystkie słowa stopowe.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Initialize an h2o session
library(___)
___.init()
# Create an h2o object for left_right
h2o_object = as.___(left_right)
# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")
# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words