Procvičení h2o
V R je k dispozici několik knihoven pro strojové učení. Knihovna h2o je přitom snadno použitelná a nabízí implementaci word2vec. h2o lze využít i pro celou řadu dalších úloh strojového učení. Aby ses s touto knihovnou mohl/a pracovat, je potřeba provést několik dodatečných kroků předzpracování dat. Máš k dispozici dataset left_right, který obsahuje tweety automaticky zveřejněné během prezidentské kampaně v USA v roce 2016.
Místo přípravy dat pro jiné techniky textové analýzy připrav tento dataset pro použití s knihovnou h2o.
Toto cvičení je součástí kurzu
Úvod do zpracování přirozeného jazyka v R
Pokyny k cvičení
- Importuj knihovnu, inicializuj session
h2o. - Vytvoř objekt
h2o. - Tokenizuj tweety uložené ve sloupci
content. - Převeď slova na malá písmena a odstraň všechna stop slova.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Initialize an h2o session
library(___)
___.init()
# Create an h2o object for left_right
h2o_object = as.___(left_right)
# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")
# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words