Začněte nyníZačněte zdarma

Procvičení h2o

V R je k dispozici několik knihoven pro strojové učení. Knihovna h2o je přitom snadno použitelná a nabízí implementaci word2vec. h2o lze využít i pro celou řadu dalších úloh strojového učení. Aby ses s touto knihovnou mohl/a pracovat, je potřeba provést několik dodatečných kroků předzpracování dat. Máš k dispozici dataset left_right, který obsahuje tweety automaticky zveřejněné během prezidentské kampaně v USA v roce 2016.

Místo přípravy dat pro jiné techniky textové analýzy připrav tento dataset pro použití s knihovnou h2o.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Pokyny k cvičení

  • Importuj knihovnu, inicializuj session h2o.
  • Vytvoř objekt h2o.
  • Tokenizuj tweety uložené ve sloupci content.
  • Převeď slova na malá písmena a odstraň všechna stop slova.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
Upravit a spustit kód