ÎncepețiÎncepe gratuit

Practică cu h2o

În R există mai multe biblioteci de învățare automată disponibile. Biblioteca h2o este ușor de utilizat și oferă o implementare word2vec. h2o poate fi folosită și pentru alte sarcini de învățare automată. Pentru a o utiliza, însă, trebuie să parcurgi câțiva pași suplimentari de preprocesare a datelor. Ai la dispoziție un set de date numit left_right, care conține tweet-uri publicate automat în timpul campaniei electorale din SUA din 2016.

În loc să îți pregătești datele pentru alte tehnici de analiză a textului, pregătește acest set de date pentru utilizarea cu biblioteca h2o.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă biblioteca, inițializează și o sesiune h2o.
  • Creează un obiect h2o.
  • Tokenizează tweet-urile stocate în coloana content.
  • Transformă cuvintele în litere mici și elimină toate cuvintele de oprire.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
Editează și rulează codul