Practică cu h2o
În R există mai multe biblioteci de învățare automată disponibile. Biblioteca h2o este ușor de utilizat și oferă o implementare word2vec. h2o poate fi folosită și pentru alte sarcini de învățare automată. Pentru a o utiliza, însă, trebuie să parcurgi câțiva pași suplimentari de preprocesare a datelor. Ai la dispoziție un set de date numit left_right, care conține tweet-uri publicate automat în timpul campaniei electorale din SUA din 2016.
În loc să îți pregătești datele pentru alte tehnici de analiză a textului, pregătește acest set de date pentru utilizarea cu biblioteca h2o.
Acest exercițiu face parte din cursul
Introducere în Prelucrarea Limbajului Natural în R
Instrucțiuni pentru exercițiu
- Importă biblioteca, inițializează și o sesiune
h2o. - Creează un obiect
h2o. - Tokenizează tweet-urile stocate în coloana
content. - Transformă cuvintele în litere mici și elimină toate cuvintele de oprire.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Initialize an h2o session
library(___)
___.init()
# Create an h2o object for left_right
h2o_object = as.___(left_right)
# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")
# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words