Crearea unui tibble dintr-un corpus
Pentru a explora mai în detaliu corpusul despre date privind petrolul brut primit de la un coleg, ai decis să creezi un pipeline care să curețe textul din documente. În loc să folosești pachetul tm, ai ales să transformi corpusul într-un tibble, astfel încât să poți utiliza funcțiile unnest_tokens(), count() și anti_join() cu care ești deja familiarizat. Corpusul crude conține atât metadatele, cât și textul fiecărui document.
Acest exercițiu face parte din cursul
Introducere în Prelucrarea Limbajului Natural în R
Instrucțiuni pentru exercițiu
- Convertește corpusul într-un tibble.
- Folosește
namespentru a afișa numele coloanelor. - Tokenizează (după cuvânt), numără și elimină cuvintele de stop din coloana
texta obiectuluicrude_tibble.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)