Găsește cuvintele comune
Să zicem că vrei să vizualizezi cuvintele comune din mai multe documente. Poți face asta cu commonality.cloud().
Fiecare dintre corpusurile noastre – cel pentru cafea și cel pentru chardonnay – este alcătuit din numeroase tweet-uri individuale. Pentru a trata tweet-urile despre cafea ca un singur document (și la fel pentru chardonnay), folosești paste() pe toate tweet-urile din fiecare corpus, împreună cu parametrul collapse = " ". Aceasta reunește toate tweet-urile (separate printr-un spațiu) într-un singur vector. Apoi poți crea un vector unic care conține cele două documente reunite.
a_single_string <- paste(a_character_vector, collapse = " ")
După ce finalizezi acești pași, poți urma aceeași abordare pe care ai văzut-o anterior pentru a crea un VCorpus() pe baza unui VectorSource din obiectul all_tweets.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Creează
all_coffeefolosindpaste()cucollapse = " "pecoffee_tweets$text. - Creează
all_chardonnayfolosindpaste()cucollapse = " "pechardonnay_tweets$text. - Creează
all_tweetsfolosindc()pentru a combinaall_coffeeșiall_chardonnay. Puneall_coffeeca primul termen. - Convertește
all_tweetsfolosindVectorSource(). - Creează
all_corpusaplicândVCorpus()peall_tweets.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create all_coffee
___ <- ___(___, ___)
# Create all_chardonnay
___ <- ___(___, ___)
# Create all_tweets
___ <- ___(___, ___)
# Convert to a vector source
___ <- ___(___)
# Create all_corpus
___ <- ___(___)