ÎncepețiÎncepe gratuit

Găsește cuvintele comune

Să zicem că vrei să vizualizezi cuvintele comune din mai multe documente. Poți face asta cu commonality.cloud().

Fiecare dintre corpusurile noastre – cel pentru cafea și cel pentru chardonnay – este alcătuit din numeroase tweet-uri individuale. Pentru a trata tweet-urile despre cafea ca un singur document (și la fel pentru chardonnay), folosești paste() pe toate tweet-urile din fiecare corpus, împreună cu parametrul collapse = " ". Aceasta reunește toate tweet-urile (separate printr-un spațiu) într-un singur vector. Apoi poți crea un vector unic care conține cele două documente reunite.

a_single_string <- paste(a_character_vector, collapse = " ")

După ce finalizezi acești pași, poți urma aceeași abordare pe care ai văzut-o anterior pentru a crea un VCorpus() pe baza unui VectorSource din obiectul all_tweets.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează all_coffee folosind paste() cu collapse = " " pe coffee_tweets$text.
  • Creează all_chardonnay folosind paste() cu collapse = " " pe chardonnay_tweets$text.
  • Creează all_tweets folosind c() pentru a combina all_coffee și all_chardonnay. Pune all_coffee ca primul termen.
  • Convertește all_tweets folosind VectorSource().
  • Creează all_corpus aplicând VCorpus() pe all_tweets.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create all_coffee
___ <- ___(___, ___)

# Create all_chardonnay
___ <- ___(___, ___)

# Create all_tweets
___ <- ___(___, ___)

# Convert to a vector source
___ <- ___(___)

# Create all_corpus
___ <- ___(___)
Editează și rulează codul