找出共同詞彙
假設你想要視覺化多個文件之間的共同詞彙。你可以使用 commonality.cloud() 來達成。
我們的 coffee 與 chardonnay 語料庫各自由許多單一推文組成。若要把 coffee 的推文視為單一文件,chardonnay 亦同,你可以將各語料庫中的所有推文搭配參數 collapse = " " 一起用 paste() 串接。這會把所有推文(以空格分隔)彙整成單一向量。接著,你可以建立一個同時包含這兩個彙整後文件的單一下向量。
a_single_string <- paste(a_character_vector, collapse = " ")
完成上述步驟後,你可以用先前相同的方式,從 all_tweets 物件的 VectorSource 建立 VCorpus()。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
- 使用
paste()並搭配collapse = " "作用在coffee_tweets$text,建立all_coffee。 - 使用
paste()並搭配collapse = " "作用在chardonnay_tweets$text,建立all_chardonnay。 - 使用
c()將all_coffee與all_chardonnay合併為all_tweets。請把all_coffee放在第一個。 - 使用
VectorSource()轉換all_tweets。 - 對
all_tweets使用VCorpus()建立all_corpus。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create all_coffee
___ <- ___(___, ___)
# Create all_chardonnay
___ <- ___(___, ___)
# Create all_tweets
___ <- ___(___, ___)
# Convert to a vector source
___ <- ___(___)
# Create all_corpus
___ <- ___(___)