從資料框建立 VCorpus
如果你的文字資料存放在資料框中,你可以用 DataframeSource() 來進行分析。傳入 DataframeSource() 的資料框必須符合特定結構:
- 第【1】欄必須命名為
doc_id,而且每列要有唯一的字串。 - 第【2】欄必須命名為
text,並使用「UTF-8」編碼(相當常見)。 - 其他欄位(第 3 欄之後)會被視為中介資料(metadata),並以此身分被保留。
本練習會介紹 meta(),用來擷取每份文件所對應的中介資料。實務上資料常會含有作者、日期、主題標籤或地點等中介資料,這些都能幫助你做分析。當文字已轉為語料庫之後,你就可以套用 meta() 檢視額外的文件層級資訊。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
在你的工作環境中,已提供一個名為 example_text 的簡單資料框,具有正確的欄名與部分中介資料。另外也有用 VectorSource() 建立的易失性語料庫 vec_corpus。
- 使用
example_text搭配DataframeSource()建立df_source。 - 將
df_source轉成「易失性」語料庫物件df_corpus(使用VCorpus())。 - 列印
df_corpus。注意它包含多少文件,以及保留下來的文件層級中介資料數量。 - 對
df_corpus使用meta(),列印與文件相關的中介資料。 - 檢視預先載入的
vec_corpus物件。將其「文件」數量與df_corpus比較。 - 對
vec_corpus使用meta(),比較vec_corpus與df_corpus之間中介資料的差異。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a DataframeSource from the example text
df_source <- ___
# Convert df_source to a volatile corpus
df_corpus <- ___
# Examine df_corpus
df_corpus
# Examine df_corpus metadata
___
# Compare the number of documents in the vector source
vec_corpus
# Compare metadata in the vector corpus
___