開始使用免費開始

從資料框建立 VCorpus

如果你的文字資料存放在資料框中,你可以用 DataframeSource() 來進行分析。傳入 DataframeSource() 的資料框必須符合特定結構:

  • 第【1】欄必須命名為 doc_id,而且每列要有唯一的字串。
  • 第【2】欄必須命名為 text,並使用「UTF-8」編碼(相當常見)。
  • 其他欄位(第 3 欄之後)會被視為中介資料(metadata),並以此身分被保留。

本練習會介紹 meta(),用來擷取每份文件所對應的中介資料。實務上資料常會含有作者、日期、主題標籤或地點等中介資料,這些都能幫助你做分析。當文字已轉為語料庫之後,你就可以套用 meta() 檢視額外的文件層級資訊。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

在你的工作環境中,已提供一個名為 example_text 的簡單資料框,具有正確的欄名與部分中介資料。另外也有用 VectorSource() 建立的易失性語料庫 vec_corpus

  • 使用 example_text 搭配 DataframeSource() 建立 df_source
  • df_source 轉成「易失性」語料庫物件 df_corpus(使用 VCorpus())。
  • 列印 df_corpus。注意它包含多少文件,以及保留下來的文件層級中介資料數量。
  • df_corpus 使用 meta(),列印與文件相關的中介資料。
  • 檢視預先載入的 vec_corpus 物件。將其「文件」數量與 df_corpus 比較。
  • vec_corpus 使用 meta(),比較 vec_corpusdf_corpus 之間中介資料的差異。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a DataframeSource from the example text
df_source <- ___

# Convert df_source to a volatile corpus
df_corpus <- ___

# Examine df_corpus
df_corpus

# Examine df_corpus metadata
___

# Compare the number of documents in the vector source
vec_corpus

# Compare metadata in the vector corpus
___
編輯並執行程式碼