開始使用免費開始

探索 R 語料庫

你的同事已經準備好一個由 20 篇討論原油的文件所組成的語料庫,名為 crude。這只是你下週將收到的數千篇文章中的小樣本。為了準備對這些文件進行文字分析,你決定先探索它們的內容與中繼資料。請記得,在 R 中,VCorpus 會針對每一段文字同時包含 metacontent。在本節練習中,你會探索這兩個物件。

本練習屬於課程

R 的自然語言處理入門

檢視課程

練習說明

  • 列印 crude 並檢視輸出結果。
  • 列印第 10 篇文章的內容。
  • 列印 crude 中第一篇文章的 ID。
  • 使用提供的 for 迴圈,建立一個向量,內容為語料庫中的所有 ID。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Print out the corpus
print(___)

# Print the content of the 10th article
crude[[___]]$___

# Find the first ID
crude[[___]]$___$id

# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
  ids <- append(ids, crude[[___]]$___$id)
}
編輯並執行程式碼