探索 R 語料庫
你的同事已經準備好一個由 20 篇討論原油的文件所組成的語料庫,名為 crude。這只是你下週將收到的數千篇文章中的小樣本。為了準備對這些文件進行文字分析,你決定先探索它們的內容與中繼資料。請記得,在 R 中,VCorpus 會針對每一段文字同時包含 meta 與 content。在本節練習中,你會探索這兩個物件。
本練習屬於課程
R 的自然語言處理入門
練習說明
- 列印
crude並檢視輸出結果。 - 列印第 10 篇文章的內容。
- 列印
crude中第一篇文章的 ID。 - 使用提供的 for 迴圈,建立一個向量,內容為語料庫中的所有 ID。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Print out the corpus
print(___)
# Print the content of the 10th article
crude[[___]]$___
# Find the first ID
crude[[___]]$___$id
# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
ids <- append(ids, crude[[___]]$___$id)
}