Rのコーパスを探索する
同僚が原油に関する20本の文書からなるコーパス crude を用意してくれました。これは、来週受け取る予定の数千本の記事のサンプルにすぎません。これらの文書に対してテキスト分析を実行する準備として、内容とメタデータを確認しておきましょう。Rでは、各テキストに関する VCorpus に meta と content の両方が含まれることを思い出してください。このレッスンでは、これら2つのオブジェクトを探索します。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
crudeを出力して内容を確認します。- 10番目の記事のcontentを出力します。
crudeの最初の記事のIDを出力します。- 用意されたforループを使って、コーパスのIDからベクターを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Print out the corpus
print(___)
# Print the content of the 10th article
crude[[___]]$___
# Find the first ID
crude[[___]]$___$id
# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
ids <- append(ids, crude[[___]]$___$id)
}