始める無料で始める

Rのコーパスを探索する

同僚が原油に関する20本の文書からなるコーパス crude を用意してくれました。これは、来週受け取る予定の数千本の記事のサンプルにすぎません。これらの文書に対してテキスト分析を実行する準備として、内容とメタデータを確認しておきましょう。Rでは、各テキストに関する VCorpusmetacontent の両方が含まれることを思い出してください。このレッスンでは、これら2つのオブジェクトを探索します。

この演習はコースの一部です

Rで学ぶ自然言語処理入門

コースを見る

演習の手順

  • crude を出力して内容を確認します。
  • 10番目の記事のcontentを出力します。
  • crude の最初の記事のIDを出力します。
  • 用意されたforループを使って、コーパスのIDからベクターを作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Print out the corpus
print(___)

# Print the content of the 10th article
crude[[___]]$___

# Find the first ID
crude[[___]]$___$id

# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
  ids <- append(ids, crude[[___]]$___$id)
}
コードを編集して実行