Utforska ett R-korpus
En kollega har förberett ett korpus med 20 dokument om råolja – det kallas crude. Det här är ett urval av de flera tusen artiklar du kommer att få ta emot nästa vecka. För att förbereda dig på att köra textanalys på dessa dokument har du bestämt dig för att utforska innehållet och metadata. Kom ihåg att ett VCorpus i R innehåller både meta och content för varje text. I den här lektionen utforskar du de två objekten.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Skriv ut
crudeoch granska resultatet. - Skriv ut innehållet i den tionde artikeln.
- Skriv ut ID:t för den första artikeln i
crude. - Använd den befintliga for-loopen för att skapa en vektor med ID:n från korpuset.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print out the corpus
print(___)
# Print the content of the 10th article
crude[[___]]$___
# Find the first ID
crude[[___]]$___$id
# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
ids <- append(ids, crude[[___]]$___$id)
}