Eksploracja korpusu w R
Twój współpracownik przygotował korpus 20 dokumentów dotyczących ropy naftowej o nazwie crude. To tylko próbka spośród kilku tysięcy artykułów, które otrzymasz w przyszłym tygodniu. Żeby przygotować się do analizy tekstu na tych dokumentach, postanawiasz przyjrzeć się ich zawartości i metadanym. Pamiętaj, że w R obiekt VCorpus zawiera zarówno meta, jak i content dla każdego tekstu. W tej lekcji zbadasz oba te obiekty.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Wyświetl obiekt
crudei przejrzyj wynik. - Wyświetl treść 10. artykułu.
- Wyświetl ID pierwszego artykułu w
crude. - Korzystając z dostarczonej pętli for, utwórz wektor identyfikatorów z korpusu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print out the corpus
print(___)
# Print the content of the 10th article
crude[[___]]$___
# Find the first ID
crude[[___]]$___$id
# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
ids <- append(ids, crude[[___]]$___$id)
}