Zacznij terazZacznij za darmo

Eksploracja korpusu w R

Twój współpracownik przygotował korpus 20 dokumentów dotyczących ropy naftowej o nazwie crude. To tylko próbka spośród kilku tysięcy artykułów, które otrzymasz w przyszłym tygodniu. Żeby przygotować się do analizy tekstu na tych dokumentach, postanawiasz przyjrzeć się ich zawartości i metadanym. Pamiętaj, że w R obiekt VCorpus zawiera zarówno meta, jak i content dla każdego tekstu. W tej lekcji zbadasz oba te obiekty.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyświetl obiekt crude i przejrzyj wynik.
  • Wyświetl treść 10. artykułu.
  • Wyświetl ID pierwszego artykułu w crude.
  • Korzystając z dostarczonej pętli for, utwórz wektor identyfikatorów z korpusu.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print out the corpus
print(___)

# Print the content of the 10th article
crude[[___]]$___

# Find the first ID
crude[[___]]$___$id

# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
  ids <- append(ids, crude[[___]]$___$id)
}
Edytuj i uruchom kod