Začněte nyníZačněte zdarma

Prozkoumej R korpus

Tvůj kolega připravil korpus 20 dokumentů o ropě, pojmenovaný crude. Jde jen o ukázku z několika tisíc článků, které dostaneš příští týden. Abys byl/a připraven/a na textovou analýzu těchto dokumentů, rozhodl/a ses prozkoumat jejich obsah a metadata. Pamatuj, že v R obsahuje VCorpus pro každý text jak část meta, tak content. V této lekci si tyto dva objekty důkladně prohlédneš.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Pokyny k cvičení

  • Vypiš crude a prohlédni si výstup.
  • Vypiš obsah 10. článku.
  • Vypiš ID prvního článku v crude.
  • Pomocí připraveného cyklu for vytvoř vektor ID z korpusu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print out the corpus
print(___)

# Print the content of the 10th article
crude[[___]]$___

# Find the first ID
crude[[___]]$___$id

# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
  ids <- append(ids, crude[[___]]$___$id)
}
Upravit a spustit kód