Prozkoumej R korpus
Tvůj kolega připravil korpus 20 dokumentů o ropě, pojmenovaný crude. Jde jen o ukázku z několika tisíc článků, které dostaneš příští týden. Abys byl/a připraven/a na textovou analýzu těchto dokumentů, rozhodl/a ses prozkoumat jejich obsah a metadata. Pamatuj, že v R obsahuje VCorpus pro každý text jak část meta, tak content. V této lekci si tyto dva objekty důkladně prohlédneš.
Toto cvičení je součástí kurzu
Úvod do zpracování přirozeného jazyka v R
Pokyny k cvičení
- Vypiš
crudea prohlédni si výstup. - Vypiš obsah 10. článku.
- Vypiš ID prvního článku v
crude. - Pomocí připraveného cyklu
forvytvoř vektor ID z korpusu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print out the corpus
print(___)
# Print the content of the 10th article
crude[[___]]$___
# Find the first ID
crude[[___]]$___$id
# Make a vector of IDs
ids <- c()
for(i in c(1:20)){
ids <- append(ids, crude[[___]]$___$id)
}