Začněte nyníZačněte zdarma

Opakování TM (I)

V kurzu Text Mining: Bag of Words ses naučil/a, že korpus je soubor textů, a pracoval/a jsi s funkcemi pro předzpracování textu. Pro připomenutí: jeden ze způsobů, jak korpus vytvořit a vyčistit, je pomocí níže uvedených funkcí. I když jde o jiný kurz, analýza sentimentu je součástí text miningu, takže malé opakování přijde vhod.

V tomto cvičení je připravena vlastní funkce clean_corpus(), která standardní předzpracovací funkce sdružuje pro snazší použití.

clean_corpus() přijímá výstup funkce VCorpus() a aplikuje na něj čisticí funkce. Příklad:

processed_corpus <- clean_corpus(my_corpus)

Toto cvičení je součástí kurzu

Sentiment Analysis in R

Zobrazit kurz

Pokyny k cvičení

V R session máš k dispozici textový vektor tm_define se dvěma krátkými dokumenty a funkci clean_corpus().

  • Vytvoř objekt tm_vector aplikováním VectorSource() na tm_define.
  • Vytvoř tm_corpus pomocí VCorpus() aplikovaného na tm_vector.
  • Použij content() k zobrazení obsahu prvního dokumentu v tm_corpus.
    • K dokumentům v korpusu přistupuješ pomocí syntaxe seznamu – používej dvojité hranaté závorky, např. [[1]].
  • Vyčisti text korpusu pomocí vlastní funkce clean_corpus() aplikované na tm_corpus. Výsledek ulož do objektu tm_clean.
  • Znovu se podívej na první dokument nového objektu tm_clean a porovnej, jak se text po aplikaci clean_corpus() změnil.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Upravit a spustit kód