Opakování TM (I)
V kurzu Text Mining: Bag of Words ses naučil/a, že korpus je soubor textů, a pracoval/a jsi s funkcemi pro předzpracování textu. Pro připomenutí: jeden ze způsobů, jak korpus vytvořit a vyčistit, je pomocí níže uvedených funkcí. I když jde o jiný kurz, analýza sentimentu je součástí text miningu, takže malé opakování přijde vhod.
- Převeď znakový vektor na textový zdroj pomocí
VectorSource(). - Převeď textový zdroj na korpus pomocí
VCorpus(). - Odstraň nežádoucí znaky z korpusu pomocí čisticích funkcí jako
removePunctuation()astripWhitespace()z balíčkutmneboreplace_abbreviation()z balíčkuqdap.
V tomto cvičení je připravena vlastní funkce clean_corpus(), která standardní předzpracovací funkce sdružuje pro snazší použití.
clean_corpus() přijímá výstup funkce VCorpus() a aplikuje na něj čisticí funkce. Příklad:
processed_corpus <- clean_corpus(my_corpus)
Toto cvičení je součástí kurzu
Sentiment Analysis in R
Pokyny k cvičení
V R session máš k dispozici textový vektor tm_define se dvěma krátkými dokumenty a funkci clean_corpus().
- Vytvoř objekt
tm_vectoraplikovánímVectorSource()natm_define. - Vytvoř
tm_corpuspomocíVCorpus()aplikovaného natm_vector. - Použij
content()k zobrazení obsahu prvního dokumentu vtm_corpus.- K dokumentům v korpusu přistupuješ pomocí syntaxe seznamu – používej dvojité hranaté závorky, např.
[[1]].
- K dokumentům v korpusu přistupuješ pomocí syntaxe seznamu – používej dvojité hranaté závorky, např.
- Vyčisti text korpusu pomocí vlastní funkce
clean_corpus()aplikované natm_corpus. Výsledek ulož do objektutm_clean. - Znovu se podívej na první dokument nového objektu
tm_cleana porovnej, jak se text po aplikaciclean_corpus()změnil.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___