Revisão de TM (I)
No curso Text Mining: Bag of Words, você aprendeu que um corpus é um conjunto de textos e estudou algumas funções de pré-processamento. Para recapitular, uma forma de criar e limpar um corpus é com as funções abaixo. Mesmo sendo um curso diferente, a análise de sentimento faz parte de text mining, então uma revisão pode ajudar.
- Transforme um vetor de caracteres em uma fonte de texto usando
VectorSource(). - Transforme uma fonte de texto em um corpus usando
VCorpus(). - Remova caracteres indesejados do corpus usando funções de limpeza como
removePunctuation()estripWhitespace()dotm, ereplace_abbreviation()doqdap.
Neste exercício, uma função personalizada clean_corpus() foi criada usando funções padrão de pré-processamento para facilitar a aplicação.
clean_corpus() recebe a saída de VCorpus() e aplica funções de limpeza. Por exemplo:
processed_corpus <- clean_corpus(my_corpus)
Este exercicio faz parte do curso
Análise de Sentimentos em R
Instruções do exercicio
Sua sessão do R tem um vetor de texto, tm_define, contendo dois pequenos documentos e a função clean_corpus().
- Crie um objeto chamado
tm_vectoraplicandoVectorSource()atm_define. - Crie
tm_corpususandoVCorpus()emtm_vector. - Use
content()para examinar o conteúdo do primeiro documento emtm_corpus.- Os documentos do corpus são acessados usando a sintaxe de lista, então use colchetes duplos, por exemplo,
[[1]].
- Os documentos do corpus são acessados usando a sintaxe de lista, então use colchetes duplos, por exemplo,
- Limpe o texto do corpus usando a função personalizada
clean_corpus()emtm_corpus. Chame esse novo objeto detm_clean. - Examine novamente o primeiro documento do novo objeto
tm_cleanpara ver como o texto mudou após a aplicação declean_corpus().
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___