Comece agoraComece grátis

Revisão de TM (I)

No curso Text Mining: Bag of Words, você aprendeu que um corpus é um conjunto de textos e estudou algumas funções de pré-processamento. Para recapitular, uma forma de criar e limpar um corpus é com as funções abaixo. Mesmo sendo um curso diferente, a análise de sentimento faz parte de text mining, então uma revisão pode ajudar.

Neste exercício, uma função personalizada clean_corpus() foi criada usando funções padrão de pré-processamento para facilitar a aplicação.

clean_corpus() recebe a saída de VCorpus() e aplica funções de limpeza. Por exemplo:

processed_corpus <- clean_corpus(my_corpus)

Este exercicio faz parte do curso

Análise de Sentimentos em R

Ver curso

Instruções do exercicio

Sua sessão do R tem um vetor de texto, tm_define, contendo dois pequenos documentos e a função clean_corpus().

  • Crie um objeto chamado tm_vector aplicando VectorSource() a tm_define.
  • Crie tm_corpus usando VCorpus() em tm_vector.
  • Use content() para examinar o conteúdo do primeiro documento em tm_corpus.
    • Os documentos do corpus são acessados usando a sintaxe de lista, então use colchetes duplos, por exemplo, [[1]].
  • Limpe o texto do corpus usando a função personalizada clean_corpus() em tm_corpus. Chame esse novo objeto de tm_clean.
  • Examine novamente o primeiro documento do novo objeto tm_clean para ver como o texto mudou após a aplicação de clean_corpus().

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Editar e Executar Código