Repetition av TM (I)
I kursen Text Mining: Bag of Words lärde du dig att ett korpus är en samling texter, och du studerade några funktioner för att förbehandla text. Som en kort repetition: ett sätt att skapa och rensa ett korpus är med funktionerna nedan. Även om det här är en annan kurs är sentimentanalys en del av textmining, så en repetition kan vara till hjälp.
- Omvandla en teckenvektör till en textkälla med
VectorSource(). - Omvandla en textkälla till ett korpus med
VCorpus(). - Ta bort oönskade tecken från korpuset med rensningsfunktioner som
removePunctuation()ochstripWhitespace()fråntm, samtreplace_abbreviation()frånqdap.
I den här övningen har en anpassad funktion, clean_corpus(), skapats med hjälp av standardfunktioner för förbehandling, vilket gör den enklare att använda.
clean_corpus() tar emot utdata från VCorpus() och tillämpar rensningsfunktioner. Till exempel:
processed_corpus <- clean_corpus(my_corpus)
Den här övningen är en del av kursen
Sentimentanalys i R
Övningsinstruktioner
Din R-session innehåller en textvektor, tm_define, med två korta dokument samt funktionen clean_corpus().
- Skapa ett objekt som heter
tm_vectorgenom att användaVectorSource()påtm_define. - Skapa
tm_corpusgenom att användaVCorpus()påtm_vector. - Använd
content()för att undersöka innehållet i det första dokumentet itm_corpus.- Dokument i korpuset nås med listsyntax – använd dubbla hakparenteser, t.ex.
[[1]].
- Dokument i korpuset nås med listsyntax – använd dubbla hakparenteser, t.ex.
- Rensa korpustexten med den anpassade funktionen
clean_corpus()påtm_corpus. Döp det nya objektet tilltm_clean. - Undersök det första dokumentet i det nya objektet
tm_cleanigen för att se hur texten förändrades efter attclean_corpus()tillämpades.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___