Kom igångKom igång gratis

Repetition av TM (I)

I kursen Text Mining: Bag of Words lärde du dig att ett korpus är en samling texter, och du studerade några funktioner för att förbehandla text. Som en kort repetition: ett sätt att skapa och rensa ett korpus är med funktionerna nedan. Även om det här är en annan kurs är sentimentanalys en del av textmining, så en repetition kan vara till hjälp.

I den här övningen har en anpassad funktion, clean_corpus(), skapats med hjälp av standardfunktioner för förbehandling, vilket gör den enklare att använda.

clean_corpus() tar emot utdata från VCorpus() och tillämpar rensningsfunktioner. Till exempel:

processed_corpus <- clean_corpus(my_corpus)

Den här övningen är en del av kursen

Sentimentanalys i R

Visa kurs

Övningsinstruktioner

Din R-session innehåller en textvektor, tm_define, med två korta dokument samt funktionen clean_corpus().

  • Skapa ett objekt som heter tm_vector genom att använda VectorSource()tm_define.
  • Skapa tm_corpus genom att använda VCorpus()tm_vector.
  • Använd content() för att undersöka innehållet i det första dokumentet i tm_corpus.
    • Dokument i korpuset nås med listsyntax – använd dubbla hakparenteser, t.ex. [[1]].
  • Rensa korpustexten med den anpassade funktionen clean_corpus()tm_corpus. Döp det nya objektet till tm_clean.
  • Undersök det första dokumentet i det nya objektet tm_clean igen för att se hur texten förändrades efter att clean_corpus() tillämpades.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Redigera och kör kod