ÎncepețiÎncepe gratuit

Funcții comune de curățare din tm

Acum că știi două moduri de a crea un corpus, poți să te concentrezi pe curățarea, sau preprocesarea, textului. Mai întâi vei curăța un fragment scurt de text, apoi vei trece la corpusuri mai mari.

În text mining cu bag-of-words, curățarea ajută la agregarea termenilor. De exemplu, poate fi util ca termenii „miner", „mining" și „mine" să fie tratați ca un singur termen. Etapele specifice de preprocesare variază în funcție de proiect. De exemplu, cuvintele folosite în tweet-uri sunt foarte diferite față de cele din documente juridice, astfel că procesul de curățare poate fi și el destul de diferit.

Printre funcțiile comune de preprocesare se numără:

  • tolower(): Transformă toate caracterele în litere mici
  • removePunctuation(): Elimină toate semnele de punctuație
  • removeNumbers(): Elimină cifrele
  • stripWhitespace(): Elimină spațiile albe în exces

tolower() face parte din R de bază, iar celelalte trei funcții provin din pachetul tm. În continuare, vom încărca tm și qdap pentru tine atunci când vor fi necesare. De fiecare dată când introducem un pachet nou, te vom ruga să îl încarci prima dată.

Variabila text, care conține o propoziție, este afișată în script.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

Aplică fiecare dintre următoarele funcții asupra variabilei text, afișând pur și simplu rezultatele în consolă:

- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create the object: text
text <- "She woke up at       6 A.M. It\'s so early!  She was only 10% awake and began drinking coffee in front of her computer."

# Make lowercase
___

# Remove punctuation
____

# Remove numbers
___

# Remove whitespace
___
Editează și rulează codul