ÎncepețiÎncepe gratuit

Aplică pașii de preprocesare unui corpus

Pachetul tm oferă funcția tm_map() pentru a aplica funcții de curățare întregului corpus, simplificând procesul.

tm_map() primește două argumente: un corpus și o funcție de curățare. În exemplul de mai jos, removeNumbers() provine din pachetul tm.

corpus <- tm_map(corpus, removeNumbers)

Pentru compatibilitate, funcțiile din R de bază și din qdap trebuie incluse în content_transformer().

corpus <- tm_map(corpus, content_transformer(replace_abbreviation))

Dacă aplici aceleași funcții pe mai multe corpusuri, o funcție personalizată precum cea din editor îți va economisi timp (și linii de cod). clean_corpus() primește un singur argument, corpus, îi aplică o serie de funcții de curățare în ordine, apoi returnează corpusul actualizat.

Ordinea pașilor de curățare contează. De exemplu, dacă aplici removeNumbers() și apoi replace_number(), a doua funcție nu va găsi nimic de modificat! Verifică, verifică și iar verifică rezultatele!

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Alter the function code to match the instructions
clean_corpus <- function(corpus) {
  # Remove punctuation
  corpus <- tm_map(corpus, ___)
  # Transform to lower case
  corpus <- tm_map(corpus, ___)
  # Add more stopwords
  corpus <- tm_map(corpus, removeWords, words = c(stopwords("en"), "coffee", ___))
  # Strip whitespace
  ___
  return(corpus)
}
Editează și rulează codul