Aplică pașii de preprocesare unui corpus
Pachetul tm oferă funcția tm_map() pentru a aplica funcții de curățare întregului corpus, simplificând procesul.
tm_map() primește două argumente: un corpus și o funcție de curățare. În exemplul de mai jos, removeNumbers() provine din pachetul tm.
corpus <- tm_map(corpus, removeNumbers)
Pentru compatibilitate, funcțiile din R de bază și din qdap trebuie incluse în content_transformer().
corpus <- tm_map(corpus, content_transformer(replace_abbreviation))
Dacă aplici aceleași funcții pe mai multe corpusuri, o funcție personalizată precum cea din editor îți va economisi timp (și linii de cod). clean_corpus() primește un singur argument, corpus, îi aplică o serie de funcții de curățare în ordine, apoi returnează corpusul actualizat.
Ordinea pașilor de curățare contează. De exemplu, dacă aplici removeNumbers() și apoi replace_number(), a doua funcție nu va găsi nimic de modificat! Verifică, verifică și iar verifică rezultatele!
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Alter the function code to match the instructions
clean_corpus <- function(corpus) {
# Remove punctuation
corpus <- tm_map(corpus, ___)
# Transform to lower case
corpus <- tm_map(corpus, ___)
# Add more stopwords
corpus <- tm_map(corpus, removeWords, words = c(stopwords("en"), "coffee", ___))
# Strip whitespace
___
return(corpus)
}