Introducere în stemming și completarea rădăcinilor
Un alt pas de preprocesare util este stemmingul și completarea rădăcinilor. Stemmingul reduce cuvintele la forma lor de bază, unificând variantele din documente diferite. De exemplu, rădăcina comună a cuvintelor „computational", „computers" și „computation" este „comput". Întrucât „comput" nu este un cuvânt real, vrem să reconstruim cuvintele astfel încât toate variantele să trimită la o formă recunoscută, cum ar fi „computer". Această etapă de reconstrucție se numește completarea rădăcinilor.
Pachetul tm pune la dispoziție funcția stemDocument() pentru a obține rădăcina unui cuvânt. Această funcție acceptă fie un vector de caractere și returnează un vector de caractere, fie un obiect PlainTextDocument și returnează un obiect PlainTextDocument.
De exemplu,
stemDocument(c("computational", "computers", "computation"))
returnează "comput" "comput" "comput".
Vei folosi stemCompletion() pentru a reconstrui aceste rădăcini în termeni recunoscuți. stemCompletion() acceptă un vector de caractere și un dicționar de completare. Dicționarul de completare poate fi un vector de caractere sau un obiect Corpus. În orice caz, dicționarul de completare pentru exemplul nostru trebuie să conțină cuvântul „computer", astfel încât toate instanțele de „comput" să poată fi reconstruite.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Creează un vector numit
complicatecare să conțină cuvintele "complicated", "complication" și "complicatedly", în această ordine. - Salvează versiunea cu rădăcinile extrase a lui
complicateîntr-un obiect numitstem_doc. - Creează
comp_dictcare să conțină un singur cuvânt: "complicate". - Creează
complete_textaplicândstemCompletion()pestem_doc. Reconstruiește cuvintele folosindcomp_dictca și corpus de referință. - Afișează
complete_textîn consolă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create complicate
complicate <- ___
# Perform word stemming: stem_doc
stem_doc <- ___
# Create the completion dictionary: comp_dict
comp_dict <- ___
# Perform stem completion: complete_text
complete_text <- ___
# Print complete_text
complete_text