O primă degustare din text mining
Uneori putem descoperi intenția autorului și ideile principale doar uitându-ne la cele mai frecvente cuvinte.
În esență, metoda bag-of-words reprezintă o modalitate de a număra termeni sau n-grame într-o colecție de documente. Ia în considerare următoarele propoziții, salvate în variabila text și disponibile în spațiul tău de lucru:
text <- "Text mining usually involves the process of structuring the input text. The overarching goal is, essentially, to turn text into data for analysis, via the application of natural language processing (NLP) and analytical methods."
Numărarea manuală a cuvintelor din propozițiile de mai sus este anevoioasă! Din fericire, pachetul qdap oferă o alternativă mai bună. Poți găsi cu ușurință primii 4 cei mai frecvenți termeni (inclusiv cei cu același număr de apariții) din text apelând funcția freq_terms și specificând 4.
frequent_terms <- freq_terms(text, 4)
Obiectul frequent_terms stochează toate cuvintele unice și frecvența lor. Apoi poți crea un grafic de tip bară pur și simplu apelând funcția plot pe obiectul frequent_terms.
plot(frequent_terms)
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
Am creat în spațiul tău de lucru un obiect numit new_text care conține mai multe propoziții.
- Încarcă pachetul
qdap. - Afișează
new_textîn consolă. - Creează obiectul
term_countcu cei mai frecvenți 10 termeni dinnew_text. - Trasează un grafic de tip bară cu rezultatele din
term_count.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load qdap
___
# Print new_text to the console
new_text
# Find the 10 most frequent terms: term_count
term_count <- ___
# Plot term_count
___