ÎncepețiÎncepe gratuit

O primă degustare din text mining

Uneori putem descoperi intenția autorului și ideile principale doar uitându-ne la cele mai frecvente cuvinte.

În esență, metoda bag-of-words reprezintă o modalitate de a număra termeni sau n-grame într-o colecție de documente. Ia în considerare următoarele propoziții, salvate în variabila text și disponibile în spațiul tău de lucru:

text <- "Text mining usually involves the process of structuring the input text. The overarching goal is, essentially, to turn text into data for analysis, via the application of natural language processing (NLP) and analytical methods."

Numărarea manuală a cuvintelor din propozițiile de mai sus este anevoioasă! Din fericire, pachetul qdap oferă o alternativă mai bună. Poți găsi cu ușurință primii 4 cei mai frecvenți termeni (inclusiv cei cu același număr de apariții) din text apelând funcția freq_terms și specificând 4.

frequent_terms <- freq_terms(text, 4)

Obiectul frequent_terms stochează toate cuvintele unice și frecvența lor. Apoi poți crea un grafic de tip bară pur și simplu apelând funcția plot pe obiectul frequent_terms.

plot(frequent_terms)

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

Am creat în spațiul tău de lucru un obiect numit new_text care conține mai multe propoziții.

  • Încarcă pachetul qdap.
  • Afișează new_text în consolă.
  • Creează obiectul term_count cu cei mai frecvenți 10 termeni din new_text.
  • Trasează un grafic de tip bară cu rezultatele din term_count.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load qdap
___

# Print new_text to the console
new_text

# Find the 10 most frequent terms: term_count
term_count <- ___

# Plot term_count
___
Editează și rulează codul