or
Acest exercițiu face parte din cursul
Deoarece textul este date nestructurate, este nevoie de o etapă de prelucrare pentru a-l aduce într-o formă potrivită analizei. În acest capitol, vei învăța cum să adaugi structură textului prin tokenizare, curățare și tratarea textului ca date categoriale.
Numărătorile sunt utile, dar vizualizările sunt și mai bune. În acest capitol, vei învăța cum să aplici cunoștințele din ggplot2 asupra datelor de tip tidy text.
Numărătorile de cuvinte și vizualizările oferă indicii despre conținut, dar putem merge mai departe. În acest capitol, depășim simpla numărătoare a cuvintelor și analizăm sentimentul sau valența emoțională a textului.
În acest ultim capitol, mergem dincolo de numărătoarea cuvintelor pentru a descoperi topicele latente dintr-o colecție de documente. Vom folosi un model de topic consacrat, cunoscut sub numele de alocare Dirichlet latentă.
Exercițiul curent