or
Den här övningen är en del av kursen
Eftersom text är ostrukturerad data krävs en del bearbetning för att göra den analyserbar. I det här kapitlet lär du dig att ge text struktur genom tokenisering, rensning och hantering av text som kategoriska data.
Frekvenser är användbara, men visualiseringar är ännu bättre. I det här kapitlet lär du dig att tillämpa dina kunskaper om ggplot2 på tidy-textdata.
Ordfrekvenser och visualiseringar ger en bild av innehållet, men vi kan gå längre. I det här kapitlet går vi bortom enbart ordfrekvenser och analyserar textens sentiment, det vill säga dess känslomässiga laddning.
I det här sista kapitlet går vi bortom ordfrekvenser för att ta fram de underliggande ämnena i en samling dokument. Vi använder en etablerad ämnesmodell kallad latent Dirichlet-allokering.
Aktuell övning