or
Toto cvičení je součástí kurzu
Text je nestrukturovaná data, takže než ho budeš moct analyzovat, je třeba ho trochu zkrotit. V této kapitole se naučíš, jak dodat textu strukturu pomocí tokenizace, čištění a práce s textem jako s kategorickými daty.
Počty jsou fajn, ale vizualizace jsou lepší. V této kapitole zjistíš, jak využít znalosti z ggplot2 při práci s tidy textovými daty.
Počty slov a vizualizace o obsahu ledacos napoví, ale dá se jít ještě dál. V této kapitole překročíme hranice pouhého počítání slov a zaměříme se na analýzu sentimentu neboli emocionálního vyznění textu.
V závěrečné kapitole jdeme za hranice počítání slov a odhalujeme skrytá témata v kolekcích dokumentů. Využijeme k tomu standardní tematický model zvaný latentní Dirichletova alokace.
Aktuální cvičení