or
Ця вправа є частиною курсу
Оскільки текст — це неструктуровані дані, його потрібно певним чином опрацювати, щоб привести до формату, придатного для аналізу. У цьому розділі ви дізнаєтеся, як надати тексту структури за допомогою токенізації, очищення та трактування тексту як категоріальних даних.
Підрахунки — це добре, але візуалізації — краще. У цьому розділі ви навчитеся застосовувати свої знання з ggplot2 до впорядкованих текстових даних.
Хоча частоти слів і візуалізації дають уявлення про зміст, можна піти далі. У цьому розділі ми виходимо за межі простих підрахунків слів і аналізуємо тональність або емоційне забарвлення тексту.
У фінальному розділі ми виходимо за межі підрахунків слів, щоб виявити приховані теми в колекції документів. Ми використаємо стандартну тематичну модель під назвою латентний розподіл Діріхле (LDA).
Поточна вправа