or
Bài tập này là một phần của khóa học
Vì văn bản là dữ liệu phi cấu trúc, bạn cần xử lý ở một mức độ nhất định để đưa nó về dạng có thể phân tích. Trong chương này, bạn sẽ học cách bổ sung cấu trúc cho văn bản bằng cách token hóa, làm sạch và xem văn bản như dữ liệu phân loại.
Đếm từ thì hữu ích, nhưng trực quan hóa còn tốt hơn. Trong chương này, bạn sẽ học cách áp dụng những gì bạn biết từ ggplot2 vào dữ liệu văn bản theo chuẩn tidy.
Đếm từ và biểu đồ có thể gợi ý đôi điều về nội dung, nhưng ta có thể làm nhiều hơn thế. Trong chương này, ta đi xa hơn việc chỉ đếm từ để phân tích cảm xúc hay sắc thái cảm xúc của văn bản.
Ở chương cuối, chúng ta vượt ra ngoài việc đếm từ để khám phá các chủ đề tiềm ẩn trong một tập tài liệu. Chúng ta sẽ sử dụng một mô hình chủ đề chuẩn gọi là latent Dirichlet allocation.
Bài tập hiện tại