or
이 연습은 강의의 일부입니다
텍스트는 비정형 데이터이므로, 분석 가능한 형태로 만들기 위해 어느 정도의 정리가 필요해요. 이 장에서는 토큰화와 정제, 그리고 텍스트를 범주형 데이터로 취급하는 방법을 통해 텍스트에 구조를 부여하는 법을 배웁니다.
단순한 개수도 유용하지만, 시각화가 더 강력해요. 이 장에서는 ggplot2에서 배운 내용을 깔끔한 텍스트 데이터에 적용하는 방법을 익힙니다.
단어 빈도와 시각화만으로도 내용을 어느 정도 파악할 수 있지만, 더 나아갈 수 있어요. 이 장에서는 단순한 단어 수를 넘어 텍스트의 감성, 즉 정서적 경향을 분석합니다.
마지막 장에서는 단어 빈도를 넘어 문서 모음 속에 숨어 있는 주제를 찾아봅니다. LDA(latent Dirichlet allocation)로 알려진 표준 토픽 모델을 사용하겠습니다.
현재 연습