서로 다른 단어 시각화하기
공통이 아닌 단어들을 시각화하고 싶다고 해봅시다. 이를 위해 comparison.cloud()를 사용할 수 있고, 전반적인 단계는 한 가지 주요 차이를 제외하면 매우 비슷해요.
공통 단어를 찾을 때처럼, 먼저 트윗을 서로 다른 코퍼스로 나누고 이를 VCorpus() 객체로 결합합니다. 다음으로 clean_corpus() 함수를 적용하고 TermDocumentMatrix로 정리하세요.
coffee와 chardonnay에 각각 어떤 단어가 속하는지 구분하려면, TDM의 열 이름을 아래와 같이 설정할 수 있어요:
colnames(all_tdm) <- c("chardonnay", "coffee")
마지막으로 comparison.cloud()에서 사용할 수 있도록 as.matrix()를 이용해 객체를 행렬로 변환하세요. comparison.cloud()에 전달되는 각 코퍼사마다 색상을 지정할 수 있어요. 예를 들어 구역을 구분하기 위해 colors = c("red", "yellow", "green")처럼 설정할 수 있습니다.
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
all_corpus는 작업 공간에 미리 로드되어 있습니다.
- 미리 정의된
clean_corpus함수를all_corpus에 적용해all_clean을 생성하세요. all_clean으로부터TermDocumentMatrix인all_tdm을 생성하세요.colnames()를 사용해all_tdm내의 각 코퍼라 이름을 바꾸세요. 첫 번째 열을 "coffee", 두 번째 열을 "chardonnay"로 지정하세요.all_tdm을 행렬 형태로 변환해all_m을 생성하세요.all_m을 사용해comparison.cloud()를 만들고,colors = c("orange", "blue"),max.words = 50로 설정하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Clean the corpus
___ <- ___(___)
# Create all_tdm
___ <- ___(___)
# Give the columns distinct names
___(___) <- ___
# Create all_m
___ <- ___(___)
# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)