시작하기무료로 시작하기

서로 다른 단어 시각화하기

공통이 아닌 단어들을 시각화하고 싶다고 해봅시다. 이를 위해 comparison.cloud()를 사용할 수 있고, 전반적인 단계는 한 가지 주요 차이를 제외하면 매우 비슷해요.

공통 단어를 찾을 때처럼, 먼저 트윗을 서로 다른 코퍼스로 나누고 이를 VCorpus() 객체로 결합합니다. 다음으로 clean_corpus() 함수를 적용하고 TermDocumentMatrix로 정리하세요.

coffeechardonnay에 각각 어떤 단어가 속하는지 구분하려면, TDM의 열 이름을 아래와 같이 설정할 수 있어요:

colnames(all_tdm) <- c("chardonnay", "coffee")

마지막으로 comparison.cloud()에서 사용할 수 있도록 as.matrix()를 이용해 객체를 행렬로 변환하세요. comparison.cloud()에 전달되는 각 코퍼사마다 색상을 지정할 수 있어요. 예를 들어 구역을 구분하기 위해 colors = c("red", "yellow", "green")처럼 설정할 수 있습니다.

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

all_corpus는 작업 공간에 미리 로드되어 있습니다.

  • 미리 정의된 clean_corpus 함수를 all_corpus에 적용해 all_clean을 생성하세요.
  • all_clean으로부터 TermDocumentMatrixall_tdm을 생성하세요.
  • colnames()를 사용해 all_tdm 내의 각 코퍼라 이름을 바꾸세요. 첫 번째 열을 "coffee", 두 번째 열을 "chardonnay"로 지정하세요.
  • all_tdm을 행렬 형태로 변환해 all_m을 생성하세요.
  • all_m을 사용해 comparison.cloud()를 만들고, colors = c("orange", "blue"), max.words = 50로 설정하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Clean the corpus
___ <- ___(___)

# Create all_tdm
___ <- ___(___)

# Give the columns distinct names
___(___) <- ___

# Create all_m
___ <- ___(___)

# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)
코드 편집 및 실행