시작하기무료로 시작하기

비교 클라우드

이 연습 문제에서는 용어 빈도를 시각적으로 파악할 수 있는 일반적인 시각화를 만들어 봅니다. 구체적으로, 긍정 및 부정으로 합쳐진 문서에서 가장 자주 등장하는 용어를 살펴볼 것입니다. 앞서 만든 TermDocumentMatrix all_tdm을 떠올려 보세요. 이 행렬은 1,000개의 숙소 리뷰 대신, polarity() 점수에 따라 구분된 모든 리뷰를 담은 2개의 문서로 구성되어 있습니다.

TDM을 행렬로 변환하면 작업이 훨씬 편리해집니다. 변환 후에는 열 이름을 변경하면 됩니다. colnames() 함수는 아래와 같이 할당 연산자의 왼쪽에 사용한다는 점을 기억하세요.

colnames(OBJECT) <- c("COLUMN_NAME1", "COLUMN_NAME2")

그런 다음 행렬을 재정렬하여 가장 긍정적인 단어와 부정적인 단어를 확인합니다. 결론 연습 문제에 답할 수 있도록 이 용어들을 꼭 살펴보세요!

마지막으로, comparison.cloud()를 사용해 용어를 시각화합니다.

이 연습은 강의의 일부입니다

R을 활용한 감성 분석

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Matrix
___

# Column names
colnames(___) <- ___

# Top pos words
order_by_pos <- order(all_tdm_m[, ___], decreasing = ___)

# Review top 10 pos words
all_tdm_m[order_by_pos, ] %>% head(___)

# Top neg words
order_by_neg <- order(___, decreasing = ___)

# Review top 10 neg words
all_tdm_m[___, ] %>% ___
코드 편집 및 실행