간단한 워드 클라우드
이 시점에서 아마 커피를 너무 많이 드셨을지도 모르겠네요. 게다가 "shop", "morning", "drinking" 같은 상위 단어들을 보는 것만으로는 그리 의미 있는 통찰을 얻기 어렵습니다.
여기까지 오신 것을 기념하며, 1000개의 트윗을 또 한 묶음 살펴보겠습니다. 지금은 이 트윗들이 무엇을 공통으로 갖는지 알 수 없지만, 워드 클라우드를 이용해 추측해 보세요. 트윗의 단어 빈도 값은 워크스페이스에 미리 로드되어 있습니다.
워드 클라우드는 단어를 시각화한 것입니다. 워드 클라우드에서 크기는 보통 빈도에 비례하고, 경우에 따라 색상은 다른 지표를 나타내기도 합니다. 지금은 단순하게 유지하겠습니다. 크기는 개별 단어의 빈도와 관련 있고, 색상은 하나만 선택합니다.
영상에서 보셨듯이, wordcloud() 함수는 다음과 같이 동작해요:
wordcloud(words, frequencies, max.words = 500, colors = "blue")
텍스트 마이닝 분석에는 종종 간단한 워드 클라우드가 포함됩니다. 사실 과하게 쓰이는 경향이 있지만, 텍스트 내용을 빠르게 파악하는 데에는 여전히 유용해요!
term_frequency가 워크스페이스에 로드되어 있습니다.
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
wordcloud패키지를 로드하세요.term_frequency에서 처음 10개 항목을 출력하세요.term_frequency에names()를 적용해 용어를 추출하고, 이 문자열 벡터를terms_vec라고 부르세요.terms_vec를 단어로,term_frequency를 값으로 사용해wordcloud()를 생성하세요. 여기에max.words = 50과colors = "red"매개변수를 추가하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Load wordcloud package
# Print the first 10 entries in term_frequency
# Vector of terms
# Create a word cloud for the values in word_freqs