불용어와 워드 클라우드
이제 텍스트 마이닝 감각을 살려 샤르도네 한 잔과 함께 더 깊이 들어가 보겠습니다. 지난 워드 클라우드에서는 "chardonnay"가 시각을 압도했죠. 너무 지배적이어서 다른 흥미로운 인사이트를 뽑아내기 어려웠습니다.
이번에는 불용어 목록에 "chardonnay"를 포함해, 원래는 가려졌던 다른 공통 단어들을 살펴보겠습니다.
작업 공간에는 정제된 chardonnay 트윗이 준비되어 있습니다. 이제 의미가 크지 않은 용어들을 제거해 볼게요. 이 연습에서는 비교를 위해 특정 트윗을 보여 주려고 content()를 사용합니다. 코퍼스 리스트를 인덱싱할 때는 대괄호 두 개를 사용해야 한다는 점을 기억하세요.
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
chardonnay_corp의 24번째 문서에content()를 적용하세요.- 영어 불용어에
"chardonnay"를 추가하고, 이를stops에 할당하세요. stops의 마지막 여섯 단어를 확인하세요.tm_map()을 사용해chardonnay_corp, 함수removeWords(), 그리고 불용어stops를 차례로 전달해cleaned_chardonnay_corp를 만드세요.- 이제 결과를 비교하기 위해 다시 한 번
24번째 트윗의content를 확인하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Review a "cleaned" tweet
___(___)
# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')
# Review last 6 stopwords
tail(stops)
# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)
# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])