시작하기무료로 시작하기

불용어 제대로 이해하기

자주 등장하지만 정보가 거의 없는 단어들이 있어요. 이를 불용어(stop words)라고 하며, 분석에서 제거하는 경우가 많습니다. 흔한 영어 불용어로는 "I", "she'll", "the" 등이 있어요. tm 패키지에는 174개의 일반적인 영어 불용어가 포함되어 있습니다(이번 연습에서 출력해 볼 거예요!).

실제 분석에서는 이 목록을 추가로 확장해야 할 때가 많습니다. 예를 들어 커피 트윗 사례에서는 모든 트윗에 "coffee"가 들어 있으므로, 일반 불용어 외에 이 단어도 빼는 것이 중요해요. "coffee"를 그대로 두면 통찰에 도움이 되지 않고, 빈도 분석에서 과도하게 강조될 수 있습니다.

c() 함수를 사용하면 불용어 목록에 새 단어를 손쉽게 추가할 수 있어요. 예를 들어, 다음 코드는 기본 영어 불용어 목록에 "word1"과 "word2"를 추가합니다:

all_stops <- c("word1", "word2", stopwords("en"))

의미 있는 불용어 목록을 만들었다면, 이제 텍스트에 removeWords() 함수를 적용하세요. removeWords()는 두 개의 인자를 받습니다: 적용할 대상 text 객체와 제거할 단어 목록입니다.

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

  • stopwords("en")을(를) 호출해 표준 불용어를 확인하세요.
  • text에서 "en" 불용어를 제거하세요.
  • 표준 불용어에 "coffee"와 "bean"을 추가해 new_stops에 저장하세요.
  • 커스텀 불용어인 new_stopstext에서 제거하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

## text is preloaded into your workspace

# List standard English stop words
___

# Print text without standard stop words
removeWords(___, ___("___"))

# Add "coffee" and "bean" to the list: new_stops
new_stops <- c("___", "___", ___)

# Remove stop words from text
___
코드 편집 및 실행