시작하기무료로 시작하기

tm의 공통 정제 함수

이제 코퍼스를 만드는 두 가지 방법을 알게 되었으니, 텍스트 정제(전처리)에 집중해 보겠습니다. 먼저 작은 텍스트를 정제한 뒤, 더 큰 코퍼스로 넘어갈 거예요.

Bag-of-Words 기반 텍스트 마이닝에서 정제는 용어를 묶는 데 도움이 됩니다. 예를 들어 "miner", "mining", "mine"는 하나의 용어로 간주하는 것이 더 합리적일 수 있어요. 구체적인 전처리 단계는 프로젝트에 따라 달라집니다. 예를 들어 트윗에서 사용하는 단어와 법률 문서에서 사용하는 단어는 크게 다르기 때문에, 정제 과정도 매우 달라질 수 있어요.

일반적인 전처리 함수는 다음과 같습니다.

  • tolower(): 모든 문자를 소문자로 변환
  • removePunctuation(): 모든 문장 부호 제거
  • removeNumbers(): 숫자 제거
  • stripWhitespace(): 불필요한 공백 제거

tolower()는 base R에 포함되어 있고, 나머지 세 함수는 tm 패키지에 있어요. 앞으로는 필요할 때 tmqdap을 미리 불러오겠습니다. 새로운 패키지를 소개할 때는 처음 한 번은 여러분이 직접 로드해 볼 거예요.

문장 하나가 들어 있는 변수 text가 스크립트에 제공되어 있습니다.

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

다음 각 함수를 text에 적용하고, 결과를 콘솔에 그대로 출력하세요:

- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create the object: text
text <- "She woke up at       6 A.M. It\'s so early!  She was only 10% awake and began drinking coffee in front of her computer."

# Make lowercase
___

# Remove punctuation
____

# Remove numbers
___

# Remove whitespace
___
코드 편집 및 실행