tm의 공통 정제 함수
이제 코퍼스를 만드는 두 가지 방법을 알게 되었으니, 텍스트 정제(전처리)에 집중해 보겠습니다. 먼저 작은 텍스트를 정제한 뒤, 더 큰 코퍼스로 넘어갈 거예요.
Bag-of-Words 기반 텍스트 마이닝에서 정제는 용어를 묶는 데 도움이 됩니다. 예를 들어 "miner", "mining", "mine"는 하나의 용어로 간주하는 것이 더 합리적일 수 있어요. 구체적인 전처리 단계는 프로젝트에 따라 달라집니다. 예를 들어 트윗에서 사용하는 단어와 법률 문서에서 사용하는 단어는 크게 다르기 때문에, 정제 과정도 매우 달라질 수 있어요.
일반적인 전처리 함수는 다음과 같습니다.
tolower(): 모든 문자를 소문자로 변환removePunctuation(): 모든 문장 부호 제거removeNumbers(): 숫자 제거stripWhitespace(): 불필요한 공백 제거
tolower()는 base R에 포함되어 있고, 나머지 세 함수는 tm 패키지에 있어요. 앞으로는 필요할 때 tm과 qdap을 미리 불러오겠습니다. 새로운 패키지를 소개할 때는 처음 한 번은 여러분이 직접 로드해 볼 거예요.
문장 하나가 들어 있는 변수 text가 스크립트에 제공되어 있습니다.
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
다음 각 함수를 text에 적용하고, 결과를 콘솔에 그대로 출력하세요:
- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create the object: text
text <- "She woke up at 6 A.M. It\'s so early! She was only 10% awake and began drinking coffee in front of her computer."
# Make lowercase
___
# Remove punctuation
____
# Remove numbers
___
# Remove whitespace
___