시작하기무료로 시작하기

qdap으로 자주 등장하는 용어 찾기

정확한 전처리 단계에 대한 일부 통제를 포기해도 괜찮다면, qdapfreq_terms()를 사용해 빠르게 자주 등장하는 용어를 구할 수 있어요.

이 함수는 텍스트 변수를 입력으로 받는데, 여기서는 tweets$text 벡터입니다. top 인수로 표시할 상위 용어의 개수를, stopwords 인수로 제거할 불용어 벡터를, at.least 인수로 포함할 단어의 최소 글자 수를 지정할 수 있어요. qdap에는 tm과는 다른 자체 불용어 목록이 있습니다. 이번 연습에서는 두 가지 방법을 각각 사용하는 법과 그 결과를 비교하는 방법을 보여 드릴게요.

결과를 기본 그래프로 그리는 것도 간단합니다. freq_terms() 객체에 대해 plot()을 호출하기만 하면 됩니다.

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create frequency
frequency <- ___(
  ___, 
  top = ___, 
  at.least = ___, 
  stopwords = ___
)

# Make a frequency bar chart
코드 편집 및 실행