시작하기무료로 시작하기

단어 연관성

예상대로, 덴드로그램 전반에서 비슷한 주제가 보이네요. 다시 긍정 댓글로 돌아가서, 워드클라우드에 나타난 상위 구문을 살펴보려고 합니다. tmfindAssocs() 함수를 사용해 연관된 용어를 찾아보려 해요. 긴 업무 시간과 일과 삶의 불균형을 확인한 지금, 뜻밖의 결과가 있는지도 점검해 보세요.

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

amzn_pros_corp 코퍼스는 이전과 같이 사용자 정의 함수를 사용해 정제되어 있어요.

  • amzn_pros_corpcontrol = list(tokenize = tokenizer)를 사용해 amzn_p_tdm이라는 TDM을 만드세요.
  • amzn_p_tdm을 행렬로 변환해 amzn_p_m을 만드세요.
  • amzn_p_mrowSums()를 적용해 amzn_p_freq를 만드세요.
  • amzn_p_freqsort()를 사용하고 decreasing = TRUE 인수를 지정해 term_frequency를 만드세요.
  • term_frequency[1:5]로 처음 5개의 바이그램을 확인하세요.
  • "fast paced"가 상위 용어로 나타나면 놀랄 수도 있어요. 이는 "long hours"와 연관된 부정적 의미일 수 있거든요. "fast paced"와 가장 연관된 용어를 살펴보세요. amzn_p_tdm에서 findAssocs()를 사용해 "fast paced"0.2 컷오프로 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Create term_frequency
___ <- ___

# Print the 5 most common terms
___

# Find associations with fast-paced
___
코드 편집 및 실행