단어 연관성
예상대로, 덴드로그램 전반에서 비슷한 주제가 보이네요. 다시 긍정 댓글로 돌아가서, 워드클라우드에 나타난 상위 구문을 살펴보려고 합니다. tm의 findAssocs() 함수를 사용해 연관된 용어를 찾아보려 해요. 긴 업무 시간과 일과 삶의 불균형을 확인한 지금, 뜻밖의 결과가 있는지도 점검해 보세요.
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
amzn_pros_corp 코퍼스는 이전과 같이 사용자 정의 함수를 사용해 정제되어 있어요.
amzn_pros_corp와control = list(tokenize = tokenizer)를 사용해amzn_p_tdm이라는 TDM을 만드세요.amzn_p_tdm을 행렬로 변환해amzn_p_m을 만드세요.amzn_p_m에rowSums()를 적용해amzn_p_freq를 만드세요.amzn_p_freq에sort()를 사용하고decreasing = TRUE인수를 지정해term_frequency를 만드세요.term_frequency[1:5]로 처음 5개의 바이그램을 확인하세요.- "fast paced"가 상위 용어로 나타나면 놀랄 수도 있어요. 이는 "long hours"와 연관된 부정적 의미일 수 있거든요. "fast paced"와 가장 연관된 용어를 살펴보세요.
amzn_p_tdm에서findAssocs()를 사용해"fast paced"를0.2컷오프로 확인하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Create term_frequency
___ <- ___
# Print the 5 most common terms
___
# Find associations with fast-paced
___