감정 점수와 정서
sentiments 데이터셋 안의 nrc 렉시콘에는 단어와 그 단어에 대응하는 정서가 사전 형태로 들어 있어요. joy, trust, anticipation 등 여러 정서가 이 데이터셋에 포함되어 있어요.
지금까지 살펴본 러시아 트윗 봇 데이터셋에는 진보 성향과 보수 성향 트윗 봇이 보낸 트윗이 있어요. nrc 렉시콘을 사용해 진보(민주당) 성향 트윗 봇이 보낸 트윗의 내용을 탐색해 보세요. 왼쪽 성향 트윗 left는 단어 단위로 토큰화되어 있으며, 불용어는 제거되어 있어요.
이 연습은 강의의 일부입니다
R로 배우는 자연어 처리 입문
연습 안내
nrc렉시콘에서 anticipation 단어만으로 구성된 tibble을 만드세요.nrc렉시콘에서 joy 단어만으로 구성된 tibble을 만드세요.left_tokens에서 발견된 상위anticipation단어를 출력하세요.left_tokens에서 발견된 상위joy단어를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
left_tokens <- left %>%
unnest_tokens(output = "word", token = "words", input = content) %>%
anti_join(stop_words)
# Dictionaries
anticipation <- ___("nrc") %>%
___(sentiment == "anticipation")
joy <- ___("nrc") %>%
___(sentiment == "joy")
# Print top words for Anticipation and Joy
left_tokens %>%
___(anticipation, by = "word") %>%
___(word, sort = TRUE)
left_tokens %>%
___(joy, by = "word") %>%
___(word, sort = TRUE)