LDA 연습
여러분이 가장 좋아하는 신간, 동물 농장에서 등장인물 Napoleon을 둘러싼 공통 주제에 관심이 있다고 해봅시다. Napoleon은 동무들을 설득해 인간 지배자를 몰아내게 하는 돼지입니다. 그리고 결국 동물 농장의 새 지도자가 되죠.
Napoleon의 이름이 언급된 모든 문장을 pig_sentences로 추출했고, 불용어를 제거하고 어간추출을 완료한 토큰화 버전을 pig_tokens로 만들었습니다. 이 문장들에 LDA를 수행하고, 일부 토픽과 연관된 상위 단어를 살펴보세요.
이 연습은 강의의 일부입니다
R로 배우는 자연어 처리 입문
연습 안내
pig_matrix에 LDA를 수행하면서 토픽 10개를 식별하세요. 재현 가능성을 위해 시드는1111로 설정하세요.- 결과에서 beta 행렬을 추출하세요.
- beta 행렬을 토픽 2만 남기도록 필터링하고, beta 값이 큰 순서로 정렬하세요.
- beta 행렬을 토픽 3만 남기도록 필터링하고, beta 값이 큰 순서로 정렬하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
library(topicmodels)
# Perform Topic Modeling
sentence_lda <-
___(___, k = ___, method = 'Gibbs', control = list(seed = ___))
# Extract the beta matrix
sentence_betas <- ___(sentence_lda, matrix = "___")
# Topic #2
sentence_betas %>%
___(topic == ___) %>%
arrange(-___)
# Topic #3
sentence_betas %>%
___(topic == ___) %>%
arrange(-___)