시작하기무료로 시작하기

LDA 연습

여러분이 가장 좋아하는 신간, 동물 농장에서 등장인물 Napoleon을 둘러싼 공통 주제에 관심이 있다고 해봅시다. Napoleon은 동무들을 설득해 인간 지배자를 몰아내게 하는 돼지입니다. 그리고 결국 동물 농장의 새 지도자가 되죠.

Napoleon의 이름이 언급된 모든 문장을 pig_sentences로 추출했고, 불용어를 제거하고 어간추출을 완료한 토큰화 버전을 pig_tokens로 만들었습니다. 이 문장들에 LDA를 수행하고, 일부 토픽과 연관된 상위 단어를 살펴보세요.

이 연습은 강의의 일부입니다

R로 배우는 자연어 처리 입문

강의 보기

연습 안내

  • pig_matrix에 LDA를 수행하면서 토픽 10개를 식별하세요. 재현 가능성을 위해 시드는 1111로 설정하세요.
  • 결과에서 beta 행렬을 추출하세요.
  • beta 행렬을 토픽 2만 남기도록 필터링하고, beta 값이 큰 순서로 정렬하세요.
  • beta 행렬을 토픽 3만 남기도록 필터링하고, beta 값이 큰 순서로 정렬하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

library(topicmodels)
# Perform Topic Modeling
sentence_lda <-
  ___(___, k = ___, method = 'Gibbs', control = list(seed = ___))
# Extract the beta matrix 
sentence_betas <- ___(sentence_lda, matrix = "___")

# Topic #2
sentence_betas %>%
  ___(topic == ___) %>%
  arrange(-___)
# Topic #3
sentence_betas %>%
  ___(topic == ___) %>%
  arrange(-___)
코드 편집 및 실행