시작하기무료로 시작하기

문서에 토픽 할당하기

LDA 모델은 결과를 해석하고 활용하지 못하면 무의미해요. 문장 모음 pig_sentences에 대해 LDA 모델 sentence_lda를 실행한 결과가 주어졌어요. 어떤 LDA 분석 결과든 제대로 이해하려면 토픽별 상위 단어를 담은 beta와 문서별 상위 토픽을 담은 gamma 두 행렬을 모두 살펴봐야 해요.

이 두 행렬에 대해 알고 있는 내용을 바탕으로, 특정 토픽의 결과를 추출하고 출력이 예상과 맞는지 확인해 보세요.

이 연습은 강의의 일부입니다

R로 배우는 자연어 처리 입문

강의 보기

연습 안내

  • betagamma 행렬 각각에 대해 tibble을 만드세요.
  • 토픽 5의 상위 단어를 확인하고, 결과를 beta 값이 큰 순서로 정렬해 토픽 5를 탐색하세요.
  • 토픽 5와 가장 잘 맞는 문장이 무엇인지 확인하고, 결과를 gamma 값이 큰 순서로 정렬해 토픽 5를 탐색하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")

# Explore Topic 5 Betas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)

# Explore Topic 5 Gammas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)
코드 편집 및 실행