시작하기무료로 시작하기

퍼플렉시티 테스트

2016년 미국 대선 기간에 트윗 봇이 보낸 트윗으로 구성된 데이터셋이 주어졌습니다. 상사는 관심 있는 두 가지 계정 유형인 LeftRight를 확인했으며, Right 트윗 봇의 트윗에 대해 토픽 모델링을 수행해 달라고 요청했습니다. 또한 이 트윗들의 내용을 토픽 모델링으로 요약하길 원합니다. 데이터에 포함된 토픽 수의 대략적인 규모를 파악하기 위해 5, 15, 50개의 토픽으로 각각 토픽 모델링을 수행하세요.

이 연습은 강의의 일부입니다

R로 배우는 자연어 처리 입문

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

library(topicmodels)
# Setup train and test data
sample_size <- floor(0.90 * nrow(right_matrix))
set.seed(1111)
train_ind <- sample(nrow(right_matrix), size = sample_size)
train <- right_matrix[train_ind, ]
test <- right_matrix[-train_ind, ]

# Peform topic modeling 
lda_model <- LDA(___, k = ___, method = ___,
                 control = list(seed = 1111))
# Train
___(lda_model, newdata = ___) 
# Test
___(lda_model, newdata = ___) 
코드 편집 및 실행