데이터 프레임에서 VCorpus 만들기
텍스트 데이터가 데이터 프레임에 있다면, 분석을 위해 DataframeSource()를 사용할 수 있어요. DataframeSource()에 전달되는 데이터 프레임은 특정 구조를 따라야 합니다:
- 첫 번째 열 이름은
doc_id여야 하며, 각 행에 대한 고유한 문자열을 포함해야 해요. - 두 번째 열 이름은
text여야 하며 "UTF-8" 인코딩이어야 해요(일반적입니다). - 그 밖의 3번째 이후 열은 메타데이터로 간주되며 그대로 유지돼요.
이 연습 문제에서는 각 문서에 연결된 메타데이터를 추출하는 meta()를 소개합니다. 실제 데이터에는 저자, 날짜, 주제 태그, 장소 등 분석에 도움이 되는 메타데이터가 있는 경우가 많아요. 텍스트를 코퍼스로 만든 뒤 meta()를 적용하면 문서 수준의 추가 정보를 확인할 수 있어요.
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
작업 공간에는 올바른 열 이름과 일부 메타데이터를 가진 간단한 데이터 프레임 example_text가 있어요. 또한 VectorSource()로 만든 휘발성 코퍼스 vec_corpus도 있어요.
example_text로DataframeSource()를 사용해df_source를 만드세요.df_source를VCorpus()로 휘발성 코퍼스 객체로 변환해df_corpus를 만드세요.df_corpus를 출력하세요. 몇 개의 문서를 포함하는지와 유지된 문서 수준 메타데이터 개수를 확인해 보세요.df_corpus에meta()를 사용해 문서 관련 메타데이터를 출력하세요.- 미리 로드된
vec_corpus객체를 살펴보세요. 문서 개수를df_corpus와 비교해 보세요. vec_corpus에meta()를 사용해vec_corpus와df_corpus사이에서 발견되는 메타데이터를 비교하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a DataframeSource from the example text
df_source <- ___
# Convert df_source to a volatile corpus
df_corpus <- ___
# Examine df_corpus
df_corpus
# Examine df_corpus metadata
___
# Compare the number of documents in the vector source
vec_corpus
# Compare metadata in the vector corpus
___