텍스트 불러오기
텍스트 마이닝은 텍스트 데이터를 R로 불러오는 것에서 시작합니다. 이를 위해 read.csv() 함수를 사용할 거예요.
가장 좋은 방법은 읽어들인 객체를 살펴보고 어떤 열이 중요한지 확인하는 것입니다. str() 함수가 이를 효율적으로 도와줍니다.
데이터 프레임에 텍스트가 아닌 열이 있다면, 올바른 텍스트 열만 사용해 새 객체를 만드는 것이 좋습니다(예: some_object$column_name).
이 데이터는 실제 Twitter 데이터이므로, 욕설이나 불쾌감을 줄 수 있는 내용이 포함될 수 있습니다(이번 연습 문제와 이후 실제 Twitter 데이터를 사용하는 연습 문제에도 해당될 수 있어요).
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
데이터는 미리 로드되어 있으며 coffee_data_file에 있습니다.
- 커피를 언급한 트윗이 들어 있는 파일
coffee_data_file에 대해read.csv()를 사용해 새 객체tweets를 만드세요. - 분석할 텍스트가 어떤 열에 있는지 확인하기 위해
str()로tweets객체를 살펴보세요. - 앞에서 확인한 텍스트 열만 사용해
coffee_tweets객체를 새로 만드세요. 이를 위해$연산자와 열 이름을 사용하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import text data from CSV, no factors
tweets <- ___
# View the structure of tweets
___
# Isolate text from tweets
coffee_tweets <- ___