or
이 연습은 강의의 일부입니다
이 장에서는 Spark에서 SQL 테이블을 생성하고 쿼리하는 방법을 배웁니다. Spark SQL은 SQL의 표현력을 Spark로 가져옵니다. 또한 Spark에서 SQL 윈도 함수를 사용하는 방법도 학습합니다. 윈도 함수는 현재 행과 관련된 여러 행을 가로질러 계산을 수행합니다. 이는 조인과 전통적 집계만으로 표현하기 어려운 결과를 훨씬 쉽게 만들어 줍니다. 우리는 윈도 함수를 사용해 누적 합, 누적 차이 등 기본 SQL만으로 구현하기 까다로운 연산을 수행해 보겠습니다.
이 장에서는 자연어 텍스트를 로드한 다음, 이동 윈도 분석을 적용해 빈번한 단어 시퀀스를 찾습니다.
앞선 장들에서 윈도 함수 SQL의 표현력을 익혔습니다. 이제 이 표현력을 제대로 활용하려면 DataFrame과 SQL 테이블을 올바르게 캐시하는 방법을 이해하는 것이 중요합니다. 또한 애플리케이션을 평가하는 방법도 알아야 합니다. 이를 Spark UI로 수행하는 방법을 배웁니다. 아울러 Spark에서의 로깅 모범 사례도 살펴봅니다. Spark SQL은 쿼리 성능 문제를 튜닝하는 데 유용한 또 다른 도구인 쿼리 실행 계획을 제공합니다. 실행 계획을 사용해 DataFrame의 소스와 변환 과정을 평가하는 방법을 배우게 됩니다.
현재 연습
앞선 장에서는 원시 텍스트를 로드하고 토크나이즈하며 단어 시퀀스를 추출하는 도구를 익혔습니다. 이는 분석에 매우 유용할 뿐 아니라 Machine Learning에도 활용할 수 있습니다. 이제 로지스틱 회귀를 사용해 텍스트를 분류하면서 배운 내용을 하나로 연결합니다. 이 장을 마치면 원시 자연어 텍스트 데이터를 로드해 텍스트 분류기를 학습하는 데까지 활용해 보게 됩니다.