or
이 연습은 강의의 일부입니다
이 장에서는 흥미로운 빅데이터의 세계와 함께, 빅데이터 처리를 위한 다양한 개념과 프레임워크를 소개합니다. 왜 Apache Spark가 빅데이터를 위한 최적의 프레임워크로 평가되는지 이해하게 될 거예요.
Spark가 제공하는 핵심 추상화는 복원력 있는 분산 데이터셋(RDD)으로, 이 엔진의 기본이자 근간이 되는 데이터 타입입니다. 이 장에서는 RDD를 소개하고, RDD Transformations와 Actions를 사용해 RDD를 생성하고 실행하는 방법을 보여 드립니다.
이 장에서는 구조화된 데이터 처리를 위한 Spark 모듈인 Spark SQL을 학습합니다. Spark SQL은 DataFrame이라는 프로그래밍 추상화를 제공하며, 분산 SQL 쿼리 엔진으로도 동작할 수 있어요. 이 장을 통해 Python에서 DataFrame을 Spark SQL로 활용하는 방법을 익히게 됩니다.
PySpark MLlib은 Python에서 사용할 수 있는 Apache Spark의 확장 가능한 Machine Learning 라이브러리로, 일반적인 학습 알고리즘과 유틸리티로 구성되어 있습니다. 마지막 장에서는 중요한 Machine Learning 알고리즘을 학습합니다. 영화 추천 엔진과 스팸 필터를 만들고, k-means 클러스터링을 사용해 볼 거예요.
현재 연습