다음 중 Spark 클러스터 위치를 지정하는 방법으로서 유효하지 않은 것은 무엇인가요?
이 연습은 강의의 일부입니다
이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요
Spark는 Big Data를 다루는 프레임워크입니다. 이 장에서는 Spark와 Machine Learning의 배경을 살펴봅니다. 이어서 Python으로 Spark에 연결하고 CSV 데이터를 로드하는 방법을 배웁니다.
현재 연습
이제 데이터를 Spark로 불러오는 데 익숙해졌으니, 두 가지 분류 모델(의사결정나무와 로지스틱 회귀)을 만들어 봅니다. 또한 데이터 준비를 위한 몇 가지 접근법도 알아봅니다.
다음으로 선형 회귀 모델을 만드는 방법을 배웁니다. 새로운 예측 변수를 설계해 데이터를 확장하고, 가장 관련성 높은 예측 변수만 선택하는 견고한 방법도 함께 살펴봅니다.
마지막으로 모델을 더 효율적으로 만드는 방법을 학습합니다. 파이프라인을 사용해 코드를 더 명확하고 유지보수하기 쉽게 만드는 법을 익히고, 교차 검증으로 모델을 더 잘 평가하고 좋은 하이퍼파라미터를 선택합니다. 끝으로 두 가지 유형의 앙상블 모델도 간단히 다뤄봅니다.