or
이 연습은 강의의 일부입니다
이 챕터에서는 Databricks 노트북 사용법, CSV 데이터를 Spark DataFrame으로 로드하는 방법, 그리고 PySpark와 SQL을 활용해 데이터를 구조화하는 방법을 배웁니다.
명시적 스키마를 정의하고 데이터 정제 파이프라인을 구축하는 방법, 그리고 브로드캐스트 조인으로 쿼리 성능을 최적화하는 방법을 학습합니다.
윈도우 함수로 누적 합계와 순위를 계산하는 방법, 스트리밍 파이프라인을 구축하는 방법, 그리고 프로덕션 워크플로를 배포하는 방법을 배웁니다.
현재 연습