시작하기무료로 시작하기

파일 크기 최적화

10개의 노드가 있는 클러스터에서 큰 데이터 파일 2개가 주어졌다고 가정해 봅시다. 각 파일에는 크기가 대략 비슷한 행이 1천만 개씩 들어 있습니다. 데이터를 다루는 동안 응답성은 괜찮지만, 파일에서 처음 읽어 오는 데 시간이 꽤 오래 걸립니다. 이 데이터는 매 실행마다 바뀌고, 사용하는 사람은 오직 여러분뿐임을 유의하세요.

다음 중 성능을 개선하는 최선의 방법은 무엇인가요?

이 연습은 강의의 일부입니다

PySpark로 데이터 정제하기

강의 보기

실습형 인터랙티브 연습문제

이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요

연습 시작