호스팅된 파일 로드하기
Sierra Publishing의 데이터 엔지니어링 팀은 데이터 엔지니어링 파이프라인을 위해 Databricks의 다양한 기능을 검토하고 있어요. 그중 한 데이터 엔지니어가 다음과 같은 문제를 제기했습니다:
지금은 외부 데이터 레이크 위치에서 여러 CSV 파일을 읽어오고 있어요. 새 데이터 파일이 언제 들어오는지 알기 어렵고, 이미 어떤 파일을 테이블에 적재했는지 쉽게 기억할 수 없어 테이블 정확도를 유지하기가 정말 힘듭니다.
이 문제를 해결하기 위해 Databricks의 기본 제공 기능을 사용하고자 합니다. 다음 옵션 중 어떤 것이 문제 해결에 도움이 될까요?
이 연습은 강의의 일부입니다
