ホストされたファイルの読み込み
Sierra Publishing のデータエンジニアリングチームは、データエンジニアリングのパイプラインに活用できる Databricks の各種機能を検討しています。チームのデータエンジニアから次のような相談がありました。
現在、外部のデータレイクの場所から複数の CSV ファイルを読み込んでいます。新しいデータファイルがいつ到着するのか分からず、どのファイルをすでにテーブルに読み込んだかも簡単には把握できないため、テーブルの正確性を保つのがとても難しいです。
この課題を Databricks の標準機能で解決したいと考えています。次の選択肢のうち、どれが解決に役立ちますか?
この演習はコースの一部です
