Wget과 curl로 데이터 다운로드
데이터 분석 프로젝트를 시작할 때는 먼저 모든 데이터를 한곳에 모아두는 것이 좋습니다. 보통은 HTTP 서버나 데이터베이스 등 여러 위치에서 데이터를 내려받아 가져오게 됩니다.
curl은 단일 파일을 받을 때 유용하지만, 여러 파일을 한꺼번에 처리하기에는 다소 불편합니다. 이 마무리 연습에서는 curl과 Wget을 모두 사용해 월별 Spotify 파일을 연속으로 내려받고, 간단히 처리한 뒤, 받은 모든 파일을 로컬 디렉터리에 정리하겠습니다.
이 연습은 강의의 일부입니다
셸에서의 데이터 처리
연습 안내
curl을 사용해 축약(리디렉션)된 URL에서 압축된201812SpotifyData데이터를 다운로드하고, 같은 단계에서 파일 이름을Spotify201812.zip으로 바꾸세요.Spotify201812.zip의 압축을 풀고, 원본 압축 파일을 삭제한 다음, 풀린 파일 이름을 일관성을 위해Spotify201812.csv로 바꾸세요.url_list.txt와Wget을 사용해Spotify201809.csv,Spotify201810.csv,Spotify201811.csv세 파일을 한 번에 다운로드하되, 최대 다운로드 속도를 2500KB/s로 제한하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls