시작하기무료로 시작하기

Wget과 curl로 데이터 다운로드

데이터 분석 프로젝트를 시작할 때는 먼저 모든 데이터를 한곳에 모아두는 것이 좋습니다. 보통은 HTTP 서버나 데이터베이스 등 여러 위치에서 데이터를 내려받아 가져오게 됩니다.

curl은 단일 파일을 받을 때 유용하지만, 여러 파일을 한꺼번에 처리하기에는 다소 불편합니다. 이 마무리 연습에서는 curlWget을 모두 사용해 월별 Spotify 파일을 연속으로 내려받고, 간단히 처리한 뒤, 받은 모든 파일을 로컬 디렉터리에 정리하겠습니다.

이 연습은 강의의 일부입니다

셸에서의 데이터 처리

강의 보기

연습 안내

  • curl을 사용해 축약(리디렉션)된 URL에서 압축된 201812SpotifyData 데이터를 다운로드하고, 같은 단계에서 파일 이름을 Spotify201812.zip으로 바꾸세요.
  • Spotify201812.zip의 압축을 풀고, 원본 압축 파일을 삭제한 다음, 풀린 파일 이름을 일관성을 위해 Spotify201812.csv로 바꾸세요.
  • url_list.txtWget을 사용해 Spotify201809.csv, Spotify201810.csv, Spotify201811.csv 세 파일을 한 번에 다운로드하되, 최대 다운로드 속도를 2500KB/s로 제한하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
코드 편집 및 실행