Descarga de datos con Wget y curl
Para iniciar un proyecto de análisis de datos, es buena práctica consolidar primero todos los datos en un mismo lugar. A menudo, esto implica descargar y extraer datos de varias ubicaciones, como servidores HTTP y bases de datos.
Aunque curl es útil para descargar un solo archivo, no es tan práctico para manejar múltiples descargas. En este ejercicio final, usaremos tanto curl como Wget para descargar una serie de archivos mensuales de Spotify, hacer un pequeño procesamiento y consolidar todos los archivos descargados en nuestro directorio local.
Este ejercicio forma parte del curso
Procesamiento de datos en Shell
Instrucciones del ejercicio
- Descarga el archivo comprimido de datos
201812SpotifyDataguardado en la URL acortada (redirigida) usandocurl. En el mismo paso, renómbralo comoSpotify201812.zip. - Descomprime
Spotify201812.zip, borra el archivo comprimido original y renombra el archivo descomprimido aSpotify201812.csvpara mantener la coherencia. - Usa
url_list.txtyWgetpara descargar de una sola vez los 3 archivos:Spotify201809.csv,Spotify201810.csvySpotify201811.csv, con un límite máximo de velocidad de descarga de 2500 KB/s.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls