EmpezarEmpieza gratis

Descarga de datos con Wget y curl

Para iniciar un proyecto de análisis de datos, es buena práctica consolidar primero todos los datos en un mismo lugar. A menudo, esto implica descargar y extraer datos de varias ubicaciones, como servidores HTTP y bases de datos.

Aunque curl es útil para descargar un solo archivo, no es tan práctico para manejar múltiples descargas. En este ejercicio final, usaremos tanto curl como Wget para descargar una serie de archivos mensuales de Spotify, hacer un pequeño procesamiento y consolidar todos los archivos descargados en nuestro directorio local.

Este ejercicio forma parte del curso

Procesamiento de datos en Shell

Ver curso

Instrucciones del ejercicio

  • Descarga el archivo comprimido de datos 201812SpotifyData guardado en la URL acortada (redirigida) usando curl. En el mismo paso, renómbralo como Spotify201812.zip.
  • Descomprime Spotify201812.zip, borra el archivo comprimido original y renombra el archivo descomprimido a Spotify201812.csv para mantener la coherencia.
  • Usa url_list.txt y Wget para descargar de una sola vez los 3 archivos: Spotify201809.csv, Spotify201810.csv y Spotify201811.csv, con un límite máximo de velocidad de descarga de 2500 KB/s.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Editar y ejecutar código