Comece agoraComece grátis

Baixando dados com Wget e curl

Para iniciar um projeto de análise de dados, é uma boa prática primeiro consolidar todos os dados em um único lugar. Muitas vezes, isso significa baixar e obter dados de vários locais, como servidores HTTP e bancos de dados.

Embora o curl seja prático para baixar um único arquivo, ele não é tão conveniente para lidar com múltiplos downloads. Neste exercício final, vamos usar curl e Wget para baixar uma série de arquivos mensais do Spotify, fazer um pequeno processamento e consolidar todos os arquivos baixados no nosso diretório local.

Este exercicio faz parte do curso

Processamento de Dados no Shell

Ver curso

Instruções do exercicio

  • Baixe o arquivo compactado 201812SpotifyData salvo na URL encurtada (redirecionada) usando curl. No mesmo passo, renomeie o arquivo para Spotify201812.zip.
  • Descompacte Spotify201812.zip, exclua o arquivo zip original e renomeie o arquivo descompactado para Spotify201812.csv para manter a consistência.
  • Use url_list.txt e Wget para baixar, em um único passo, os 3 arquivos: Spotify201809.csv, Spotify201810.csv e Spotify201811.csv, com um limite máximo de velocidade de download de 2500KB/s.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Editar e Executar Código