Baixando dados com Wget e curl
Para iniciar um projeto de análise de dados, é uma boa prática primeiro consolidar todos os dados em um único lugar. Muitas vezes, isso significa baixar e obter dados de vários locais, como servidores HTTP e bancos de dados.
Embora o curl seja prático para baixar um único arquivo, ele não é tão conveniente para lidar com múltiplos downloads. Neste exercício final, vamos usar curl e Wget para baixar uma série de arquivos mensais do Spotify, fazer um pequeno processamento e consolidar todos os arquivos baixados no nosso diretório local.
Este exercicio faz parte do curso
Processamento de Dados no Shell
Instruções do exercicio
- Baixe o arquivo compactado
201812SpotifyDatasalvo na URL encurtada (redirecionada) usandocurl. No mesmo passo, renomeie o arquivo paraSpotify201812.zip. - Descompacte
Spotify201812.zip, exclua o arquivo zip original e renomeie o arquivo descompactado paraSpotify201812.csvpara manter a consistência. - Use
url_list.txteWgetpara baixar, em um único passo, os 3 arquivos:Spotify201809.csv,Spotify201810.csveSpotify201811.csv, com um limite máximo de velocidade de download de 2500KB/s.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls