Stahování dat pomocí Wget a curl
Při zahájení projektu datové analýzy je dobré nejprve shromáždit všechna data na jednom místě. To často znamená stahování dat z různých zdrojů, jako jsou HTTP servery nebo databáze.
Zatímco curl se hodí pro stažení jednoho souboru, práce s více soubory najednou je s ním trochu nepohodlná. V tomto závěrečném cvičení použijeme curl i Wget ke stažení série měsíčních Spotify souborů, provedeme základní zpracování a všechny stažené soubory uložíme do místního adresáře.
Toto cvičení je součástí kurzu
Data Processing in Shell
Pokyny k cvičení
- Stáhni zazipovaná data
201812SpotifyDatauložená pod zkrácenou (přesměrovanou) URL pomocícurl. Ve stejném kroku soubor přejmenuj naSpotify201812.zip. - Rozbal
Spotify201812.zip, odstraň původní zazipovaný soubor a rozbalenou verzi přejmenuj naSpotify201812.csv, aby byl název konzistentní. - Pomocí
url_list.txtaWgetstáhni všechny 3 soubory:Spotify201809.csv,Spotify201810.csvaSpotify201811.csvv jednom kroku, s maximální rychlostí stahování 2500 KB/s.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls