Začněte nyníZačněte zdarma

Stahování dat pomocí Wget a curl

Při zahájení projektu datové analýzy je dobré nejprve shromáždit všechna data na jednom místě. To často znamená stahování dat z různých zdrojů, jako jsou HTTP servery nebo databáze.

Zatímco curl se hodí pro stažení jednoho souboru, práce s více soubory najednou je s ním trochu nepohodlná. V tomto závěrečném cvičení použijeme curl i Wget ke stažení série měsíčních Spotify souborů, provedeme základní zpracování a všechny stažené soubory uložíme do místního adresáře.

Toto cvičení je součástí kurzu

Data Processing in Shell

Zobrazit kurz

Pokyny k cvičení

  • Stáhni zazipovaná data 201812SpotifyData uložená pod zkrácenou (přesměrovanou) URL pomocí curl. Ve stejném kroku soubor přejmenuj na Spotify201812.zip.
  • Rozbal Spotify201812.zip, odstraň původní zazipovaný soubor a rozbalenou verzi přejmenuj na Spotify201812.csv, aby byl název konzistentní.
  • Pomocí url_list.txt a Wget stáhni všechny 3 soubory: Spotify201809.csv, Spotify201810.csv a Spotify201811.csv v jednom kroku, s maximální rychlostí stahování 2500 KB/s.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Upravit a spustit kód