Descărcarea datelor cu Wget și curl
Pentru a demara un proiect de analiză a datelor, este o bună practică să consolidezi mai întâi toate datele într-un singur loc. De cele mai multe ori, acest lucru înseamnă descărcarea și preluarea datelor din diverse surse, cum ar fi servere HTTP și baze de date.
Deși curl este util pentru descărcarea unui singur fișier, devine mai puțin practic atunci când trebuie să gestionezi descărcări multiple. În acest exercițiu final, vom folosi atât curl, cât și Wget pentru a descărca o serie de fișiere Spotify lunare, vom face câteva procesări minore și vom consolida toate fișierele descărcate în directorul local.
Acest exercițiu face parte din cursul
Procesarea datelor în linia de comandă
Instrucțiuni pentru exercițiu
- Descarcă datele comprimate
201812SpotifyDatasalvate la URL-ul scurtat (redirecționat) folosindcurl. În același pas, redenumește fișierul caSpotify201812.zip. - Dezarhivează
Spotify201812.zip, șterge fișierul comprimat original și redenumește fișierul dezarhivat înSpotify201812.csvpentru a păstra consistența. - Folosește
url_list.txtșiWgetpentru a descărca toate cele 3 fișiere:Spotify201809.csv,Spotify201810.csvșiSpotify201811.csvîntr-un singur pas, cu o viteză maximă de descărcare de 2500 KB/s.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls