Pobieranie danych za pomocą Wget i curl
Dobrą praktyką na początku projektu analizy danych jest zgromadzenie wszystkich danych w jednym miejscu. Często oznacza to pobieranie plików z różnych źródeł – serwerów HTTP czy baz danych.
Co prawda curl świetnie sprawdza się przy pobieraniu pojedynczego pliku, ale przy wielu plikach jednocześnie bywa mało wygodny. W tym ćwiczeniu podsumowującym użyjesz zarówno curl, jak i Wget, aby pobrać serię miesięcznych plików Spotify, wykonać podstawowe przetwarzanie i zebrać wszystkie pobrane pliki w lokalnym katalogu.
To ćwiczenie jest częścią kursu
Przetwarzanie danych w wierszu poleceń
Instrukcje do ćwiczenia
- Pobierz skompresowany plik
201812SpotifyDatazapisany pod skróconym (przekierowanym) adresem URL za pomocącurl. W tym samym kroku zmień nazwę pliku naSpotify201812.zip. - Rozpakuj
Spotify201812.zip, usuń oryginalny skompresowany plik i zmień nazwę rozpakowanego pliku naSpotify201812.csv, aby zachować spójność. - Użyj pliku
url_list.txti narzędziaWget, aby pobrać wszystkie 3 pliki:Spotify201809.csv,Spotify201810.csviSpotify201811.csvw jednym kroku, z górnym limitem prędkości pobierania wynoszącym 2500 KB/s.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip
# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv
# View url_list.txt to verify content
cat url_list.txt
# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt
# Take a look at all files downloaded
ls