Zacznij terazZacznij za darmo

Pobieranie danych za pomocą Wget i curl

Dobrą praktyką na początku projektu analizy danych jest zgromadzenie wszystkich danych w jednym miejscu. Często oznacza to pobieranie plików z różnych źródeł – serwerów HTTP czy baz danych.

Co prawda curl świetnie sprawdza się przy pobieraniu pojedynczego pliku, ale przy wielu plikach jednocześnie bywa mało wygodny. W tym ćwiczeniu podsumowującym użyjesz zarówno curl, jak i Wget, aby pobrać serię miesięcznych plików Spotify, wykonać podstawowe przetwarzanie i zebrać wszystkie pobrane pliki w lokalnym katalogu.

To ćwiczenie jest częścią kursu

Przetwarzanie danych w wierszu poleceń

Zobacz kurs

Instrukcje do ćwiczenia

  • Pobierz skompresowany plik 201812SpotifyData zapisany pod skróconym (przekierowanym) adresem URL za pomocą curl. W tym samym kroku zmień nazwę pliku na Spotify201812.zip.
  • Rozpakuj Spotify201812.zip, usuń oryginalny skompresowany plik i zmień nazwę rozpakowanego pliku na Spotify201812.csv, aby zachować spójność.
  • Użyj pliku url_list.txt i narzędzia Wget, aby pobrać wszystkie 3 pliki: Spotify201809.csv, Spotify201810.csv i Spotify201811.csv w jednym kroku, z górnym limitem prędkości pobierania wynoszącym 2500 KB/s.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Edytuj i uruchom kod