ПочатиПочніть безкоштовно

Завантаження даних за допомогою Wget і curl

Щоб розпочати проєкт аналізу даних, варто спершу зібрати всі дані в одному місці. Часто це означає завантаження даних із різних джерел, зокрема HTTP-серверів і баз даних.

Хоча curl зручний для завантаження одного файла, для пакетних завантажень він не надто зручний. У цій підсумковій вправі ви скористаєтеся і curl, і Wget, щоб завантажити низку щомісячних файлів Spotify, виконати невелику обробку та зібрати всі завантажені файли в нашій локальній теці.

Ця вправа є частиною курсу

Опрацювання даних у Shell

Переглянути курс

Інструкції до вправи

  • Завантажте заархівовані дані 201812SpotifyData, що збережені за скороченою (переспрямованою) URL-адресою, за допомогою curl. У цьому ж кроці перейменуйте файл на Spotify201812.zip.
  • Розпакуйте Spotify201812.zip, видаліть початковий архів і перейменуйте розпакований файл на Spotify201812.csv для узгодженості.
  • Використайте url_list.txt і Wget, щоб за один крок завантажити всі 3 файли: Spotify201809.csv, Spotify201810.csv і Spotify201811.csv, обмеживши максимальну швидкість завантаження до 2500KB/s.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Редагувати та запускати код