НачатьНачать бесплатно

Загрузка данных с помощью Wget и curl

Хорошей практикой при запуске проекта по анализу данных является предварительная консолидация всех данных в одном месте. Как правило, это означает загрузку данных из различных источников: HTTP-серверов, баз данных и других ресурсов.

Хотя curl удобен для загрузки отдельного файла, работать с ним при загрузке нескольких файлов не очень удобно. В этом итоговом упражнении мы воспользуемся curl и Wget, чтобы загрузить набор ежемесячных файлов Spotify, выполнить базовую обработку и объединить все загруженные файлы в локальной директории.

Это упражнение является частью курса

Обработка данных в командной строке

Посмотреть курс

Инструкции к упражнению

  • Загрузите архив 201812SpotifyData по сокращённому (перенаправленному) URL с помощью curl. В том же шаге переименуйте файл в Spotify201812.zip.
  • Разархивируйте Spotify201812.zip, удалите исходный архив и переименуйте извлечённый файл в Spotify201812.csv для единообразия.
  • Используйте url_list.txt и Wget, чтобы загрузить все 3 файла: Spotify201809.csv, Spotify201810.csv и Spotify201811.csv — за один шаг, установив максимальную скорость загрузки 2500 КБ/с.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
Редактировать и запускать код