Wczytywanie wielu plików z danymi
Ręczne importowanie wielu zbiorów danych jest jak najbardziej możliwe. Zdarzają się jednak sytuacje, gdy chcesz wczytać całą grupę zbiorów danych bez konieczności wielokrotnego wywoływania read_csv().
Możesz do tego użyć wbudowanej biblioteki glob, która służy do wyszukiwania plików pasujących do określonego wzorca.
Nazwa pochodzi od pojęcia „globbing" – sposobu definiowania wzorców w powłoce Bash.
Funkcja glob() zwraca listę nazw plików pasujących do podanego wzorca.
Następnie możesz użyć wyrażenia listowego, aby wczytać wiele plików do listy, a potem wyodrębnić interesujący cię DataFrame.
To ćwiczenie jest częścią kursu
Python dla użytkowników R
Instrukcje do ćwiczenia
- Utwórz listę wszystkich plików csv w bieżącym katalogu i przypisz ją do zmiennej
csv_files. - Napisz wyrażenie listowe, które wczyta wszystkie pliki
csvdo listydfs. - Napisz wyrażenie listowe, które sprawdzi atrybut
.shapekażdego DataFrame na liście.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
import glob
import pandas as pd
# Get a list of all the csv files
csv_files = glob.____('*.csv')
# List comprehension that loads of all the files
dfs = [pd.read_csv(____) for ____ in ____]
# List comprehension that looks at the shape of all DataFrames
print(____)