Fazendo scan de vários arquivos
Os dados de empréstimos da equipe agora estão divididos em um CSV por ano ("seattle2021.csv", "seattle2022.csv", "seattle_2023.csv"). Esses arquivos anuais usam os nomes de colunas legados usageclass e materialtype. Use um padrão glob para fazer o scan de todos os arquivos juntos como um único conjunto de dados lógico e, em seguida, crie um resumo de empréstimos físicos.
polars já está carregado como pl, e o diretório está em MULTIFILE_DIR.
Este exercicio faz parte do curso
Dimensionamento e Otimização de Pipelines de Dados com Polars
Instruções do exercicio
- Faça o scan de todos os arquivos "seattle*.csv" em MULTIFILEDIR usando um padrão glob.
- Filtre o conjunto de dados combinado para empréstimos "Physical" e depois faça o group by de materialtype.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
str(MULTIFILE_DIR / "____")
)
# Build a physical-checkout summary across the combined dataset
result = (
yearly_checkouts
# Filter to physical
.filter(pl.col("usageclass") == "____")
.group_by("____")
.agg(pl.col("checkouts").sum().alias("total"))
.sort("total", descending=True)
.collect()
)
print(result)