Розбиття файлів Python
Хоча текстові й кодові файли містять ті самі символи, у файлах коду є структури, що виходять за межі природної мови. Щоб зберегти цей контекст, специфічний для коду, під час розбиття документів, варто налаштувати розділювач так, щоб він спочатку намагався розбивати за найпоширенішими кодовими структурами. На щастя, LangChain надає для цього готову функціональність!
Усі потрібні класи вже імпортовано для вас, зокрема Language з langchain_text_splitters.
Ця вправа є частиною курсу
Retrieval Augmented Generation (RAG) з LangChain
Інструкції до вправи
- Створіть рекурсивний символьний розділювач, який розбиватиме за поширеними структурами коду Python.
- Розбийте завантажувач документів
python_dataна частини.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a Python-aware recursive character splitter
python_splitter = RecursiveCharacterTextSplitter.____(
____, chunk_size=300, chunk_overlap=100
)
# Split the Python content into chunks
chunks = ____
for i, chunk in enumerate(chunks[:3]):
print(f"Chunk {i+1}:\n{chunk.page_content}\n")