Разбиение файлов Python на части
Хотя текстовые и программные файлы содержат одни и те же символы, код имеет структуры, которых нет в естественном языке. Чтобы сохранить этот контекст при разбиении документов, нужно настроить сплиттер так, чтобы он в первую очередь разбивал текст по наиболее распространённым структурам кода. К счастью, LangChain предоставляет именно такую возможность!
Все необходимые классы уже импортированы, включая Language из langchain_text_splitters.
Это упражнение является частью курса
Retrieval Augmented Generation (RAG) с LangChain
Инструкции к упражнению
- Создайте рекурсивный символьный сплиттер, который будет разбивать текст по типичным структурам кода Python.
- Разбейте загрузчик документов
python_dataна фрагменты.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a Python-aware recursive character splitter
python_splitter = RecursiveCharacterTextSplitter.____(
____, chunk_size=300, chunk_overlap=100
)
# Split the Python content into chunks
chunks = ____
for i, chunk in enumerate(chunks[:3]):
print(f"Chunk {i+1}:\n{chunk.page_content}\n")