文档切分算法详解
一、算法概述
文档切分(Document Chunking)是将长文档分割成适合检索的小段落(chunks)的过程。这是RAG(检索增强生成)系统中最基础也最关键的环节之一。好的文档切分策略直接影响后续检索的准确性和生成的质量
二、算法原理
2.1 核心概念
文档集合 D = {D₁, D₂, …, Dₙ} // n篇文档
切分长度 K = chunk_size // 每个chunk最大Token数
重叠长度 L = overlap_size // 相邻chunk重叠Token数
第i篇文档被切分为: Cᵢ = {cᵢ₁, cᵢ₂, …, cᵢₘᵢ} // mᵢ个chunks
2.2 切分数计算公式
三、算法流程
3.1 整体流程图
原始文档
↓
[1. 文本预处理]
↓
[2. 句子分割]
↓
[3. 标题提取与映射]
↓
[4. 重叠滑窗切分]
↓
[5. 后处理与元数据添加]
↓
结构化Chunks
