所有文章
阅读时长 1 分钟
文档每 512 个 token 切一刀,不叫 RAG 策略
切分方式会直接改变模型能找回什么、丢掉什么。别照着教程填默认值,先看你的文档结构和用户究竟怎么问。
切块决定检索器能看到的证据单位。固定 512 token 只是一个起点;标题层级、表格、代码和问答跨度不同,最佳边界也不同。
先保留文档结构
优先按章节、段落、列表、表格和代码块切分,并把标题路径与页码保存为元数据。只有超长单元再按 token 分割并重叠,避免把表头和单元格、函数签名和实现拆开。
用真实问题测召回
为一组问题标注支持答案的文档片段,比较不同切块方案的 context recall、precision 和排名。大块可能带来噪声,小块可能丢上下文,不能只看向量相似度。
为特殊内容单独处理
表格可转成带表头的行记录,代码按符号或语法树切分,扫描 PDF 先做 OCR 质量检查。检索后可扩大到相邻块,但要记录最终送入模型的来源范围。
上线前检查
- 引用能回到原文位置
- 结构化内容没有被随意截断
- 切块选择由检索评测支持