知识库设置
配置组:rag
知识库设置用于控制 RAG 的内容切分、索引、召回、精排和多轮会话上下文。它直接影响知识库构建速度、检索准确率和模型回答成本。
基础开关
关闭后,知识库相关功能将不可用或不再参与前台问答。
内容分块
配置建议
- 文章较短、结构清晰:
chunkSize可设为800-1000。 - 长文较多、上下文关联强:
chunkOverlap可设为100-200。 - 内容噪声较多时,不建议把分块设置得过大,否则召回结果会包含太多无关内容。
索引批量
配置建议
- 普通站点可以使用默认值
8。 - 模型较慢或经常超时,建议调小到
5或更低。 - 文档很多且模型稳定时,可以适当调大,但要观察 AI 基座超时和内存压力。
Embedding 调用
超时场景建议
- OpenAI 兼容模型或远程模型较慢时,保持
embeddingBatchSize = 1。 - 自部署模型吞吐不稳定时,保持
embeddingParallelCalls = 1。 - 频繁超时时,不要先增加重试次数,优先调小批量或调大超时时间。
- 重试会拉长整体索引耗时,适合偶发失败,不适合长期超时。
混合检索与精排
配置建议
- 内容标题、关键词明确:保持混合检索开启。
- 没有 Rerank 模型:可以关闭
enableRerank,系统会使用召回顺序。 - 回答经常缺少关键信息:适当提高
vectorTopK、keywordTopK或rerankTopN。 - 成本或响应时间过高:降低
rerankTopN和maxContextCharacters。
多轮会话上下文
配置建议
- 前台助手以单轮问答为主:可降低到
4-8。 - 访客经常连续追问:保持默认
12。 - 模型上下文较小或成本敏感:降低字符预算。
增量索引说明
导入文章或文档后,可以只索引本次新增内容,不需要每次全量重建。全量重建更适合以下场景:
- 更换 Embedding 模型。
- 大幅调整分块大小或分块重叠。
- 怀疑索引数据不一致,需要整体刷新。