LLM Wiki 与 RAG 工程专题
从文档摄取、索引、检索、重排、GraphRAG、Agentic RAG 到评测治理,系统拆解生产级知识系统。
这个专题讨论的不是“怎么接一个向量库”,而是生产级知识系统如何把组织知识变成可检索、可引用、可评测、可治理、可持续更新的知识访问层。
专题主线
RAG 是让模型使用外部知识的技术模式;LLM Wiki 是围绕知识生命周期、访问权限、检索质量、答案证据和持续运营建设的系统。前者是链路,后者是长期能力。
技术地图
图中把生产级知识系统分为数据与索引、在线检索、答案生成、质量治理四条主链路;GraphRAG 与 Agentic RAG 是按问题复杂度引入的扩展能力,而不是默认前提。
可编辑源文件:llm-wiki-rag-architecture.excalidraw
选择阅读路径
01 基础架构
RAG 的真实架构
从文档摄取到可引用答案,拆开索引、检索、生成和评测四条链路。
Naive RAG 为什么失败
分析召回不到、上下文断裂、引用不可靠、权限泄露和线上不可诊断等失败模式。
数据摄取与索引流水线
处理来源、解析、清洗、版本、幂等、失败恢复与索引发布。
RAG 实验设计
用变量控制、数据分层和离线回放判断改动是否真正有效。
02 数据与索引
Chunking 工程指南
覆盖 PDF、网页、表格、代码和长文档的分块、父子结构与引用定位。
多模态 RAG
重新设计图片、图表、表格和版面信息的解析、索引、检索与评测。
Elasticsearch Mapping 设计
理解 object、flattened、nested 和关系投影的适用边界。
MySQL 与 Elasticsearch 一致性
设计事实源、事件投递、幂等、重放、校验和索引迁移。
03 检索与排序
Metadata Filtering
把租户、权限、文档类型、时间和业务范围约束放进候选集生成阶段。
Elasticsearch Hybrid Search 生产实战
组合 BM25、kNN、RRF、Rerank、过滤、MMR 去冗余、评测与降级。
Embedding 模型评估
用真实查询、领域数据、多语言覆盖、延迟和成本选择向量模型。
Query Rewriting
把自然问题转换为可检索任务,并控制 multi-query、HyDE 和路由风险。
Reranker 指南
理解二阶段检索、Cross-Encoder、LLM Rerank、候选规模和延迟取舍。
Context Packing
在上下文预算内处理证据排序、邻接扩展、去重、压缩和引用完整性。
04 高级知识系统
GraphRAG 的价值与边界
判断什么时候需要关系图谱,什么时候普通 Hybrid RAG 更合适。
GraphRAG 实战架构
从 TextUnit、实体关系抽取、社区发现到 Global、Local 与 DRIFT Search。
Agentic RAG
从固定检索流水线走向可规划、可调用工具、可反思和可验证的检索工作流。
05 质量与治理
RAG 评测体系
从检索、上下文、答案和系统四层建立可重复、可分层的质量指标。
RAG Bad Case 分析
把线上坏例转化为可复现、可归因、可修复和可回归的评测资产。
RAG 发布门禁
在索引、召回、答案、安全、延迟和成本退化时阻止风险版本上线。
RAG 权限与安全
处理权限裁剪、Prompt Injection、检索污染、越权引用和敏感信息泄露。
Citation Engineering
让答案中的证据可以定位、验证、审计,并在证据不足时拒答。
答案置信度
区分检索信号、生成信号和业务风险,避免伪精确的单一置信度分数。
06 生产运营
RAG 可观测性
用 Trace 串起 query、filter、chunk、rank、token、latency、cost 和答案结果。
缓存策略
区分解析、Embedding、检索、重排、上下文和答案缓存,并处理版本失效。
成本控制
从索引、查询、重排、生成、存储和运维维度建立成本预算与降级策略。
RAG 生产检查清单
发布前核对数据、索引、检索、生成、权限、评测、观测、容量和回滚。
当前维护方式
专题已经形成从基础链路到生产运营的完整阅读路径。后续维护优先补充版本边界、官方资料快照、可复现实验、真实 Bad Case 和生产检查项,而不是继续堆叠概念名词。
系列写作原则
| 原则 | 说明 |
|---|---|
| 先讲失败模式 | 每项技术先说明它解决什么问题,以及不用它会在哪里失败。 |
| 区分 Demo 与生产 | Demo 关注跑通;生产关注权限、延迟、成本、评测、审计、降级和恢复。 |
| 不神化单点技术 | GraphRAG、Agentic RAG、向量检索和 Reranker 都有明确适用边界。 |
| 保留版本与证据 | 快速变化的实现标注核验日期、版本范围、来源与仍需验证的部分。 |
| 形成反馈闭环 | 线上 Trace、用户反馈和 Bad Case 最终要回到数据、索引和评测集。 |