LLM Wiki / RAG
结构化数据 RAG:表格、数据库和指标怎么进上下文
设计面向表格、数据库、指标和配置项的 RAG,区分文本检索、SQL 查询、Schema Linking 和答案生成边界。
不是所有知识都适合切成文本 chunk。价格表、配置项、数据库表、指标口径、API 参数,往往需要结构化查询和精确计算。
三种路径
| 路径 | 适用场景 |
|---|---|
| Text RAG | 表格说明、指标定义、政策解释。 |
| SQL / API Tool | 实时数值、聚合、过滤、排序。 |
| Hybrid | 先用文档解释口径,再用工具取数。 |
Schema Linking
用户问题要先映射到表、字段和指标口径。
风险
- LLM 编 SQL 时误用字段。
- 指标口径和实际查询不一致。
- 表权限和文档权限不一致。
- 聚合结果没有时间范围。
结论
结构化数据 RAG 不应该把所有表格都转成 Markdown。能查询的让工具查询,能解释的让文档解释,最终答案必须同时引用口径和数据结果。
讨论
继续讨论这篇笔记
有问题、补充案例或不同观点,可以通过 GitHub Discussions 继续交流。