LLM Wiki / RAG
RAG 成本控制:别只盯 LLM Token
拆解 RAG 成本来源,覆盖解析、Embedding、向量库、检索、Rerank、上下文、LLM、缓存和评测任务。
RAG 的成本不是只有 LLM token。生产系统里,解析、embedding、向量库、reranker、日志、评测和重建索引都会消耗预算。
成本地图
| 环节 | 成本来源 | 控制方式 |
|---|---|---|
| 解析 | OCR、版面识别 | 增量处理、按类型分级。 |
| Embedding | 文本量、模型单价 | chunk hash 缓存、批处理。 |
| 存储 | 向量维度、chunk 数 | 去重、压缩、冷热分层。 |
| Retrieval | 多路召回 | 控制 Top-K、并行和超时。 |
| Rerank | 候选数量、模型 | 只重排 Top-N。 |
| LLM | 上下文和输出 token | context packing、回答长度限制。 |
| 评测 | 样本数、judge 模型 | 分层评测、抽样回归。 |
成本 Trace
每次请求最好记录:retrieval cost、rerank cost、input tokens、output tokens、cache hit、latency。
{
"retrieval_ms": 80,
"rerank_ms": 240,
"input_tokens": 4200,
"output_tokens": 520,
"cache_hit": false,
"estimated_cost_usd": 0.014
}结论
成本控制不是简单换小模型,而是让每层能力按价值付费。能缓存的缓存,能过滤的过滤,能用小模型解决的不要交给大模型。
讨论
继续讨论这篇笔记
有问题、补充案例或不同观点,可以通过 GitHub Discussions 继续交流。