Chico Notes
LLM Wiki / RAG

RAG 成本控制:别只盯 LLM Token

拆解 RAG 成本来源,覆盖解析、Embedding、向量库、检索、Rerank、上下文、LLM、缓存和评测任务。

持续修订的工程笔记

RAG 的成本不是只有 LLM token。生产系统里,解析、embedding、向量库、reranker、日志、评测和重建索引都会消耗预算。

成本地图

环节成本来源控制方式
解析OCR、版面识别增量处理、按类型分级。
Embedding文本量、模型单价chunk hash 缓存、批处理。
存储向量维度、chunk 数去重、压缩、冷热分层。
Retrieval多路召回控制 Top-K、并行和超时。
Rerank候选数量、模型只重排 Top-N。
LLM上下文和输出 tokencontext packing、回答长度限制。
评测样本数、judge 模型分层评测、抽样回归。

成本 Trace

每次请求最好记录:retrieval cost、rerank cost、input tokens、output tokens、cache hit、latency。

{
  "retrieval_ms": 80,
  "rerank_ms": 240,
  "input_tokens": 4200,
  "output_tokens": 520,
  "cache_hit": false,
  "estimated_cost_usd": 0.014
}

结论

成本控制不是简单换小模型,而是让每层能力按价值付费。能缓存的缓存,能过滤的过滤,能用小模型解决的不要交给大模型。

讨论

继续讨论这篇笔记

有问题、补充案例或不同观点,可以通过 GitHub Discussions 继续交流。

On this page