AI Engineering
AI 应用成本与延迟:体验预算怎么拆
拆解 AI 应用的模型、检索、工具、流式输出、缓存、并行和降级策略,建立成本与延迟预算。
AI 应用的体验不是只由模型决定。检索、rerank、工具、网络、上下文长度、输出长度、并行策略都会影响延迟和成本。
延迟预算
retrieval: 150ms
rerank: 300ms
tool calls: 500ms
first token: 1000ms
streaming answer: 3000ms没有预算,就无法判断优化哪里最有价值。
控制手段
| 手段 | 作用 |
|---|---|
| 流式输出 | 降低感知延迟。 |
| 并行检索 | 降低等待时间。 |
| Prompt 缓存 | 降低重复上下文成本。 |
| 模型路由 | 简单任务用小模型。 |
| 回答长度限制 | 控制输出 token。 |
| 降级策略 | 超时时保留核心能力。 |
结论
成本和延迟要当产品指标管理。系统不需要永远用最强模型,而是要把预算花在影响用户结果的地方。
讨论
继续讨论这篇笔记
有问题、补充案例或不同观点,可以通过 GitHub Discussions 继续交流。