Chico Notes
AI Engineering

AI 应用成本与延迟:体验预算怎么拆

拆解 AI 应用的模型、检索、工具、流式输出、缓存、并行和降级策略,建立成本与延迟预算。

持续修订的工程笔记

AI 应用的体验不是只由模型决定。检索、rerank、工具、网络、上下文长度、输出长度、并行策略都会影响延迟和成本。

延迟预算

retrieval: 150ms
rerank: 300ms
tool calls: 500ms
first token: 1000ms
streaming answer: 3000ms

没有预算,就无法判断优化哪里最有价值。

控制手段

手段作用
流式输出降低感知延迟。
并行检索降低等待时间。
Prompt 缓存降低重复上下文成本。
模型路由简单任务用小模型。
回答长度限制控制输出 token。
降级策略超时时保留核心能力。

结论

成本和延迟要当产品指标管理。系统不需要永远用最强模型,而是要把预算花在影响用户结果的地方。

讨论

继续讨论这篇笔记

有问题、补充案例或不同观点,可以通过 GitHub Discussions 继续交流。

On this page