AI Engineering
Agent 可观测性:一次自动执行背后要记录什么
设计 Agent trace、事件、工具调用、状态快照、成本和人工确认日志,支持复盘和回归测试。
Agent 出错时,只有最终回答没有意义。你需要知道它为什么计划那样做、调用了哪些工具、工具返回什么、状态如何变化、哪里需要人介入。
Trace 结构
| 字段 | 说明 |
|---|---|
| run_id | 一次 Agent 执行。 |
| goal | 用户目标。 |
| plan | 当前计划和版本。 |
| tool_calls | 工具名、参数、结果、耗时。 |
| state_diff | 每步状态变化。 |
| approvals | 人工确认记录。 |
| cost | token、工具成本、总耗时。 |
| final_status | success、failed、cancelled、needs_human。 |
事件流
结论
Agent 可观测性是信任基础。没有 trace 的自动执行不可审计,也无法把线上失败变成回归样本。
讨论
继续讨论这篇笔记
有问题、补充案例或不同观点,可以通过 GitHub Discussions 继续交流。