AI Engineering
Agent 评测:别只评最终答案
设计 Agent 评测体系,覆盖任务成功率、工具调用、步骤效率、恢复能力、安全边界和人工介入率。
Agent 的输出不是一段答案,而是一串决策、工具调用和状态变化。只看最终答案,会漏掉很多生产风险。
评测维度
| 维度 | 指标 |
|---|---|
| Task Success | 任务是否完成。 |
| Tool Correctness | 工具是否选对、参数是否正确。 |
| Step Efficiency | 是否绕路、重复调用。 |
| Recovery | 工具失败后能否恢复。 |
| Safety | 是否触发越权或危险操作。 |
| HITL | 人工介入是否出现在正确节点。 |
Trace 评审
结论
Agent 评测要评过程。一个最终答案正确但调用了错误工具、泄露了中间信息、绕了十步的 Agent,仍然不是好 Agent。
讨论
继续讨论这篇笔记
有问题、补充案例或不同观点,可以通过 GitHub Discussions 继续交流。