AI Engineering
AI App Guardrails:把安全边界写进系统而不是写进愿望
设计 AI 应用的输入、检索、工具、输出和人工确认 guardrails,避免只靠 prompt 约束。
Guardrails 不是一句“不要做危险事情”。生产 AI 应用需要在输入、检索、工具、生成和输出层都有明确边界。
分层 Guardrails
| 层级 | 检查 |
|---|---|
| Input | 注入、越权意图、敏感请求。 |
| Retrieval | ACL、租户、数据范围。 |
| Tool | 参数校验、权限、速率、幂等。 |
| Generation | 引用、拒答、格式、事实约束。 |
| Output | 敏感信息、政策违规、不可执行建议。 |
| Human | 高风险操作人工确认。 |
原则
Prompt guardrail 只能作为最后一层辅助,不能替代权限系统、参数校验和审计日志。
结论
安全边界要写进系统路径,而不是写进模型愿望。能用代码确定的,不要交给模型判断。
讨论
继续讨论这篇笔记
有问题、补充案例或不同观点,可以通过 GitHub Discussions 继续交流。