AI red teaming 依 OWASP LLM Top 10 测试你的 AI 应用
在上线前,用攻击者的方法测你的 AI 应用:提示词注入、数据外泄、越权操作,依 OWASP LLM Top 10 逐项检查。
01
适合谁
- 已上线或准备上线的 AI 客服、聊天机器人或内部 AI 助理
- AI 应用串接了内部数据,或能执行寄信、下单等动作
- 需要向客户、审计或主管机关说明 AI 的安全措施
- 模型或功能改版后,不确定原本的防护还有没有效
02
服务内容
范围界定
厘清应用架构、AI 可以访问的数据与工具,以及不同用户的权限。
提示词注入测试
直接注入与间接注入(藏在文档、网页、Email 里的指令),确认 AI 会不会被改变行为。
数据外泄与越权
系统提示与敏感数据是否会被套出、AI 能否被诱导执行超出权限的动作。
输出处理
AI 的输出被其他系统使用时,是否会造成注入或错误执行。
报告与复测
每个发现附严重度、重现步骤与修补建议;修补后复测。
03
执行方式
1. 范围与规则
约定测试范围、环境、时段与停止条件。
2. 测试
依 OWASP LLM Top 10 逐项测试,记录每一次尝试。
3. 报告
说明发现、影响与修补建议,并与开发团队逐项讨论。
4. 复测
修补后重新测试,确认问题已处理。
04
交付物
- 测试范围与方法说明
- 发现清单(严重度、重现步骤、修补建议)
- 复测报告
05
合作周期
以三个月、半年或一年为一个周期,依范围决定。每个周期结束时,我们会和你一起对照一开始设置的目标,再决定下一个周期要做什么,或到此为止。
每个周期:盘点 → 设计 → 导入 → 对照目标,决定下一步
06
计价方式
依个别案例估算:要处理的系统与数据有多少、需要的人力与时间、周期多长。先聊一次,我们会依实际范围给你一个数字,而不是先报价再凑范围。
07
常见问题
什么是 AI 对抗测试?
模拟攻击者,尝试让 AI 应用做出不该做的事:泄漏数据、忽略原本的指令、执行超出权限的动作。目的是在真正的攻击者之前找到问题。
AI 对抗测试跟一般的渗透测试有什么不同?
一般渗透测试针对网络、服务器与网页的弱点;AI 对抗测试针对语言模型特有的风险,例如用文字内容改变模型行为的提示词注入。两者互补。
测试会影响正式环境吗?
建议在测试环境进行。必须在正式环境测试时,会事先约定范围、时段与停止条件。
修补之后就安全了吗?
提示词注入目前没有一次根治的解法,重点是降低风险、限制 AI 能动用的权限与数据。模型或功能改版后,建议重新测试。
08