网络安全

AI red teaming 依 OWASP LLM Top 10 测试你的 AI 应用

在上线前,用攻击者的方法测你的 AI 应用:提示词注入、数据外泄、越权操作,依 OWASP LLM Top 10 逐项检查。

01

适合谁

  • 已上线或准备上线的 AI 客服、聊天机器人或内部 AI 助理
  • AI 应用串接了内部数据,或能执行寄信、下单等动作
  • 需要向客户、审计或主管机关说明 AI 的安全措施
  • 模型或功能改版后,不确定原本的防护还有没有效

02

服务内容

范围界定

厘清应用架构、AI 可以访问的数据与工具,以及不同用户的权限。

提示词注入测试

直接注入与间接注入(藏在文档、网页、Email 里的指令),确认 AI 会不会被改变行为。

数据外泄与越权

系统提示与敏感数据是否会被套出、AI 能否被诱导执行超出权限的动作。

输出处理

AI 的输出被其他系统使用时,是否会造成注入或错误执行。

报告与复测

每个发现附严重度、重现步骤与修补建议;修补后复测。

03

执行方式

1. 范围与规则

约定测试范围、环境、时段与停止条件。

2. 测试

依 OWASP LLM Top 10 逐项测试,记录每一次尝试。

3. 报告

说明发现、影响与修补建议,并与开发团队逐项讨论。

4. 复测

修补后重新测试,确认问题已处理。

04

交付物

  • 测试范围与方法说明
  • 发现清单(严重度、重现步骤、修补建议)
  • 复测报告

05

合作周期

以三个月、半年或一年为一个周期,依范围决定。每个周期结束时,我们会和你一起对照一开始设置的目标,再决定下一个周期要做什么,或到此为止。

每个周期:盘点 → 设计 → 导入 → 对照目标,决定下一步

06

计价方式

依个别案例估算:要处理的系统与数据有多少、需要的人力与时间、周期多长。先聊一次,我们会依实际范围给你一个数字,而不是先报价再凑范围。

07

常见问题

什么是 AI 对抗测试?

模拟攻击者,尝试让 AI 应用做出不该做的事:泄漏数据、忽略原本的指令、执行超出权限的动作。目的是在真正的攻击者之前找到问题。

AI 对抗测试跟一般的渗透测试有什么不同?

一般渗透测试针对网络、服务器与网页的弱点;AI 对抗测试针对语言模型特有的风险,例如用文字内容改变模型行为的提示词注入。两者互补。

测试会影响正式环境吗?

建议在测试环境进行。必须在正式环境测试时,会事先约定范围、时段与停止条件。

修补之后就安全了吗?

提示词注入目前没有一次根治的解法,重点是降低风险、限制 AI 能动用的权限与数据。模型或功能改版后,建议重新测试。

08

延伸阅读

聊聊你的状况

写信告诉我们你现在卡在哪里,我们会回复可行的做法与下一步。