如何用多个 LLM 对计划进行红队测试(分步指南)
红队测试——在现实动手之前先攻击自己的计划——在安全领域是标准做法,在产品和战略工作中也越来越常见。瓶颈一直是人:召集不同专长的攻击者需要一场工作坊。
有了多个 LLM,这只需要几分钟。本指南展示了 LLM Debate Council 中的抗压测试模式如何运作,以及如何获得真正可执行、而非泛泛而谈的发现。
抗压测试模式的结构
一个智能体被指定为你计划的防守方;其他每个智能体都是固定角度的攻击方:安全、可扩展性、成本、用户体验或法律。攻击方必须提出具体的失败场景——何时以及为何会出问题——而不是模糊的担忧。
从第二轮开始,攻击方必须专门针对防守方最新的反驳进行攻击(“你说了 X——这站不住脚,因为 Y”),使攻击不断深入而不是重复。最终综合结果是一份结构化的漏洞列表:每项发现都附有防守方的应对措施和风险评分。
分步操作
- 1. 将计划写成简短的说明:你在做什么、为谁而做、有哪些限制条件。将其粘贴为辩论主题。
- 2. 从至少两个不同厂商中挑选 4–6 个智能体——攻击方的多样性正是关键所在。
- 3. 选择抗压测试模式。第一个智能体将成为防守方,因此把你最强的模型放在这个位置。
- 4. 如果计划依赖数字或法规,请开启事实核查(声明会通过来源进行核实)。
- 5. 运行它。实时观察每一轮;如果攻击方遗漏了你担心的角度,可通过专家介入字段在辩论中途插入。
- 6. 将结论当作工作清单来读:每个漏洞、其应对措施、其风险评分。导出为 PDF/DOCX(Pro)供团队使用。
让攻击更犀利
攻击质量取决于说明质量。加入真实的限制条件(预算、截止日期、团队规模、技术栈)——攻击方会用它们构建可信的失败场景。指出你已经知道薄弱的地方:攻击方会验证你的修复方案能否经受住实际检验。
在指令中为智能体设定人设,以获得特定领域的犀利视角:“你是一名 GDPR 律师”、“你是一名见过这种架构失败的 SRE”。人设会引导每个攻击方超越内置的五个默认角度。
多厂商相比单一模型自我攻击的优势
让单一模型攻击自己的计划,往往只会提出礼貌、笼统的风险。来自竞争厂商的模型——在不同数据上训练、对齐方式各异——确实能发现不同的漏洞。实践中,GPT + Claude + Grok 攻击的合集覆盖的面明显更广,防守方无法用一个含糊其辞的答案就应付所有人。
常见问题
应该使用多少个攻击方?
总共四到六个智能体效果最好:一个防守方加 3–5 个攻击方,理想情况下跨越两个或更多厂商。超过这个数量,轮次会变长,却不会增加多少新发现。
我可以添加自己的攻击角度吗?
可以——有两种方式:在指令中为某个智能体设定人设(“以税务审计员的身份发起攻击”),或通过专家介入字段在辩论中途插入指令,下一轮所有智能体都必须对此作出回应。
我需要哪种套餐?
抗压测试是 Pro 套餐的功能(每月 20 美元)。每个套餐都包含内置模型和每月额度,因此完整一次会话通常只消耗你每月额度的一小部分;你也可以选择接入自己的 API 密钥,直接向服务商付费(消耗 0 额度)。导出为 PDF/DOCX 同样仅限 Pro 套餐。
免费套餐 · 自带 API 密钥 · 15 种语言