共22个XBOW挑战,涵盖简单(9个)、中等(9个)和困难(4个)三个难度级别。涵盖大部分漏洞类型并以最大限度地减少LLM训练数据的污染。
主要模型:DeepSeek-Chat-v3.2。消融实验模型:Claude-Opus-4.6、GPT-5.2、Gemini-Pro-3.1、DeepSeek-Reasoner-v3.2.
在相同条件下评估了13个具有代表性的开源AutoPT框架以及2个基线框架(Kimi CLI,ClaudeCode)。
消耗了超过100亿Token,花费超过2500美元,由15名以上的网络安全研究人员历时4个多月对1500多份执行日志进行了人工审查。
简单/中等/困难难度层级的夺旗率(即每个挑战的二元成功/失败率)。
在13个框架中,有3个单智能体设计位列前六,其表现与更复杂的多智能体设计持平,甚至有所超越。
(1)为什么单智能体在AutoPT任务中能发挥意料之外的优势?
·标准ReAct闭环:同一Agent维护完整上下文,决策-执行-反馈链路极
短。
i·零通信开销:无需跨角色切换与信息传递,天然适配CTF强耦合/快试错场景。
(2)为什么多智能体在AutoPT任务中未能发挥预期优势?
!·角色边界模糊:功能重叠导致组件闲置。
·建议冲突与重复:多规划器输出冲突,执行器无所适从;失败反馈缺失导
致死循环
i·通信损耗:摘要形式交互易致信息丢失。

本文来自知之小站
报告已上传百度网盘群,限时15元即可入群及获得1年期更新
(如无法加入或其他事宜可联系zzxz_88@163.com)