
研究背景随着网络攻击的规模和复杂度不断上升渗透测试pentesting的需求已超出安全专业人员的供给能力。已有的 LLM 辅助方案如 PentestGPT仍属于半自动化需要大量人工执行命令、解读结果自动化程度有限。为此作者提出 AutoPentester——一个高度自动化的 LLM 智能体框架能够仅凭目标 IP自主完成侦察、扫描、漏洞评估与利用并生成完整报告。核心方法五大智能体模块AutoPentester 采用迭代式架构由五个基于 LLM 的智能体协同完成任务1. 总结器Summarizer将上一步安全工具如 Nmap、Nikto产生的冗长输出按 6000 字符分块含 500 字符重叠后逐块摘要再合并为可读性强的结果供后续模块使用。2. 策略分析器Strategy Analyzer核心决策模块。维护一棵“渗透测试树”Pentest Tree, PTT记录每一步骤及其关键发现并通过思维链Chain-of-Thought推理结合历史发现动态制定下一步攻击策略避免了 PentestGPT 容易遗忘上下文、策略僵化的问题。3. 生成器Generator基于检索增强生成RAG架构从由《Metasploit渗透测试指南》《Penetration Testing: A Hands-on Introduction to Hacking》及 HackTricks 文章构建的知识库中检索相关知识生成可直接执行的完整命令减少模型因知识缺失产生的“幻觉”。4. 智能体-计算机接口ACI负责从生成器输出中提取命令并通过 subprocess/pexpect 等方式在真实终端Nmap、Metasploit、Dirbuster 等中执行实现命令生成到落地执行的完全自动化。5. 结果校验器Results Verifier检查工具输出是否符合预期若命令不完整或效果不佳如端口被过滤未加 -Pn自动调整命令重试。此外框架还包含一个“重复识别模块”Repetition Identifier通过对步骤描述做向量嵌入并计算余弦相似度阈值 0.15来检测是否陷入重复循环一旦发现即向操作员提供“继续/退出/交互模式/自定义输入”四种选择从而显著减少无效循环。任务结束后报告生成器Report Generator会自动汇总日志输出包含 CVE 编号、CVSS 评分、风险等级、修复建议等字段的标准化 CSV 报告。实验与应用场景作者在两类目标上评估 AutoPentester• Hack The BoxHTB真实靶机10 台不同难度机器用于衡量策略性渗透测试能力• 自建虚拟机覆盖 OWASP Top 10 漏洞用于衡量漏洞与威胁评估的覆盖率。以 PentestGPT 为基线对比AutoPentester 在子任务完成率上提升 27.0%漏洞覆盖率提升 39.5%步骤数减少 18.7%循环次数减少约 85.7%人工干预次数从平均 15.36 次降至 1.13 次命令不完整比例下降 97.7%。10 位从业五年以上的安全专家参与的问卷调查也显示AutoPentester 在攻击面覆盖、报告质量、修复建议等维度均优于 PentestGPT平均得分约 4/5PentestGPT 为 3.3/5。消融实验进一步表明RAG 模块与重复识别模块对性能提升贡献最大。该框架适用于企业安全评估、红队演练等场景其全自动化特性可显著节省人工时间尤其适合大规模、重复性的漏洞扫描任务同时也可作为渗透测试培训或红队演练的辅助工具。作者也指出其局限性——在需要与 GUI 交互如 Web 应用的场景下表现较弱且高度依赖知识库的时效性与覆盖面。链接代码仓库https://github.com/YasodGinige/AutoPentester论文 DOI10.1109/TrustCom66490.2025.00026