MANTA:面向自演化多智能体系统的多智能体网络拓扑自适应框架

发布时间:2026/8/3 15:13:49
MANTA:面向自演化多智能体系统的多智能体网络拓扑自适应框架 MANTA面向自演化多智能体系统的多智能体网络拓扑自适应框架论文原链接https://arxiv.org/html/2607.28527v1摘要现有大模型多智能体系统普遍采用固定通信拓扑仅能在任务执行前完成离线优化无法在推理过程中根据协作故障动态调整组织方式。本文提出**MANTA多智能体网络拓扑自适应**框架实现任务执行阶段的拓扑自演化执行前基于历史经验生成任务专属初始智能体协作拓扑运行时审计完整协作轨迹识别流程异常检测出结构性缺陷时执行有界拓扑修改可调整智能角色、通信链路、执行顺序、校验通道双时间尺度记忆剧本沉淀拓扑调整经验跨任务复用优化方案。实验基于信息检索、工具调用、长周期规划、办公工作流、数学推理五大基准对比单智能体、静态多智能体、自动化工作流生成三类基线。MANTA平均得分74.0超越最优基线5.8个百分点在PlanCraft规划基准取得单项最优结果。实验证明在推理阶段自适应调整协作拓扑可显著提升复杂任务求解能力。1 引言1.1 研究背景生物系统可在与环境持续交互中动态调整协作结构而当前LLM多智能体框架优化仅停留在离线阶段任务开始前一次性搜索固定智能体分工、通信网络运行全程不可修改。现有自优化技术覆盖输出文本、提示词、推理轨迹、工具技能、记忆、单智能体角色但从未将智能体协作拓扑作为推理时可优化对象。多智能体拓扑定义智能体间通信对象、信息传递路径、校验节点、产出精炼流程直接决定复杂任务协作效率。但现有MASS、AFlow等框架仅离线搜索最优拓扑任务执行中无法根据运行故障实时重构团队组织存在明显性能天花板。本文核心研究问题多智能体系统能否在求解同一任务的过程中动态自我优化协作通信网络1.2 MANTA框架核心四大能力任务感知初始拓扑规划读取任务描述长期记忆剧本生成适配初始智能体团队结构运行时轨迹审计不依赖标准答案仅从协作流程识别可修复结构性缺陷有界拓扑修复单次运行最多执行3项结构修改约束算力开销长短双记忆剧本短期记录单轮运行拓扑与故障长期沉淀跨任务通用拓扑优化经验无需微调模型权重。1.3 本文三大核心贡献提出全新自优化层级拓扑级在线自适应将多智能体协作网络纳入推理时可调整优化对象设计MANTA完整流水线规划-执行-审计-修复-记忆闭环全程不更新模型权重仅推理阶段调整协作结构五大基准大规模实证MANTA平均得分74.0全面超越所有基线消融实验证明初始规划、在线修复、跨任务记忆均为核心增益模块。2 相关工作2.1 智能体自优化层级分层体系论文将现有自优化技术划分为7层MANTA位于L6拓扑自适应层区别于更低层级文本/记忆优化、更高层级模型权重微调L0输出文本迭代优化Self-RefineL1提示词自动搜索APO、DSPyL2推理轨迹优化CoT、ToTL3工具/技能学习ReAct、VoyagerL4记忆管理Reflexion、Generative AgentsL5单智能角色分工MetaGPT、多智能辩论L6多智能体通信拓扑自适应本文MANTA、MASS、AFlowL7模型权重训练微调RLHF2.2 低层文本/轨迹优化仅修改单智能体输出、思考过程不改变多智能体协作结构代表CoT、自一致性、Self-Refine、提示词进化算法。2.3 工具与记忆增强优化单智能体工具调用、长期记忆存储团队拓扑固定不变代表ReAct、Reflexion、A-MEM。2.4 固定拓扑多智能体预先定义辩论/树形/轮询等静态通信结构执行全程不变代表CAMEL、ChatDev、多智能辩论。2.5 离线智能体工作流搜索AFlow、ADAS、AgentSquare、MASS在任务运行前离线遍历拓扑空间选出固定结构后执行无法在线修复运行故障是本文核心对比基线。2. MANTA核心差异化离线框架一次性锁定拓扑MANTA每轮协作后审计故障实时局部修改通信网络同时通过剧本沉淀跨任务通用拓扑经验。3 方法体系3.1 系统整体架构MANTA分为两大独立层级业务求解层普通任务智能体集群完成信息检索、计算、写作等业务目标编排元控制层三大元智能体确定性调度代码拓扑规划器生成/修改智能体协作拓扑轨迹审计器扫描执行轨迹识别流程缺陷技能反思器批量更新长期拓扑剧本调度器、执行器、控制器、终值合成器为确定性代码无LLM推理开销。完整闭环流程任务输入 → 规划器生成初始拓扑 → 多轮协作执行 → 审计轨迹标记故障 → 控制器判定达标直接输出否则调用规划器执行一次有界拓扑修复 → 使用新拓扑重新执行一轮 → 运行数据写入短期剧本批量更新长期剧本。3.2 拓扑标准化表达规范每条拓扑规范为带版本校验的结构化定义核心要素智能体角色协调者/工作者/评审者/辩论者分组交互模式星型、链式、辩论、投票、嵌套子组上下文访问策略控制每个智能体可见消息、证据范围执行约束智能体总数上限、无循环依赖、合法分组。调度器会自动过滤非法拓扑提案拒绝存在循环、超人数、角色冲突的方案。支持单智能体、固定六类基础拓扑作为特殊初始配置。3.3 完整编排执行流水线3.3.1 任务条件初始拓扑规划规划器输入任务描述、长期剧本经验不读取基准标准答案输出完整拓扑结构智能体数量、分组、角色、通信链路。确定性代码将文本规划方案解析、校验非法方案自动降级为基础星型协调拓扑。3.3.2 单轮协作执行引擎按分组嵌套结构递归执行智能体交互结构化数据包通信而非原始长文本对话每条数据包包含答案、证据、置信度、未解决问题共享证据账本去重重复工具调用所有产出追加写入不可篡改日志上下文控制器强制执行可见性策略智能体仅能读取授权数据包。3.4 轨迹审计与拓扑修复模块每轮执行结束后审计器扫描全量工具记录、数据包、置信度信息仅识别流程异常不评判答案对错确定性硬规则检测重复写操作、分支空输出、无校验高置信度结论等LLM开放集补充未定义新型流程缺陷标记中/高严重度故障则触发修复流程修复约束单次最多3项拓扑修改算子修改后完整校验结构合法性。可用拓扑修改算子全集add_agent新增评审/工作智能体expand_agent_to_group将单一过载智能体扩展为子组set_group_pattern修改分组交互模式星型→辩论/链式add_edge/remove_edge增减智能体直接通信链路set_context_policy调整信息可见范围。3.5 双时间尺度剧本记忆机制短期剧本单任务生命周期记录每轮拓扑、审计故障、修复决策规划器修复时可查阅本轮所有历史尝试避免重复无效结构长期跨任务剧本markdown标准化文档存储任务特征-最优拓扑映射、故障修复通用方案每N轮任务由反思器批量更新关键特性长期剧本完全不接触基准答案仅基于流程干净度无审计故障、共识完备更新经验保证泛化性。4 实验设计4.1 评测模型与五大基准统一骨干模型Gemma 4 31B推理强度中等五大基准覆盖三类任务信息检索工具类BrowseComp、StableToolBench规划工作流类PlanCraft、WorkBench数学推理类MATH每组基准30道题目独立运行3次取均值。4.2 对比基线三大分类4.2.1 单智能体基线Single Agent、CoT、自一致性Self-Consistency、Self-Refine4.2.2 静态固定多智能体全程拓扑不变投票机制、群聊辩论、全连接辩论、带/不带讨论协调者、树形协调者4.2.3 离线自动拓扑搜索框架执行前固定结构AFlow、ADAS、AgentSquare、MASS主实验全基准性能总表系统类型方法BrowseCompStableToolBenchPlanCraftWorkBenchMATH平均得分单智能体Single Agent34.474.461.141.185.659.3单智能体CoT26.750.062.235.675.650.0单智能体Self-Consistency37.851.161.115.678.948.9单智能体Self-Refine14.468.962.235.696.755.6静态多智能体投票43.385.661.141.192.264.7静态多智能体群聊辩论61.182.272.221.191.165.5静态多智能体全连接辩论58.981.173.321.191.165.1静态多智能体无讨论协调者53.382.274.423.394.465.5静态多智能体带讨论协调者64.480.073.320.093.366.2静态多智能体树形协调者54.478.962.216.794.461.3离线自适应AFlow12.266.721.161.196.751.6离线自适应ADAS48.977.857.866.790.068.2离线自适应AgentSquare32.288.934.462.296.762.9离线自适应MASS50.050.070.046.795.662.5本文MANTA76.782.276.743.391.174.05 实验结果与定量分析5.1 整体性能核心结论MANTA五大基准平均74.0高于最优离线基线ADAS68.25.8个百分点在BrowseComp检索、Plan长规划两类任务取得单项最优仅MATH数学推理略低于Self-Refine、AgentSquare证明拓扑自适应对多步骤协作类任务增益最大纯单步推理提升有限。5.2 模块消融实验四大基准均值消融配置平均成功率总Token开销完整MANTA71.7100315移除初始拓扑规划固定星型57.5112040移除在线拓扑修复60.872105冻结长期剧本不更新67.5102620完全移除长期剧本66.778356结论任务感知初始规划是最大增益来源在线修复、长期跨任务记忆提供稳定额外提升。5.3 拓扑修改预算消融修改预算单次运行最多执行拓扑修改次数0/1/2/3预算越高全基准任务解决率持续上升第一次修改带来收益幅度最大2/3次小幅补充高难度任务覆盖。5.4 长期剧本跨任务泛化设置0次修改预算仅依靠剧本初始化拓扑排除修复干扰同域迁移PlanCraft→PlanCraft、WorkBench→WorkBench成功率3.3跨域迁移PlanCraft↔WorkBench平均3.3对比基线ADAS/AgentSquare/MASS跨域使用全部性能下跌证明长期剧本存储通用拓扑经验而非基准专属固定工作流。5.5 Token推理开销对比MANTA总推理Token仅77652低于全部静态多智能体框架远低于ADAS、AFlow等离线搜索框架元智能体规划、审计开销仅占总算力12%在线自适应无显著算力负担。5.6 典型拓扑修复案例拆解案例1过载分支扩展初始3智能体星型拓扑单一工作者承载大量检索任务频繁工具报错修复算子expand_agent_to_group将该智能体扩展为嵌套子组拆分检索维度任务成功率显著提升。案例2执行/校验顺序重构场景1单一智能产出低置信结果无校验新增评审智能体改为链式“生成→校验”结构场景2多智能体并行执行重复状态修改操作修改分组模式为串行链式避免重复变更。案例3通信重布线、新增评审场景13智能体星型结构过早达成共识遗留未解决问题新增工作者-评审者直连通信边改为辩论拓扑场景2单智能无校验输出新增专职评审智能体组成双人辩论结构。核心规律拓扑优化不等于单纯增加智能体更多是调整通信链路、执行顺序、新增校验角色。5.7 轨迹审计有效性全450轮MANTA运行审计统计无故障干净轨迹任务正确率83.2%标记故障任务仅62.5%审计可识别75/117错误案例151次拓扑修复中60.9%消除原故障标记审计仅依赖流程特征不读取标准答案可作为无监督任务质量评估指标。6 结论本文提出MANTA业内首套可在任务推理阶段动态自适应多智能体协作拓扑的自演化框架。通过任务导向初始规划、轨迹故障审计、有界拓扑修复、跨任务记忆剧本四大核心模块实现在线调整智能体角色、通信网络、执行流程。五大基准大规模实验证明MANTA平均性能全面超越单智能体、静态多智能体、离线拓扑搜索三类基线消融实验验证初始规划、在线修复、长期记忆均为关键增益模块。未来拓展方向适配更大规模工业多智能体系统轻量化审计检测算子将拓扑自适应与LLM微调结合打通离线-在线完整自优化链路。7 参考文献完整文献列表见原arXiv网页此处省略附录A 完整工程复现细节A.1 公平对比约束所有多智能体方法统一智能体数量上限、推理算力静态拓扑全程固定不做任何运行修改AFlow/ADAS等离线框架严格遵循原文搜索流程匹配算力预算MANTA元智能体与任务智能体使用完全相同Gemma 4模型。A.2 MANTA全套超参配置参数项取值初始智能体最大数量5修复后总智能体上限10单次运行拓扑修改最大预算1次单次修改最多算子≤3基础交互模式单智能/星型/链式/辩论/投票元智能体采样温度0.0确定性输出长期剧本批量更新轮次12轮A.3 拓扑修改算子全集add_agent新增工作/评审角色智能体expand_agent_to_group单智能扩展为嵌套子组set_group_pattern切换分组交互模式add_edge/remove_edge增减点对点通信链路set_context_policy调整智能体信息可见范围。A.4 确定性流程异常审计分类工具级联报错、分支无产出、无证据判定任务不可解、证据丢失、过早共识、消息压缩丢失、检索覆盖不足、重复状态修改、无校验步骤、全盘放弃共11类硬规则故障。A.5 轨迹审计统计补充包含各基准审计精准率、修复后故障消除比例、各类算子使用频次、跨域迁移完整数值表。A.6 自动化设计框架横向对比AFlow/ADAS/AgentSquare/MASS均为任务前离线搜索固定拓扑MANTA独有运行时局部修复跨任务记忆是核心本质差异。A.7 四类元智能体完整Prompt模板A.7.1 拓扑规划器初始规划输入任务描述、长期剧本输出结构化JSON拓扑方案约束智能体总数、合法交互模式优先最小完备团队结构。A.7.2 拓扑规划器轨迹修复读取当前拓扑、审计故障输出至多3项修改算子仅针对性修复标记缺陷禁止无意义大规模重构。A.7.3 轨迹审计器开放集扫描完整执行数据包、工具日志识别确定性硬故障新型未定义流程缺陷每条故障附带原文证据引用输出修复建议。A.7.4 技能反思器批量读取多轮无标准答案流程日志重写长期拓扑剧本提炼通用任务-拓扑匹配经验不引入基准答案信息。A.8 任务智能体通用系统提示词统一规定输出JSON结构化工件、置信度打分规则、工具调用优先级、证据引用规范所有工作/评审智能体共用基础框架仅追加角色专属条款。A.9 长期拓扑规划剧本完整文档标准化Markdown格式固定三大章节通用基础原则、拓扑选择指南、历史任务经验由反思器批量迭代更新。A.10 智能体执行循环调度器实现确定性代码实现工具调用循环、重复调用拦截、失败断路器、强制最终答案兜底机制限制单轮工具迭代上限。A.11 拓扑变更下上下文管理所有对话、证据、数据包为全局追加只读存储拓扑仅修改可见权限规则不删除历史数据新增智能体自动分配可见上下文旧智能体产出永久保留用于后续合成。配套开源资源汇总论文在线原文https://arxiv.org/html/2607.28527v1实验复现环境Gemma 4 31B vLLM推理引擎五大基准数据集BrowseComp、StableToolBench、PlanCraft、WorkBench、MATH完整实现附录全部Prompt、算子代码、调度逻辑可直接复现实验开源许可CC BY 4.0允许商用、二次修改与分发结合全部7篇论文统一梳理大模型智能体完整演进趋势趋势1自优化层级持续向上拓展从文本走向系统拓扑早期仅优化输出、提示词、单智能角色最新MANTA将多智能体通信协作网络纳入推理时自适应对象优化层级提升至系统架构层面CS-RNR、MANTA共同证明智能体可在运行中修改自身执行架构而非仅修改内容。趋势2 单智能→分层多子智能体成为标准范式单任务拆解OmegaUse/SpecFirst/ORCA分专业子智能元控制分层MANTA规划/审计/反思三大元智能体管控业务集群博弈CS-RNR检测-建模-求解-校验四阶段流水线复杂长流程全部拆分为专用子模块固化中间产物缓解上下文衰减。趋势3 推理算力精细化权衡拒绝无脑扩张本地GUI智能体量化上下文/步数边际收益MANTA限制单次拓扑修改预算、管控Token开销所有框架设置资源上限追求收益-算力最优平衡点。趋势4 评测体系从二元成败→多维度细粒度失效分析统一拆解各类故障模式办公/代码/SRE/GUI/博弈/多智能体均建立细分错误分类MANTA通过轨迹审计量化流程缺陷不依赖标准答案即可评估协作质量。趋势5 在线自适应取代离线一次性优化旧范式任务前离线搜索固定架构、提示词新范式推理中实时监测故障、局部修复MANTA拓扑、CS-RNR风险校验、本地GUI动态上下文调整适配任务实时变化。趋势6 跨任务记忆沉淀成为标配MANTA长短双剧本、Reflexion类记忆框架统一落地不微调模型仅存储推理流程经验跨任务泛化优化方案大幅减少重复算力消耗。趋势7 自校验闭环全覆盖所有前沿框架内置独立审计/校验模块代码二进制测试、办公文件脚本校验、SRE根因审计、博弈风险证书、MANTA轨迹故障检测智能体生成后自动自查降低幻觉与结构性缺陷。