)
如今能像人类一样操作电脑、点击网页、完成办公任务的计算机操作智能体Computer-Use AgentCUA正在快速落地。为了让AI越用越高效业界普遍采用Skill Learning的思路让AI从成功的操作记录里提炼可复用的套路就像把重复步骤封装成快捷键下次遇到同类任务直接调用。但这个方法有一个致命假设它们默认“成功完成任务操作步骤 好Skill”。针对这一痛点来自浙江大学的研究团队在2026年6月发表论文《SkillHarness: Harnessing Safe Skills for Computer-Use Agents》提出了一种名为SkillHarness的新框架。该框架的核心理念是让AI不仅能从成功中学习“做什么”更要从失败和风险中学习“何时做”和“何时不做”。文末附下载一、现有方法的两个短板当前主流的Skill学习方法本质都是从成功的操作轨迹里提取代码化的技能。这套思路在稳定环境里很好用但放到动态、有风险的真实场景中会暴露出两个核心问题。监督偏差只看结果不看过程安全绝大多数方法默认只要任务最终做成了中间的操作就是对的、值得学习的。但现实中很多成功只是巧合比如刚好绕过了权限校验、刚好利用了临时的页面漏洞、刚好没触发安全规则。这种巧合的成功经验一旦被封装成可复用的Skill后续每次调用都会重复不安全的操作。论文将这种现象称为监督偏差只以成败论英雄却忽略了过程的安全质量。执行僵化死板的代码复用大多数学出来的Skill都是固定的操作代码一旦环境发生变化比如网页改版、按钮挪了位置、突然弹出一个窗口等Skill就会直接失效。更危险的是它不会判断当前能不能执行只会机械地按脚本走遇到弹窗、恶意提示很容易被带偏产生不可控的后果。论文称之为脆弱的执行Skill无法适应环境的变化执行稳定性很差。说白了现有AI只学到了做什么know-what没学到怎么做才安全、什么场景不能用know-how。人类掌握一项Skill时恰恰相反不光从成功里总结经验还会从失败里踩坑、从风险里立规矩清楚同一个操作在不同场景下效果不同该收手的时候就收手。SkillHarness正是借鉴了人类的学习逻辑这个名称可以理解为Skill技能加Harness缰绳给AI的强大能力套上一根安全缰绳让它在高效完成任务的同时不会失控。二、SkillHarness的核心设计SkillHarness的核心目标是把Skill从写死的操作脚本变成带约束的交互能力。它的设计围绕两个核心思路展开一是把高层意图和底层操作拆开解决环境变化的脆弱性二是用多源信号构建Skill边界解决学习过程的安全隐患。两层解耦传统Skill要么是纯自然语言描述太灵活不好控制要么是纯代码片段太死板不抗变化。SkillHarness把技能拆成宏观技能Macro Skill 微观技能Micro Skill两层各司其职。宏观技能Skill的大脑管目标和边界宏观技能对应一个完整的业务意图除操作步骤外还包含三部分关键信息成功模式正常情况下怎么做、做到什么状态算完成失败教训哪些坑容易踩、踩了之后怎么补救风险防护执行前必须满足的安全条件比如不可逆操作前必须征得用户明确同意。宏观技能定义了Skill的适用边界是安全的第一道闸门。微观技能Skill的手脚管具体执行微观技能对应原子化的操作比如“点击提交按钮”“填写输入框”。它不是写死的代码而是带占位符的参数化模板不会写死“点击idsave的按钮”而是写成“点击{{保存按钮}}”运行时再根据当前页面的真实元素自动匹配。如果页面变化太大、模板匹配不上它还能自动降级成语义指导让大模型根据文字描述灵活操作不会直接卡死。这样的解耦设计将“做什么”和“具体怎么操作”分离开来优势非常明显界面改版了只需要调整微观技能的模板宏观技能的目标和安全规则不受影响遇到风险场景直接在宏观层面拦住根本不会走到执行步骤。多源学习SkillHarness的学习过程不是被动喂现成的成功案例而是让智能体自主在环境里探索从每一次交互的三种结果里提炼知识共同构成完整的技能边界。从成功里提炼有效路径做对的任务里不光提取操作步骤还提取完成标志。比如创建项目不能只学到点提交按钮还要学到页面出现创建成功提示才算真正完成避免点了按钮就误以为任务结束。从失败里总结避坑经验做错的任务不会被直接丢掉而是用来总结经验比如“搜索无结果时不要乱点第一个条目”“表单提交失败先检查必填项”。这些教训会被放进宏观技能里下次遇到类似场景就会主动规避不会重复踩坑。从风险里固化安全规则交互中触发的安全违规、检测到的风险点会被提炼成风险防护规则变成Skill启动的前置条件。比如“提交数据前必须确认用户已授权”“不能把隐私信息填到公开输入框”不满足这些条件对应的Skill就会被直接禁用。每次探索结束后系统都会做一次判断这次的经验是不是已有Skill没覆盖的新知识需不需要补充进去它不追求技能库越堆越大而是追求每个Skill都边界清晰、安全可靠。选择性复用学完Skill之后使用环节也不是无脑调用。SkillHarness采用选择性复用机制每一步都做安全校验。检索匹配根据当前任务从技能库里语义匹配相关的宏观技能边界校验规划器对照宏观技能里的风险规则检查当前环境是否满足条件。不满足就直接禁用对应的微观技能绝不硬执行分级执行满足条件时优先用微观技能的代码模板速度快、结果确定模板匹配失败时自动降级为大模型语义执行保证环境变化也能继续推进主动熔断如果同一个技能连续多次执行失败系统会主动停用模板完全交给大模型灵活处理避免机械重复错误、越陷越深。三、实验数据效果如何研究团队在业界主流基准测试上做了全面实验对比了ASI、SkillWeaver等代表性方法结果非常直观。学出来的技能更安全在专门测安全合规的ST-WebAgentBench基准上传统方法ASI学出的技能75%都存在安全违规SkillWeaver的不安全技能比例也有43.6%SkillHarness的不安全技能比例仅为2.2%整体不安全率降低了57.1%。这意味着原来学100个Skill有七八十个带坑现在几乎每个Skill都符合安全规范。核心原因就是它从学习阶段就把风险信号融入了Skill而不是学完再事后过滤。环境变化下更稳定在OpenApps基准的干扰测试中研究人员给页面加了弹窗、恶意文案、误导性标签等多种扰动测试Skill的完成率无干扰时两者表现差不多说明SkillHarness没有为了安全牺牲基础执行效率随着干扰强度增加传统方法的Skill完成率断崖式下跌混合干扰下只剩50%左右SkillHarness始终保持80%以上的完成率抗扰动能力显著更强。这背后就是宏微分离的功劳局部界面变化不会让整个Skill废掉大不了降级成语义执行总比直接卡死强。安全不挑模型大小一个很有意思的发现是SkillHarness的安全效果几乎不依赖模型强弱。哪怕是参数很小的开源模型虽然任务成功率不高但也很少违反安全规则。这说明技能边界是实实在在的结构化约束不是靠大模型的推理能力硬撑的弱模型哪怕做不成事也不会闯祸。这对低成本部署安全智能体非常有价值。消融实验也验证了去掉技能边界之后攻击成功率直接上升9.6个百分点是对性能影响最大的部件证明多源监督的安全设计确实是框架的核心。四、小结SkillHarness最核心的贡献**是把安全从Skill使用时的事后补丁变成了贯穿学习、演化、复用全流程的内置属性。**它打破了“成功即正确”的行业惯性证明了让AI从失败和风险中学习才能得到真正能落地的可靠Skill。当然它也还有待完善的地方比如智能体自主探索出来的技能有时过于细分复用性不够Skill粒度太粗会丢失约束太细又会失去灵活性这个平衡还需要进一步优化防护能力终究受限于训练见过的风险场景面对全新的攻击方式仍然可能被绕过。但整体来看SkillHarness给CUA的技能学习指出了一个非常务实的方向比起一味堆砌Skill数量先搞清楚每个Skill的安全边界和适用范围才是让AI真正走进真实工作环境的关键。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】