
让 AI自己改自己的 Agent Harness滨州pvc管道管件胶 ,这事已经被顶 Agent 社区注意到了。
上海人工智能实验室团队提出的 Self-Harness,近期被LangChain CEO、联创始人 Harrison Chase转发,也被前 OpenAI 总裁 Lilian Weng收进自进化 Agent 相关博客。
它盯上的不是换模型,而是 Agent 外层那套 Harness。
做法很直接。模型先检查自己的运行轨迹,从失败里挖出模式,再提出有边界的 Harness 修改,后交给回归测试决定要不要采纳。
实验结果显示,在 Terminal-Bench-2.0 上,底层模型、工具环境和评测协议都保持不变,只改 Harness,三个模型后端都拿到了 held-out 提升。
其中 Qwen3.5-35B-A3B 总提升达到104,MiniMax M2.5 和 GLM-5 分别提升28和24。
论文和项目已经公开,文末附链接。
△LangChain CEO/co-founder Harrison Chase 转发 Self-Harness 让 Harness 自己进化
Agent Harness 可以理解为包在模型外层的套运行装置,覆盖系统提示词、工具使用规则、验证器、运行时控制策略和轻量 middleware。
在多轮工具任务里,它决定 Agent 怎么调用工具,什么时候停,失败后怎么恢复,产物又该如何验证。
过去,这套东西主要靠工程师手调。要读大量执行轨迹,找失败原因,改提示词或工具规则,再反复跑 benchmark。
模型越多、任务越杂,Harness 就越难继续按"模型套人工调参"的式扩展。
△三种 Harness 改进范式:人工改、强模型外援改滨州pvc管道管件胶 ,以及 Self-Harness 让模型基于自身轨迹改 Self-Harness 怎么工作
换到 Self-Harness,流程被压成三步。先挖弱点,再提改法,后跑回归。
Weakness Mining:从失败轨迹挖弱点
系统先让当前 Harness 驱动固定模型完成批任务,记录完整执行轨迹、工具调用和评测结果。
失败样本不会被当成孤例处理。Self-Harness 会结验证器反馈、Agent 行为和失败之间的因果关系,把可复用的失败机制聚起来。
这样,"某个任务没过"会变成"这类失败可能来自同种 Harness 缺陷"。比如缺少终产物、重复执行命令、工具报错后不恢复,或者探索太久却迟迟不进入实现。
Harness Proposal:提有边界的改法
拿到结构化失败证据后,同个模型会切换成 proposer,针对已挖出的失败机制提出候选 Harness edit。
这些 edit 只能落在预先声明的可编辑表面上,不能把整个 Agent 控制架构倒重来。
每个提案都要说明想改变哪种行为,可能带来什么回归风险,以及为什么可能修好当前失败模式。
Proposal Validation:用回归测试拍板
候选 Harness 会在同评测协议下重跑,并和当前 Harness 对比。
接受规则很保守。held-in 或 held-out 至少个 split 要提升,另个 split 不能退化,才会进入下代 Harness。
这也是它和普通"自动改 prompt "的差别。Self-Harness 不让模型凭感觉拍板,而是把每次改动都放进可记录、可复现、可回退的评测闭环里。
△Self-Harness 自改进闭环,包括弱点挖掘、修改提案和回归验证不换模型,只改外层也能涨
论文在 Terminal-Bench-2.0 上做了系统评测。
Terminal-Bench-2.0 是个多轮智能体 benchmark,任务运行在容器化终端环境中,覆盖文件管理、命令执行、错误恢复、产物验证等真实工具使用能力。
在固定模型、工具集、任务环境和评测配置的前提下,Self-Harness 只改 Harness。结果三个模型都出现提升。
MiniMax M2.5 总提升28,Qwen3.5-35B-A3B 总提升104,GLM-5 总提升24。
这组结果的不是又换了个强模型,保温护角专用胶而是在同个模型外面,Harness 本身也可以被搜索、验证和迭代。
△Terminal-Bench-2.0 结果,三个模型后端在 Self-Harness 后均获得 held-out 提升
重要的是,每个候选修改都经过 held-in 和 held-out 回归测试。
换句话说,Self-Harness 不是堆长的提示词,而是在次次验证门控后,只留下真的带来收益、又没有明显回退的 Harness edits。
△Qwen3.5 Self-Harness 进化路线,通过多轮验证门控保留有 edits 不同模型暴露出不同弱点
Self-Harness 的另个观察像工程现场。不同模型不是同种失败。
MiniMax M2.5:找到线索后迟迟不交付滨州pvc管道管件胶
在初始 Harness 下,MiniMax M2.5 有时会持续探索数据集。即使已经找到关键元信息,也迟迟不创建评测所需的答案文件,后因为缺少产物或时失败。
Self-Harness 保留的修改会鼓励 Agent 早识别需输出,先创建初始产物,并在工具调用过长时转向具体实现和验证。
Qwen3.5-35B-A3B:工具失败后容易陷入循环
Qwen3.5-35B-A3B 的常见问题,是工具失败后进入重复编辑、重复覆盖或重复命令循环,甚至在停止前删除评测需文件。
Self-Harness 为它引入依赖预检查、失败后产物恢复、避相同命令重试,以及由工具错误触发的 artifact-focused 提醒。
△Qwen3.5 保留下来的 code-level Harness edits,集中在依赖预检查、产物恢复和重试约束。GLM-5:需要管住 shell 状态和节奏
GLM-5 暴露出的弱点集中在 shell 会话状态,以及从探索切到实现的时机。
改进后的 Harness 会提醒 Agent 在修改环境变量、安装工具或调整路径后,确认这些变化能跨命令持续可用。当长时间探索还没有形成产物时,系统也会动它转向实现与测试。
这说明 Self-Harness 不只是给所有模型加段通用提示。它会根据每个模型在真实轨迹中暴露出的弱点,生成并筛选适它的 Harness 改动。
为什么会引起关注
Agent 越来越像跑在工具环境里的系统,而不是只回答单轮问题的模型。
在这种设定里,模型能力只是部分。外层 Harness 决定它是否知道何时调用工具,如何从错误中恢复,是否保留正确产物,退出前有没有做验证。
过去,Harness 工程像经验活。Self-Harness 给出的向是,让模型自己参与这套经验的挖掘和改写,但终仍由评测而不是自评来拍板。
它没有证明" Agent 可以自己进化",也没有绕过 benchmark 范围。论文里的结果主要来自 Terminal-Bench-2.0 和固定模型后端。
但作为个自进化 Agent 的组件,它给出了比较清楚的边界:改什么,怎么改,怎么验,什么时候拒。
研究团队
该工作来自上海人工智能实验室团队,论文题为 Self-Harness: Harnesses That Improve Themselves。
从现有文档看,团队公开了论文和项目地址,读者可以查看具体实验设置、Harness edits 和代码。
论文:https://arxiv.org/abs/2606.09498
项目地址:https://github.com/qzzqzzb/Self-Harness
键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系式。
� � 我们会 ( 尽量 ) 及时回复你 : )
� � 点亮星标 � �
科技前沿进展每日见相关词条:管道保温施工 塑料挤出设备 预应力钢绞线 玻璃棉厂家 保温护角专用胶
奥力斯 pvc管道管件胶批发 联系人:王经理 手机:15226765735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》滨州pvc管道管件胶 ,以此来变相勒索商家索要赔偿的违法恶意行为。




