从长期记忆到自进化:EverMind让AI智能体正在走向下一阶段

热点 | 2026-08-10 10:24:08
时间:2026-08-10 10:24:08   /   来源: 天极网      /   点击数:()

如果说过去一段时间,AI发展的重点是让模型变得更强,那么接下来,一个更加值得关注的问题正在浮现:AI能不能在被使用的过程中不断积累经验,并进一步改变自己的能力?这也是“自进化AI”真正受到关注的原因。从长期记忆,到技能沉淀,再到脚手架和模型本身的持续优化,EverMind正在探索一条从“记住经验”走向“利用经验改变自身”的路径。自进化并不是简单地让AI“自己修改自己”,而是涉及Agent运行逻辑、技能管理以及模型训练等多个层面的系统性问题。

  在深入EverMind的技术细节之前,还需想清楚一件事:为什么“让AI自我进化”既是必答题,又是一道难题。

  传统大语言模型一旦完成训练并部署,能力就被冻结了,不再随使用而增长。可人类智能*迷人的地方恰恰相反——每一次交流、每一次思考,我们都在悄然进化。

  下一代AI也理应如此:能够通过持续学习不断变得更聪明,而不是停在出厂那一刻。

  而且这条路正在变得现实。

  随着大模型能力的跃升,越来越多的案例表明,“AI自主改进AI”已经从设想走向可行,在某些环节甚至开始超越人类专家。

  一旦AI能够稳定地自我改进,随之而来的很可能是一场生产力的跃迁。

  但要真正做到这一点并不容易。业界通常有三条路径,每一条都横着一道难关。

  脚手架(Harness)的自我改进,是*道关卡。

  一个Agent的实际表现,不仅取决于模型本身,更取决于包裹在模型外围的「脚手架」——提示词、注入的知识、运行时控制逻辑等。

  让模型自己修改这些代码看似简单,真正的难点却在于如何避免过拟合:模型自我生成的反馈往往充满噪声,一个看似有效的修改,可能只是针对特定测试集的过拟合,换个场景就会导致灾难性崩溃。

  技能(Skills)的规模化管理,是第二道关卡。

  当Agent把成功经验固化为可复用的技能文件,技能数量会爆炸式增长,那么如何管理这些碎片化、冗余、质量参差不齐的技能?又如何在一个数十万量级的技能库中,精准检索出当前任务真正需要的那几个?

  这类工程问题长期被学术界忽视,却恰恰是产品能否落地的关键。

  模型权重(Weights)的训练信号分配,是第三道关卡。

  在*底层的模型训练阶段,同策略自我蒸馏(On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段。

  但传统OPSD在处理长序列推理时,会把相同的监督权重均匀分配给每一个生成步骤,完全忽略了错误发生的时序上下文。这就像长跑时,无论你在起跑摔倒还是在终点前摔倒,教练的惩罚都一模一样。

  如此粗颗粒度的信号分配,严重拖累了模型的学习效率。

  EverMind的三篇论文,正是分别瞄准这三道难关,各自给出了严谨的解法。

  HarnessBank:让Agent学会安全改写「脚手架」

  在实际部署中,模型权重往往是冻结的,修改Agent外围的Harness成为了提升性能的*直接手段。

  EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》一文中,提出了一套全新的框架:

  它能够让Agent自主诊断失败并重写自己的运行逻辑,同时从根本上解决了自我改进中的过拟合问题。

  这套框架的核心创新在于将“提出变更”与“归因变更”彻底分离。

  在过去的研究中,模型既当运动员又当裁判,自己写代码自己评估,极易产生幻觉式的性能提升。

  而在EverMind的方案中,语言模型只负责诊断失败原因并提出补丁(Patch),所有的采样、测量和显著性检验全部交由确定性的代码逻辑来控制。

  这一设计确保了每一个被系统认可的性能提升,在统计意义上都是绝对可靠的,而非测量误差或随机波动。

  更有创新性的是其引入的装备基因库(Harness Gene Bank, HGB)机制。

  传统的自进化系统往往以“任务”为键(Key)来存储改进,这极易导致系统只学会了如何解决特定的几道题,换一个场景便原形毕露。

  EverMind则将每一份高性能脚手架以“WHERE × WHY”(改动作用在哪个环节、又是为何被引入)作为语义坐标存档,并支持通过故障诊断进行“重新发明”,或跨单元进行“机制重组”,防止搜索过程陷入崩溃或原地打转。

  这种设计引入了强大的抗过拟合归纳偏置——系统学到的不是“如何解决这道题”,而是“如何修复这类病理”。

  为了从大量候选后代脚手架中高效挑出真正有效的改进,团队还设计了分级装备筛选(Gated Harness Screening)机制,用有效性、激活、配对显著性、增益四道顺序闸门层层过滤,兼顾了评估成本与结果的可信度。

  实验结果证明了这一设计的有效性。

  团队默认以Qwen3.6-27B作为任务Agent、Claude Opus 4.8作为进化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七个多样化基准上评测,并与GEPA、DGM(Darwin Gödel Machine)两种当前*先进的自进化方法对比。

  结果显示,在冻结任务Agent权重的情况下,HarnessBank在全部七个基准上取得了5.1%到15.4%的一致性能提升。

  同时所有增益均通过了配对显著性检验(z≥1.96),证明这些提升在统计意义上绝对可靠,而非测量误差或随机波动。

  论文中还有一个极具启发性的发现:

  跨模型实验证实,这些性能提升来自模型特异性的自进化过程,而不是存在某个放之四海而皆准的“万能脚手架”。

  获胜的补丁追踪的是模型的主导“病理”,而不是模型的大小或家族。

  也就是说,当你更换一个不同的基础模型时,主导病理会改变,对应的*优脚手架也会随之改变;但同样的病理-补丁匹配关系,会在不同的模型家族中重复出现。

  这意味着,EverMind构建的这套“诊断-归因”循环机制,是一种可以跨模型迁移的元能力,证明了AI for AI的技术可行性。

  SkillCorpus:10万技能库背后的工程与科学

  如果说Harness的自进化赋予了Agent重写逻辑的能力,那么“技能”(Skills)则是Agent沉淀经验的具体载体。

  在EverMind的Raven框架中,内置了高达10万项开箱即用的技能。

  这并非简单的数量堆砌,其背后的工程与科学支撑,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》。

  随着开源社区中技能文件(如Skill.md格式)的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均。

  EverMind团队构建了一个名为SkillCorpus的框架,首次在规模化层面上对开放技能生态进行了聚合、策展、匹配和评估。

  这个过程堪称一场浩大的数字淘金。

  团队从爬取的大约82.1万个原始技能中,通过多阶段多维度策略过滤,*终精选出96401个高质量技能。

  为了管理这些技能,他们建立了一个包含16个类别的分类法,并从实用性(Utility)、鲁棒性(Robustness)和安全性(Safety)三个维度进行了严格的质量控制。

  仅仅有库还不够,关键在于检索。

  EverMind配合这个庞大的语料库,微调了一套专门的检索与选择技术栈,确保Agent在执行任务时能够精准匹配到相关的技能。

  SkillsBench、GDPVal和QwenClawBench三个基准测试中的端到端评估显示,自研的Raven Harness集成SkillCorpus后,Agent在所有基准上均获得了稳定的性能提升,其中在SkillsBench上的提升*大,达到了7.5个百分点。

  通过深入的运营分析,团队还识别出了技能带来的增益边界——

  覆盖边界(技能库是否覆盖了任务所需的知识)和Harness边界(Agent的脚手架是否能有效调用技能),这为未来如何进一步优化技能检索和应用指明了方向。

  这篇论文不仅是对Raven 10万技能库的技术解密,更是业界*关于“经过策展和检索服务的社区技能库如何在真实Agent任务中发挥作用”的端到端系统性研究。

  更进一步,技能并非一入库就固定不变。

  无论是人工编写的技能,还是AI自动生成的技能,EverOS都能依据任务执行的成败经验对其持续打磨。

  用得好的被强化、被复用,用得差的被修正、被淘汰。

  技能库因此不是一份静态清单,而是一个随任务不断自我进化、越用越强的资产,这也正是技能沉淀归属于任务层的原因所在。

  DASH:让模型看清哪里出了错

  自进化的*深层,是模型权重的自我迭代。

  EverMind的*新论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》,展示了其在底层算法上的深厚功底。

  传统的同策略自我蒸馏(OPSD)存在一个致命的时间盲区:

  它对所有局部散度(即学生与教师的差异)分配相同的系数,完全忽略了错误发生的时间顺序和上下文。

  EverMind的研究团队通过对大量真实推理轨迹的分析,发现了一个关键现象:在一个推理序列中,局部散度值的大小与未来散度的演变之间,存在极弱的关联。

  这意味着,用同一个系数来处理所有时间步的散度,本质上是在用一把尺子量所有不同形状的错误,必然导致监督信号的严重失真。

  为了解决这一问题,EverMind提出了DASH(Divergence-Adaptive Supervision Horizons)。

  DASH的核心思想是将每个局部蒸馏信号与序列级均值之间的差距,转化为一个自适应的传播门(Propagation Gate),然后利用这些门控制向后的多步聚合。

  当一个时间步的局部散度高于序列均值时,说明这里是一个高风险分叉点,DASH会打开一个更大的传播门,让这个时间步的监督信号向前传播更远;反之,传播门收窄,避免无关紧要的步骤干扰整体学习。

  实验结果令人印象深刻。

  在AIME 2024、AIME 2025和HMMT 2025三个极具挑战性的数学推理基准上,DASH在Qwen3-1.7B、Qwen3-4B和Qwen3-8B三个模型规模上均取得了所有对比方法中的*高分。

  在Qwen3-1.7B上,DASH将三个基准的平均得分从vanilla OPSD的41.87提升至45.07;在Qwen3-8B上,从65.00提升至66.40。

  更重要的是,DASH不需要引入任何额外的教师或学生前向传递开销,这意味着这种性能提升几乎是免费的。

  EverMind的自进化框架全景

  EverMind的自进化之路(四层框架)

  在长期记忆领域已经贡献了数篇ACL、KDD等顶会高质量论文,并取得开源库1.8万star后,EverMind继续分享对自进化演进的研究成果——

  将自进化的完整路径,概括为一个从任务层到元改进层的四层递进体系。

  上述三篇论文构成的技术栈,与EverMind内部的产品和研究框架之间,存在着精密的映射关系:

  1、任务层:

  任务层是*直接的进化层次,进化在单次任务中即时发生。

  优化对象是单次任务的执行质量,既包括记忆的提取与回写,也包括技能(Skills)的即时沉淀与复用;经验来源是 Context、Trace 与用户反馈,更新动作是即时回写,验证方式是结果与反馈。

  这一层的能力复利是“记得更牢、用得更顺、单次任务做得更好”,价值定位是沉淀任务级、可复用的记忆与技能资产。

  这正是EverOS与SkillCorpus所覆盖的核心场景。

  2、脚手架层:

  脚手架层(Harness)优化对象是Code与Policy,即Agent外围的运行逻辑与控制策略;经验来源是Eval与Reflection,更新动作是脚手架的版本迭代,验证方式是Agent Evals复盘。

  这一层的能力复利是“更会执行”,价值定位是可复用行为资产的持续积累。

  这正是Raven框架与Self-Evolving Harness论文所对应的工作。

  3、模型层:

  模型层优化对象是模型本身,经验来源是高价值轨迹、偏好与失败样本,更新动作是LoRA与端侧模型的验证后灰度,验证方式是离线集加灰度测试。

  这一层的能力复利是“更准、更省”,价值定位是个性化的专属模型能力。DASH论文正是这一层的核心算法支撑。

  4、元改进层:

  元改进层是整个框架*令人兴奋的顶层。

  优化对象是Evaluator、Data与Training Recipe本身,经验来源是多轮实验与Benchmark,更新动作是优化“提出—选择—验证”的整个循环,验证方式是版本门槛加评测体系。

  这一层的能力复利是“下一轮进化更快、更可靠”,价值定位是让改进能力本身也持续升级。

  这个四层框架的深刻之处在于,它把自进化拆成了四个层层递进又彼此支撑的环节,并为每一层都配备了具体的技术路径与验证机制。

  它不是一张空洞的愿景图,而是一个有工程细节、有学术支撑的完整路线图。

  其实在今年4月,团队就率先提出了针对Agent自进化的评测基准EvoAgentBench,当月在Hugging Face同类benchmark上下载量*。

  这是一套用于衡量智能体从既往执行中提取并迁移能力效果的评测方法,为技能沉淀、脚手架迭代和模型优化提供统一、可比较的验证框架。

  结合三篇论文从技术、脚手架到模型权重的系统性探索,EverMind已将自进化能力建设由方法研究延伸至评测体系,形成更完整的技术闭环。

  对比海外坐标系,EverMind走到了哪一步?

  要理解EverMind这套完整技术栈的*性,我们不妨将目光投向海外那些估值令人咋舌的NeoLab。

  Recursive Superintelligence(RSI)提出了宏大的“自动化AI研究闭环”理念,并拿到了6.5亿美元融资和AWS的4.1亿美元算力合作协议。

  其*阶段目标是训练一个具备“5万名博士”能力的系统来自动化AI科学研究本身。

  然而,RSI目前仍处于纯研发阶段,尚无成型的产品或框架落地,其公开结果仅限于在GPU内核算法优化基准上超越了人类两年的优化记录。

  Engram以6亿美元估值完成了9800万美元A轮融资,其核心技术是基于稀疏记忆模块的参数化权重记忆(如LoRA微调)。

  Engram在降低推理成本和解决灾难性遗忘方面做出了出色工作,但其路径过于依赖底层权重的更新,缺乏在Agent脚手架(Harness)和外部技能库层面的灵活进化机制,且需要白盒访问模型权重,这在实际部署中是一个重大限制。

  Adaption Labs(估值10亿美元)主攻无梯度推理时适应,试图通过动态解码和适配器组合来消除微调和提示词工程。

  这在思路上与EverMind的Harness自进化有相似之处,但Adaption Labs缺乏如SkillCorpus这样庞大且经过策展的外部经验沉淀体系,也没有在底层训练算法上进行深度优化。

  Core Automation(估值目标40亿美元)由前OpenAI研究副总裁Jerry Tworek创立,其旗舰项目Ceres专注于持续学习模型,目标是将训练数据需求降低100倍。

  这是与EverMind方向*为接近的项目,但Core Automation目前仍在早期研发阶段,缺乏EverMind这样完整的技术栈和开源生态。

  相比之下,EverMind的独特之处在于其**“三层并发”**的战略纵深。

  它没有陷入「参数化记忆」与「非参数化记忆」的非此即彼的争论,而是通过EverOS(非参数化长期记忆)、Raven(Harness自进化)和DASH(底层权重训练优化)构建了一个全栈生态。

  更重要的是,EverMind坚持开源优先,通过在GitHub上积累的超过1.2万颗Star(同期mem0为7千),正在迅速建立起类似Android的底层开发者生态护城河。

  从长期记忆到自进化,真正值得关注的并不是某一项单独的技术,而是记忆、技能、脚手架与模型优化之间逐渐形成的连接:记忆让AI保留过去,技能让经验得到复用,脚手架让Agent能够调整运行方式,模型层优化则推动能力本身持续变化。当这些环节形成完整连接,AI智能体也将从单纯完成任务的工具,走向持续积累、持续调整和持续提升。或许,这正是EverMind三篇论文所探索的方向——AI的下一阶段,不只是变得更强,而是在使用和学习中不断成为更好的自己。


标签:

最近更新