Recuris智能体架构推出:无需训练实现多模型长程任务性能提升

Recuris智能体架构推出:无需训练实现多模型长程任务性能提升

财π新闻 由新加坡国立大学、普林斯顿大学、斯坦福大学、牛津大学的研究团队联合开发的智能体架构Recuris正式推出,这是全球范围内首个将递归自我改进机制应用在记忆控制层内的智能体架构,该架构无需对模型进行任何训练操作,即可实现从参数规模仅为3B的小模型,到Claude Opus 5、GPT-5.6-Sol等当前前沿大模型的全面性能提升,为长程任务场景下的智能体能力升级提供了全新的实现路径。

长期以来,长程任务场景下的智能体运行始终面临诸多难以突破的瓶颈,随着任务交互轮次的不断增加,智能体需要处理的对话历史信息会持续膨胀,已完成的操作步骤、过期的冗余信息、尚未解决的核心目标以及各类执行过程中产生的噪声信息相互混杂,很容易导致智能体对当前所处的任务状态产生误判,进而出现技能调用错位的问题,甚至在部分场景下会直接误以为任务已经全部完成,提前终止后续执行流程。传统的记忆处理方法大多直接依托不断膨胀的对话历史开展记忆注入或检索操作,在长程任务推进过程中极易生成各类幻觉内容,无法保障执行过程的准确性与稳定性;同时这类方法在记忆迭代环节,往往仅从单次任务的最终成败结果出发,对整个记忆体系进行重写调整,无法精准定位到产生问题的具体组件,更新操作普遍呈现粗粒度特征,缺乏足够的针对性,面对长程任务中不断拉长的推理轨迹,持续增长的上下文长度也会进一步加大智能体的分析难度,很难从中筛选出最有效的改进策略。Recuris的出现,从根本层面重构了智能体记忆处理的底层逻辑,与既有记忆方法形成了清晰的范式差异,这种差异集中体现在记忆使用和记忆迭代两个核心维度上。在记忆使用维度,Recuris不再依托完整的对话历史开展相关操作,而是在具体的执行事件节点上直接取用适配的技能,同时设置专门的检查器模块,将环境返回的各类反馈信息转化为经过严格验证的状态更新内容,完全避免了智能体仅凭对话历史中诸如“已完成”这类表述就直接判定任务进展的情况,从源头减少了幻觉生成的可能性。在记忆迭代维度,Recuris会主动读取完整的结构化执行轨迹,将任务推进过程中出现的失败精准定位到具体的组件层面,仅对引发问题的对应组件进行针对性修改,而非对整个记忆体系进行无差别重写,所有完成修改的内容还必须通过验证集的门控校验,确认不会对原有正常功能造成负面影响之后,才会被系统正式接纳为有效更新内容,从机制层面保障了记忆迭代过程的安全性与有效性。

Recuris的整体架构依托三项相互支撑的核心技术构建而成,每一项技术都针对长程智能体运行的核心痛点设计,共同构成了完整的递归自我改进闭环体系。第一项核心技术是经验记忆与工作记忆的深度耦合,在这套耦合机制下,工作记忆模块会持续不间断地追踪智能体当前的任务进展情况,以及所有尚未得到解决的目标内容,基于动态更新的实时任务状态,从经验记忆库中筛选出最适配当前场景的技能进行调用,在技能执行完成后,系统会结合环境返回的真实反馈信息,对任务实际推进的进展情况进行验证,确认进展真实有效之后再对工作记忆中的状态内容进行更新,整个流程形成一个完全闭合的执行闭环,所有操作都紧密锚定真实的任务推进情况,不会出现脱离实际执行状态的判断偏差。第二项核心技术是结构化轨迹与组件级失败定位,Recuris会将任务状态、调用的技能、执行的具体动作以及环境返回的观测结果全部显式串联起来,把智能体的整个执行过程直接转化为可追溯、可核查的结构化证据,彻底改变了过往执行过程信息零散、难以回溯的状况,研究团队还通过主动向记忆体系中注入已知故障的方式,验证了这套机制的定位准确性,固定的裁判模块可以从多维度的结构化证据中精准判断出出现问题的具体组件,让后续的局部修补操作具备了可落地的基础,无需对整个系统进行大范围调整就能完成问题修复。第三项核心技术是有界的验证门控递归演化,这套机制由专门的Meta-Agent模块负责运行,当智能体执行任务出现失败情况时,Meta-Agent会对整个执行轨迹进行全面诊断,将失败的根本原因精准归因到对应的具体组件上,随后生成针对性的修改补丁对该组件进行调整,所有生成的补丁内容都必须先后通过目标任务的验证测试,以及留出集的回退校验,确认补丁不仅能够解决当前的失败问题,同时不会导致原有已经正常运行的功能出现性能回退,满足全部校验条件的补丁才能正式进入系统,成为记忆体系的一部分,这套有边界的递归演化机制,完全避免了无限制递归可能带来的系统不稳定问题,保障整个自我改进过程始终处于可控、可验证的范围内。

为了全面验证Recuris的实际性能表现,研究团队选取了四个长程基准测试集,分别为τ²-Retail、τ²-Airline、SkillFlow、Terminal-Bench 2.1,同时覆盖十个不同参数规模的模型开展系统性评测,从参数规模仅为3B的开源小模型,到Claude Opus 5、GPT-5.6-Sol这类当前最前沿的大模型,全部纳入评测范围,最终在37组完成的模型与基准的组合中,有35组的任务成功率都实现了显著提升。其中在τ²-Retail基准测试中,GPT-5.6-Sol的任务成功率从原本的58.3%提升至76.1%,提升幅度达到17.8个百分点,Claude Opus 5的任务成功率则从72.4%提升至87.9%,提升幅度达到15.6个百分点;在SkillFlow基准测试中,Qwen3.6-27B的任务成功率提升了16.6个百分点,Qwen3.6-35B的任务成功率提升了13.5个百分点。针对长程能力评价过程中普遍存在的“任务变长”与“智能体提前放弃”两个因素相互混淆的问题,研究团队按照任务本身完成所需的固有轮次数量,将τ²-Retail基准下的所有任务划分为四个长度分位,分别开展针对性评测,最终结果显示,Recuris的性能优势完全不会随着任务长度的增加而出现衰减,在任务固有长度的四个分位上,Recuris的表现全部领先基线水平17.0至44.7分,性能优势不会随着交互轮次的增加而出现单调下滑的情况,反而在最长周期的任务中,性能提升幅度进一步扩大,最高达到32.2个百分点,同时长程执行过程中常见的各类失败模式的发生率,最高可以降低80%,充分验证了Recuris在长程任务场景下的可靠性与稳定性。

除了在单一场景下的性能提升表现之外,Recuris通过递归演化生成的记忆内容还具备极强的跨场景迁移能力,这种迁移能力体现在跨任务和跨模型两个不同的维度上。在跨任务迁移维度,研究团队从16个失败任务中蒸馏提取出对应的记忆内容,将这些记忆内容应用到86个完全没有参与过演化过程的全新任务中,最终评测结果显示,这些蒸馏得到的记忆内容可以为全新任务的表现带来9.01至17.44的性能提升,无需针对新任务重新开展复杂的调整操作,就能直接将过往任务中积累的经验迁移复用,大幅降低了新任务的适配成本。在跨模型迁移维度,研究团队仅在某一个部署模型上完成一次完整的记忆演化流程,将最终得到的演化记忆内容原封不动地直接交付给完全没有参与过之前演化过程的其他前沿模型使用,不需要针对新模型进行任何额外的适配调整,这些前沿模型的表现也能产生明显的性能提升,这种特性打破了过往不同模型之间经验无法互通的壁垒,让一次演化得到的成果可以在不同规模、不同类型的模型体系中实现共享复用,大幅拓展了递归自我改进成果的适用范围。

(编辑:付健)