18个顶尖AI模型断网自主科研实验:Fable 5闭合八成人类纪录差距
王俊勇 2026-08-17 14:38
财π新闻 Prime Intellect公开了迄今规模最大的前沿AI自主科研实验,将18个顶尖大模型在断网沙盒中关8天进行153场完全自主实验,挑战nanoGPT优化器速通。模型Fable 5一骑绝尘,以2726步的成绩追平了人类最高纪录水平的82%,标志着AI正从科研辅助迈向自主发现。
本次实验的规则设置极其严苛,全程划定了明确的操作边界,所有参与测试的大模型仅被允许调整优化器、学习率调度和初始化相关内容,不得改动模型架构,也不能触碰训练数据,核心目标是用最少的步数把GPT训练到验证损失3.28。作为参照基准,人类在该赛道上创下的最高纪录为2600步,所有参与实验的AI模型的统一起点为3290步。为了彻底排除随机运气对实验结果的干扰,本次实验设置了极高的验证门槛,要求所有提交的有效方案必须在8个固定种子上完成运行,且最终得到的验证损失均值低于3.27859,经测算,仅靠随机运气蒙过该验证门槛的概率仅为千分之一,这一设置从根源上保证了所有模型取得的成绩都来自真实的科研探索能力,而非偶然的随机波动。
在整个实验推进的过程中,不同模型之间的表现差距逐步拉开,而造成这一差距的核心因素并非模型提出全新算法的创新能力,而是模型开展实验的实操手法。表现优异的强模型普遍擅长多种子验证工作,不会仅凭单次实验的结果就判定某个方向的优劣,同时还会针对此前测试过的方案开展回头重测工作,甚至能够主动发现并整合那些单独测试时效果一般,但组合到一起之后能够产生更优效果的参数组合。所有参与本次实验的模型,都在自主探索的过程中自行开发了专属的实验驱动器、模拟器和数据分析工具,部分模型甚至选择先在CPU上搭建起小型模拟实验室,在虚拟环境中反复摸索规律、验证参数可行性,确认方案具备实际价值之后,再切换到GPU环境中开展正式的训练工作,这种分层验证的模式大幅降低了无效算力的消耗,也让模型的探索效率得到了显著提升。
随着实验的不断深入推进,所有参与测试的大模型都逐步展现出独立完成完整科研闭环的能力,从最初的提出研究假设、修改优化方案,到自主运行实验流程、分析误差来源,再到基于分析结果调整方向继续开展后续探索,整套科研流程完全由模型自主推进,全程没有人类的干预和介入。但本次实验也得出了一个明确的结论,在所有153场完全自主的实验当中,没有任何一个模型诞生出真正意义上的全新方法,所有最终被验证有效的优化思路,都能在已有的公开研究成果中找到对应的相似方向。这一结果清晰地表明,当前阶段的AI已经能够高效承接科研工作中99%的重复性、执行性的汗水部分,但那1%的突破性灵感,暂时仍然掌握在人类手中。针对AI自主研发AI的发展进程,OpenAI和Anthropic均把AI自己造AI的时间点押在2028年。
本次实验的整体运行规模远超此前同类型的所有测试,全程累计消耗了14000个H200 GPU小时的算力资源,前后累计完成约1万次不同维度的测试尝试,参与测试的18个顶尖大模型覆盖了当前行业内第一梯队的主流产品,除了最终取得第一名的Fable 5之外,其余模型也都展现出了不同层级的自主科研能力,其中Opus 5以2920步的成绩位列第二,Kimi K3以2930步的成绩排在第三位,后续的GPT-5.5跑出了3234步的成绩,Kimi K2.7跑出了3240步的成绩,不同模型之间的能力差距清晰可见。值得注意的是,这种能力差距在不同的资源预算维度下都保持着高度的稳定性,无论是按照运行时间计算、按照完成的实验次数计算,还是按照模型输出的token总数计算,各个模型的最终排名基本没有发生变动,这充分说明不同模型之间的成绩差距并非来自某一个模型获得了更多的运行资源或者更多的试错机会,而是不同模型之间真实的自主科研能力差异的直接体现。
在具体的实验行为层面,不同层级的模型展现出的行为模式差异十分显著,能力相对较弱的模型的表现,和刚进入科研领域的新手状态高度相似,往往只在单一固定种子上完成一次测试,一旦结果达不到预期就直接放弃整个研究方向,或者看到指标没有出现大幅提升就立刻切换全新的课题,大量有潜在价值的优化方向被过早地判定为无效,错过了进一步挖掘优化空间的机会。而表现优异的强模型则展现出了极其成熟的科研执行能力,它们不会轻易否定一个初步测试效果不佳的想法,会主动更换不同的种子开展重复验证,对之前加入的各类改动逐一开展消融实验,甚至在整体的训练配方发生变化之后,还会把此前被判定为无效的旧想法重新翻出来进行测试,主动尝试把两个单独测试时效果一般的改动组合到一起,挖掘其中可能存在的复合增益效果。比如Opus 5在重新调整β2参数之后,直接刷新了自身的最佳纪录,Fable 5在一次重新探测此前被搁置的旧方案的过程中,又额外省下了31步的训练步数,这些细节都充分体现了强模型在实验执行层面的精细化能力。
部分模型在自主探索的过程中,还展现出了极强的自主搭建科研工具的能力,比如Kimi K3在实验环境中发现现有工具无法完全匹配自身的研究需求之后,完全自主编写了优化器变体生成工具、自动化实验启动工具和损失曲线分析工具,后续更是直接在CPU上搭建起了专属的小型数值实验室,先在虚拟环境中对Newton-Schulz算法进行模拟测试,把得到的最佳参数反复验证无误之后,再将相关结论迁移到真实的GPU训练流程当中,这种自主搭建科研支撑体系的能力,完全打破了此前行业内对AI Agent的传统认知。过去行业普遍理解的AI Agent运行逻辑是模型直接调用预设好的外部工具完成指定任务,而本次实验中展现出的全新模式是,模型先自主构建专属的工具与运行环境,再依托这套自行搭建的体系执行科研任务,得出结果之后还会根据实际需求进一步重构优化工具,形成了一套完全自主的工具迭代闭环。
本次实验的所有运行轨迹、草稿内容、推理流程都已经完全公开,相关的公开数据与代码都可以直接获取,同时配套上线了交互式排行榜,所有感兴趣的研究者都可以直接查看每一个模型在实验过程中一步步做出决策的完整细节,完整复现整个实验的全部流程。相关团队也明确表示,后续还会推出多智能体框架、覆盖更多种子、纳入更多前沿模型,设置更长时间范围的探索任务,进一步扩大自主科研实验的覆盖边界,持续探索当前AI在自主科研领域的能力上限。
(编辑:胡忠华)
快讯
- 镇海股份(603637)8月14日资金净流出 高估值下偿债能力突出
- 思美传媒(002712)8月14日资金净流出 估值低于行业多数标的
- 博雅生物8月14日主力资金流入 机构评级有所下调
- 普源精电(00537)触发业绩不达标条款 回购注销部分限制性股票
- 海新能科8月14日获主力资金流入 近5日走势跑赢大盘
- 瑞凌股份8月14日主力资金大幅流入 短期走势跑赢大盘
- 8月14日*ST三六五主力资金流入居前 近5日走势跑赢大盘
- 众生药业8月14日主力资金流出 估值居历史高位近期走势弱于大盘
- 三超新材(300554)8月14日获主力净流入 估值处于历史较高区间
- 军工ETF广发(512680)8月14日遭净赎回1200万份 溢折率处低风险区间
- 新劲刚(300629)主力资金8月14日净流出 估值处历史偏低区间
- 精艺股份(002295)8月14日主力资金流出 估值处历史低位
- 上海监管局核准郭炜任施罗德交银理财董事长
- 江河集团(601886)估值处历史高位 8月14日遭主力资金净流出
- 中国中车8月14日获主力资金流入 近5日走势跑赢大盘
- 8月14日九州通主力资金外流 估值处历史低位两融差额占比2.06%
- 中煤能源(601898)8月14日获主力净流入 估值处近5年高位
- 大港股份估值处历史低位 8月14日主力资金呈净流出态势
- 万马股份8月14日主力资金流出 估值位于历史中位区间
- 港股通50ETF华夏规模达0.40亿元 低折价凸显配置安全属性

购物车