Claude棉花糖与甜瓜两模型曝光,显空间推理与深度思考特征

Claude棉花糖与甜瓜两模型曝光,显空间推理与深度思考特征

财π新闻 人工智能领域的最新动态显示,两款隶属于Claude系列的全新模型近期在开发者社区引发广泛关注,相关信息最早通过API流量监测被公开。这两款新模型的内部代号分别为claude-marshmallow-eap和claude-melon-eap,开发者社区根据代号中的英文词汇,将其俗称为棉花糖和甜瓜。相关监测数据显示,8月21日,这两个全新的模型代号在API流量中出现高频调用记录,相关调用行为被开发者完整截获,这也是两款此前从未对外公开的模型首次进入公众视野。截至目前,两款模型均未进入正式公开发布阶段,整体处于红队测试或内部测试的状态,仅对极少数指定人员开放使用权限,普通开发者和用户暂时无法通过常规API渠道进行访问。

从目前已披露的核心参数来看,两款新模型均支持高达100万Token的超长上下文窗口,这一参数配置能够支撑用户一次性输入体量极大的文本、数据或关联信息,无需进行分段拆分处理,大幅拓展了模型单次任务的信息承载上限。不同于此前Claude系列公开模型沿用的文学体裁命名体系,也不同于更早阶段内部开发代号使用的动物命名规则,此次棉花糖和甜瓜两款模型采用了食物主题的命名方式,延续了此前7月短暂测试过的相关EAP模型的命名逻辑,这种命名体系的切换也让不少行业观察者推测,这一批新模型在Anthropic内部可能归属于一个全新的开发分支,并非现有产品线的简单迭代调整。

在实际性能表现层面,两款新模型在3D强化学习和建筑空间布局相关任务上展现出极其优异的能力,完全区别于此前多数大模型在空间类任务上需要多轮引导才能输出合格结果的表现。依托全新的底层能力架构,这两款模型能够一次性直接理解并生成复杂的3D坐标和空间关系,对拓扑学、几何学和物理约束相关的各类规则实现了完美兼容处理,用户在发起相关任务请求时,无需反复调整提示词的表述方式、补充各类限定条件,模型就可以直接输出符合要求的完整3D场景数据。这种能力落地之后,相关应用场景的工作效率将得到显著提升,以建筑设计领域为例,建筑师可以直接输入对应地形、光照条件等基础参数,模型就能快速生成数十种符合力学结构要求的初步布局方案,无需再经过多轮人工修正调整。除此之外,元宇宙场景搭建、工业数字孪生体系构建、自动驾驶仿真环境开发等此前需要大量人力投入的领域,也都可以借助这一全新的3D生成能力获得效率层面的大幅优化。

参与早期测试的相关人员还发现了两款新模型一个极具标志性的运行特征,那就是模型在最终向用户输出答案之前,会在后台消耗海量的思考Token开展深度逻辑推理,这一运行模式和传统大模型的应答逻辑存在本质区别。过往绝大多数大模型在接收到用户的请求之后,会根据训练形成的概率分布,逐字逐句快速生成对应的应答内容,整个过程几乎没有预留额外的推演空间,一旦遇到复杂逻辑问题很容易出现疏漏或错误。而这两款新模型彻底调整了这一运行逻辑,在最终答案生成之前,会在后台生成大量隐形的Token资源,用于完成多轮深度自我推演、思维链完整构建、不同逻辑路径试错校验等工作,这种对算力资源的高消耗模式,甚至在多次测试过程中直接逼近了系统预设的使用上限。这一运行层面的显著变化,也清晰地传递出行业发展的全新信号,意味着大模型领域的市场竞争,已经正式从此前训练阶段的算力堆叠方向,逐步转向推理阶段的算力消耗比拼,当模型可以投入足够多的算力资源用于前置深度思考时,最终输出的答案质量将对传统运行模式的模型形成明显的能力优势。

从两款模型的横向对比结果来看,代号为棉花糖的模型综合能力略强于代号为甜瓜的模型,尤其是在日常对话和逻辑交互的实际体验层面,棉花糖的表现已经优于目前正式发布的Opus 5模型,对话过程的自然度、适配性都得到了早期测试者的普遍认可。不过目前两款模型的综合能力,还没有达到Anthropic旗下顶级的Fable级别模型的水准,整体定位处于现有公开产品线的中间偏上区间。结合两款模型曝光的时间节点来看,7月24日Anthropic刚刚正式发布了Opus 5模型,该版本发布之后的市场表现并未达到此前的预期,相关产品在同等评测得分的前提下,算力成本控制表现不及市场预期,企业用户的实际付费转化和使用放量情况也未达目标。因此开发者社区形成了几种主流推测,有观点认为棉花糖可能是针对Opus 5表现不及预期而紧急回炉重造的威力加强版Opus 5.1,也有观点认为两款模型分别对应Sonnet产品线的更新版本,还有部分观点认为其中可能包含新一代Haiku模型的迭代产品,目前所有推测都尚未得到官方的确认。

从Anthropic近期的产品迭代节奏来看,该公司今年以来基本保持着每隔大约两周就推出一次重要模型更新的频率,距离此次两款新模型曝光的十几天之前,刚刚有Sonnet 5.5模型的相关信息对外流出,如此高密度的产品迭代节奏,也让整个开发者社区对两款新模型的后续进展充满期待。按照当前的开发进度,不少行业分析认为,如果两款模型能够顺利完成全部内部测试流程,正式对外发布的时间窗口大概率就在不久之后。不过需要明确的是,内部测试代号出现在公开的API流量环境中,并不直接等同于相关产品已经完全定型,按照行业过往的开发惯例,这类处于早期测试阶段的模型代号,后续依然存在被重命名、不同模型功能合并甚至直接取消开发计划的可能性。

当前整个全球大模型行业的竞争已经进入白热化阶段,各家头部科技企业都在持续加快自身的技术迭代步伐,OpenAI在推进GPT-5 Turbo与RAG-Edge双引擎的技术落地,谷歌的Gemini 2.5 Pro已经接入Android 16原生Agent框架,国内头部厂商推出的大模型产品也在跨文档因果推理等领域实现了关键突破。在这样的行业大背景下,Anthropic选择将两款新模型的测试接口接入生产环境API,还同步在开发者控制台上线了对应的EAP反馈中心,支持测试人员一键提交提示词失败案例、延迟异常日志与Token损耗热力图,这种将测试开发者视为共同研发合作伙伴的推进方式,也让两款新模型的落地概率大幅提升。尽管目前两款模型的API兼容层尚未完全开放Function Calling与Tool Use等高级特性,相关功能还在持续优化调整过程中,但整个行业都已经清晰感知到,大模型领域新一轮的产品能力升级窗口,已经随着这两款代号为棉花糖和甜瓜的新模型曝光正式开启。

(编辑:付健)