智谱开源低价多模态大模型 推动国产算力规模化应用
苏斯楠 2026-08-28 00:47
财π新闻 8月26日,智谱正式上线并开源GLM-5.3-Flash模型,这是GLM-5系列推出的首个原生多模态模型。该模型总参数量达到320B,推理过程中激活参数为18B,可支持最长100万Token的上下文处理能力,在定价层面仅约为GLM-5.3的十分之一,限时折扣阶段的价格更是低至GLM-5.3的二十分之一。这一发布动作迅速在全球开发者社群引发广泛关注,相关技术参数与定价策略同步公开后,大量开发者第一时间启动了对新模型的测试与调用工作。
在正式对外发布之前,GLM-5.3-Flash就已经以匿名模型Ox Alpha的身份,在OpenRouter和OpenCode两大平台开展了大规模公开测试,不少参与测试的中文开发者将这个匿名模型的中文名称为“牛来”。在五至六天的测试周期内,该匿名模型在两个平台的累计调用量达到数十万亿Token,不仅快速刷新了两大平台此前保持的流量增长纪录,还直接登顶平台模型调用量榜首,成为测试阶段最受开发者关注的大模型产品。整个测试过程中,开发者完全基于模型的实际运行速度、输出稳定性和内容质量选择持续调用,没有提前获知模型背后的开发主体信息,所有反馈都来自真实的使用体验。
智谱方面随后正式确认,该模型在测试期间以及发布之后产生的全部线上推理流量,均由规模达到10万张的国产芯片集群承载,相关芯片的供应商可能包括华为、摩尔线程和海光信息。这是国产算力首次以如此庞大的芯片集群规模,直接面向全球范围的真实用户负载提供稳定服务,打破了此前行业内大规模前沿大模型推理必须依赖海外主流GPU集群的固有认知。不同于实验室环境下的峰值性能演示,这次国产算力集群承接的是来自全球各地开发者的真实、动态的多样化请求,覆盖了编程开发、文档处理、专业场景分析等各类不同类型的任务,对集群的稳定性、响应速度和并发承载能力都提出了极高要求。
为了让前沿大模型能够在国产芯片集群上高效稳定运行,智谱在SGLang的基础上专门构建了适配该模型的专用推理引擎,同时采用生产级编码预填充解码分离式架构,搭配混合缓存量化等多项核心技术优化手段,最终实现端到端服务性能较初始基线水平提升3倍。经过这一系列系统性优化之后,整个国产芯片集群的硬件利用效率和单Token推理成本,已经达到与主流英伟达GPU相当的水平,直接证实了国产芯片完全可以在十万张级别的大规模部署场景下,高效支撑前沿大模型的全链路推理需求。这一技术突破也为后续更多前沿大模型基于国产算力实现大规模落地提供了可参考的实践路径。
受这一行业突破性消息的直接影响,8月27日港股市场上智谱股价出现明显上涨,盘中涨幅一度超过11%,最终收盘报1160港元每股,对应总市值约为5327亿港元。与此同时,二级市场上科创芯片板块的相关标的也同步出现大幅收涨,市场参与者普遍对国产算力支撑前沿大模型落地的后续发展空间给出了积极反馈。整个交易时段内,相关板块的交投活跃度显著提升,反映出资本市场对这一技术落地成果的高度认可。
在全球权威的Artificial Analysis综合智能指数评测中,GLM-5.3-Flash拿到了57分的成绩,这一得分与海外知名旗舰模型Claude Opus 4.8的得分持平,同时还超越了智谱此前推出的上一代旗舰模型GLM-5.2。该模型采用了稀疏注意力与线性注意力混合的全新架构,原生集成视觉能力,能够借助视觉反馈指导编程开发和各类交互测试任务,同时还专门针对金融、法律等专业领域的工作场景,以及日常办公文档处理场景进行了定向优化。在处理PPTX、PDF、DOCX和XLSX等各类办公文档时,模型的视觉理解能力可以辅助检查并优化自身输出内容,实现更精准的呈现质量评估;在金融场景下,模型可以覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,提供可追溯的参考依据;在法律场景下,模型能够审查合同中的费用、账户与责任条款,按照律师实务惯例完成批注留痕,起草符合格式规范的各类法律文书。
从模型架构的整体设计逻辑来看,GLM-5.3-Flash完全是为了实现极低成本运行而打造,其总参数量与GLM-4.5基本相当,分别为355B和320B,但激活参数量从32B降至18B,模型层数也从92层缩减至45层,两项核心参数几乎实现减半。搭配智谱最新的30T Token多模态预训练语料,该模型能够以远少于前代产品的计算资源消耗,实现更强的综合性能表现。作为首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,它在保持精准长上下文处理能力的同时,还大幅降低了长上下文场景下的整体服务成本,线性注意力模块通过递归机制高效捕获局部依赖关系,稀疏注意力模块则借助轻量级索引器快速召回全局上下文信息,两者的结合让模型在处理百万级Token的长文档任务时,推理效率得到显著提升。
目前GLM-5.3-Flash已经正式面向全球开源,开发者可以通过官方指定的开源渠道获取完整的模型权重,同步开放的还有API调用接口,方便各类应用开发者快速将模型能力集成到自身的产品和服务当中。模型接入了ZCode等编码开发平台,也纳入了GLM Coding Plan相关服务体系,面向开发者限量发放体验资源,进一步降低了普通开发者接触和使用前沿大模型的门槛。整个开源开放的布局,也让更多行业用户可以基于这款高性价比的前沿模型,探索更多此前受成本限制无法落地的AI应用场景,推动前沿智能能力向更多产业领域渗透。
(编辑:徐松丽)
快讯
- 佳宏新材北交所IPO拟募2.53亿9月3日上会
- 二季度净利润同比增近六成 金罗斯黄金(KGC)股价随金价走高
- 美国美盛(MOS)11月将迎财季披露,行业供给端波动待观察
- Meta(META)天价诉讼落定 AI业务进展获机构上调预期
- 金山云披露上半年及二季度业绩 AI云营收猛增首获经营正利润
- 瑞幸咖啡(LKNCY)2026年Q2净利14.86亿 自营同店销售连降三季
- 老虎证券(TIGR)2026年Q2营收同比增长31.4% 实现季度扭亏
- 网易有道首款iPhone专属AI耳机开启预售 1499元9月登陆京东
- 小鹏集团(XPEV)业绩指引不及预期 加码机器人与智驾技术布局
- 怪物饮料(MNST)Q2营收破25亿美元 高营销投入引市场争议

购物车