谷歌将发布Gemini 3.8 Flash 强化编程能力及视频处理功能

谷歌将发布Gemini 3.8 Flash 强化编程能力及视频处理功能

财π新闻 人工智能大模型领域的产品迭代节奏正在持续加快,全球头部科技企业的相关研发与发布进程进入高度密集的阶段,一系列面向不同应用场景的新模型正接连推向市场,行业技术竞争的激烈程度持续攀升。谷歌旗下的Gemini系列大模型即将迎来重要的版本更新,代号为Skimaki的Gemini 3.8 Flash预计于当地时间周三正式上线,这一版本的研发推进节奏显著快于此前的多个迭代版本,距离Gemini 3.7 Flash的正式发布间隔还不到三周时间。

在Gemini 3.8 Flash的研发推进过程中,谷歌方面已经明确放弃了此前规划的Gemini 3.5 Pro版本的后续推进工作,该版本的多个内部候选模型经过多轮测试评估后,被认定为性能提升幅度未达预期,甚至未能在核心效能指标上实现对同期Flash系列模型的超越,因此相关研发资源已被全部调整至其他优先级更高的项目当中。与此同时,谷歌旗下的下一代旗舰级大版本Gemini 4.0目前正处于后训练阶段,该版本在预训练环节的各项评估表现均达到了内部预设的相关标准,后续的调优工作仍在按既定流程有序推进。

作为Gemini Flash轻量化系列的全新迭代产品,Gemini 3.8 Flash的核心研发方向聚焦于编程能力的全面强化,其内部代号为Skimaki,在谷歌自研的内部编码工具Jetski开展的对比测试中,该模型展现出了极为强悍的编程实力,测试过程中谷歌工程师对Gemini 3.8 Flash的使用偏好度明显高于Anthropic旗下的Opus模型,相关测试结果显示其在编程相关的各类任务处理表现上实现了对Opus模型的全面超越。这一性能表现也让谷歌在编程大模型赛道上显著缩小了与Anthropic、OpenAI等头部竞争对手之间的技术差距,补上了此前Gemini系列在核心编程能力上的短板。

从产品架构定位来看,Gemini 3.8 Flash隶属于体积更小、运行速度更快的Flash系列,这类轻量化模型的训练和调优过程所需消耗的算力资源远低于参数规模达到数万亿级别的Pro系列旗舰模型,这也使得谷歌内部的多支研发团队可以同步推进不同技术方案的测试验证工作,大幅提升了版本迭代的效率。此前谷歌原计划推出的Gemini 3.5 Pro版本之所以最终被放弃,核心原因就在于Pro系列的调整需要占用大量的训练资源,不同研发团队很难同步开展并行测试,最终产出的候选版本性能提升幅度甚至不及同期快速迭代的Flash系列产品,继续推进该版本的研发已经不具备实际的技术和市场价值。

谷歌DeepMind团队近期经历的重大组织人事调整,也成为推动Gemini系列迭代节奏加快的重要背景。此前DeepMind联合创始人Demis Hassabis卸任日常管理职务,转任Alphabet首席科学家及部门主席,其长期副手Koray Kavukcuoglu升任高级副总裁全面接管日常运营工作,新任管理层上任后明确提出要加快技术落地执行速度,直接推动了Gemini 3.8 Flash的快速上线。为了进一步强化核心技术竞争力,谷歌今年以来大幅增加了编程方向的研究人员和算力投入,尤其在强化学习领域投入了大量资源,这类技术的应用场景已经不再局限于基础的代码补全,还覆盖了漏洞修复、工具调试、多任务连续执行等更为复杂的编程相关场景。除此之外,谷歌近期还成功引进了前OpenAI后训练负责人Barret Zoph,这位同时也是Thinking Machines Lab联合创始人的顶尖技术人才加盟后出任谷歌研究副总裁,专门负责强化学习和模型后训练相关的研发工作,为Gemini系列的后续迭代提供了关键的人才支撑。

在推出Gemini 3.8 Flash的同期,谷歌还为整个Gemini系列植入了全新的智能体视频理解功能,这项功能的核心运行逻辑是由模型自主决定视频的播放速度和采样帧率,无需按照固定的全量逐帧模式处理视频内容。依托这一全新的技术机制,Gemini系列模型在处理视频相关任务时,Token消耗最多可以降低88%,对应的运行成本最多可以降低66%,同时任务处理的准确率最多还能实现7%的提升,在大幅降低资源消耗的同时进一步优化了最终的输出效果。目前Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite三个版本的模型都已经支持这项智能体视频理解功能,相关功能的使用入口已经开放在Google AI Studio和Gemini Enterprise Agent平台当中,可供相关开发者和企业用户直接调用。

这项智能体视频理解功能的落地,直接拓展了大模型在视频处理领域的应用边界,能够有效支撑亚秒级片段检索、长视频复杂问题检索、异常检测和计数等高难度应用场景,使得各类智能体可以在极低成本的前提下直接处理长时间的视频素材,无需对长视频进行预先的人工切片和预处理操作,大幅降低了长视频AI处理的技术门槛和使用成本。此前大模型处理长视频内容时往往需要消耗海量的Token资源,不仅运行成本居高不下,处理耗时也难以满足实时性要求,很多涉及长视频的复杂任务根本无法规模化落地,而谷歌推出的这项智能体视频理解功能,通过模型自主决策采样策略的方式,从底层技术路径上解决了长期以来视频大模型面临的资源消耗过高的痛点,为后续各类视频相关的AI应用普及扫清了关键障碍。

当前全球人工智能行业已经进入了新一波的密集产品发布周期,头部企业的大模型迭代速度不断刷新行业纪录,各类具备全新能力的新模型接连亮相。除了谷歌即将推出的Gemini 3.8 Flash之外,Anthropic已经正式推出了Claude 5.1版本大模型,进一步巩固了其在长文本处理和编程领域的技术优势。OpenAI也即将发布名为Astra的全新大模型,这款新模型最核心的特性是具备持续智能体能力,依托名为“循环深度”的新型推理方法,Astra可以在减少思考Token消耗的同时大幅提升整体性能,能够支撑智能体长时间连续运行处理复杂的多步骤任务,相关产品的正式发布工作已经进入最后倒计时阶段。

除了上述三家头部企业的产品之外,马斯克也公开预告了旗下大模型产品Grok 4.7的发布计划,明确表示该版本将在十天后正式推出,为原本就已经十分热闹的AI产品发布潮再添新的变量。整个行业的产品迭代节奏已经提升到了前所未有的水平,谷歌CEO桑达尔·皮查伊此前在第二季度财报电话会议上就曾明确表示,公司将力争保持几乎每月发布一次新模型的节奏,从Gemini 3.6 Flash在7月正式推出,到三周后Gemini 3.7 Flash跟进上线,再到不到三周之后Gemini 3.8 Flash即将发布,谷歌的实际推进节奏已经完全兑现了这一公开承诺。

尽管Gemini 3.8 Flash在编程能力上实现了重大突破,但受限于Flash系列本身的轻量化定位,这款模型的整体综合处理能力仍然不及那些参数规模达到数万亿级别的大型旗舰模型,仅凭这一版本还不足以让谷歌重新确立在前沿大模型领域的绝对领先地位。目前谷歌内部的多支研发团队仍在同步推进不同技术方向的项目落地,确保不同研发路径之间可以形成有效互补,即便某一条技术路线的推进不及预期,其他路线的成果也可以及时补上,保障整体研发进度不会出现长时间的停滞。在行业竞争持续白热化的背景下,谷歌选择优先快速迭代Flash系列产品,一方面是为了快速响应当前市场对于高性价比、低延迟大模型产品的旺盛需求,另一方面也可以通过高频次的版本迭代快速收集真实场景下的用户反馈,为后续Gemini 4.0旗舰版本的最终落地积累充足的实战数据和技术经验。

(编辑:曹凤芹)