OpenAI投资企业Harvey自研模型采用中国开源底座

OpenAI投资企业Harvey自研模型采用中国开源底座

财π新闻 当地时间8月20日,总部位于美国旧金山的法律AI独角兽企业Harvey正式发布其首个自研模型Tenet,该模型以中国开源模型Kimi K3作为底座,核心目标是解决通用大模型无法胜任真实场景下复杂法律任务的行业痛点。作为OpenAI重点投资的AI创业企业,Harvey的这一技术选择在全球AI产业领域引发广泛关注,也成为中国开源模型深度参与美国AI产品研发链条的标志性事件。

Harvey成立于2022年,由前诉讼律师Winston Weinberg与前Google DeepMind研究员Gabe Pereyra联合创立,成立之初便获得OpenAI的投资支持,后续又陆续引入红杉资本、a16z、GIC等多家头部投资机构的资本加持。经过数年的市场拓展,Harvey目前已经成长为全球估值最高的法律AI企业,2025年底其估值达到80亿美元,2026年3月最新一轮融资完成后估值攀升至110亿美元,当前企业正在推进新一轮融资,目标估值约为155亿美元。在业务覆盖层面,Harvey的服务范围已经拓展至全球60个国家,累计服务超过2400家机构,覆盖20多万名执业律师,包括Latham & Watkins、A&O Shearman在内的多家全球顶尖律所,以及汇丰银行、普华永道、桥水基金、KKR等跨国金融与专业服务机构都是其核心付费客户,企业当前年化收入约为3.5亿美元,在商业落地层面已经形成了成熟的运营体系。

在Tenet模型发布之前,Harvey长期是闭源大模型在专业服务领域的典型客户,此前其业务运行主要依托Anthropic、OpenAI和谷歌等美国科技公司推出的封闭专有模型,甚至还曾与OpenAI合作共同训练过一套案例法模型,将约100亿token的美国案例法数据纳入训练流程。而此次发布的Tenet模型并非从零开始训练的全新基础大模型,Harvey选择了后训练的技术路径,在Kimi K3的通用能力基础之上,引入公开法律资料、合成数据集、法律专家标注的真实业务数据,专门针对长周期、高复杂度的法律实务任务开展定向优化,重点适配合同审阅、尽职调查、诉讼研究等律师日常高频工作场景。为完成Tenet的后训练工作,Harvey与Fireworks Research展开合作,投入134块至150块英伟达B300图形处理单元,在真实法律工作环境中开展了为期两个月的异步强化学习训练,训练过程中AI智能体被分配各类长周期法律任务,系统会根据其高效产出实质性法律工作成果的能力进行评分,整套训练环境完全对标Legal Agent Benchmark任务的标准架构。

从实际测试结果来看,Tenet模型在法律任务维度的能力提升效果显著,在行业基准测试中,对比原生Kimi K3底座模型,Tenet在法律任务的完成通过率实现大幅提升,其中在LAB测试集的全任务通过率相对基座模型提升82%,在LAB Contracts合同类法律测试集上的表现相对基座提升22%,最终拿下LAB Contracts测试集的行业第一、LAB整体测试集的行业第二的成绩,推理成本不足主流闭源基础模型的四分之一,在复杂长周期法律智能体任务中的表现,甚至超过了美国本土的前沿系统Fable 5和GPT-5.6 Sol,达到了法律领域的最先进性能水平。目前Tenet尚处于研究预览版本阶段,模型权重、正式API接口暂未对外放出,Harvey计划将模型中经过验证的能力逐步整合进现有产品体系,尚未面向全部客户开展大规模商用落地。

值得注意的是,Harvey并非硅谷唯一选择中国开源模型作为技术底座的明星AI企业,当前已有多家硅谷头部AI创业公司的核心产品采用Kimi系列模型作为底层支撑。其中,AI代码工具企业Cursor推出的Composer 2产品,技术底座选用的是Kimi K2.5;专注于企业AI服务的Cosine公司,其发布的Lumen Outpost产品基于Kimi K2.6搭建;此前在全球AI开发领域引发广泛关注的AI程序员Devin,其搭载的SWE-1.7模型同样以Kimi K2.7作为底座。除此之外,由OpenAI前CTO创办的AI企业Thinking Machines,在技术研发过程中参考了DeepSeek的V3架构,同时使用Kimi K2.5生成的合成数据完成模型微调,一系列行业案例共同印证了美国AI产品由中国模型预制已经成为明确的产业发展趋势。

中国开源模型的快速发展,为海外AI创业公司开辟出了不同于以往的第三条技术发展路径。在此之前,海外AI创业公司想要搭建自有垂直模型,通常只能在两种方案中做出选择,第一种方案是从零开始完整训练一套基础大模型,这一过程需要投入极高的算力成本、数据成本和研发人力成本,绝大多数创业企业都难以承担如此巨大的前期投入;第二种方案是长期依赖OpenAI等海外厂商推出的闭源模型API开展业务,这种模式下企业需要持续支付高额的接口调用费用,同时还始终面临着闭源模型服务商调整服务规则、提升调用价格甚至直接下场参与同赛道竞争的潜在风险,企业自身的业务发展始终存在不可控的外部隐患。而依托中国开源成熟模型底座开展垂直领域后训练的新路径,让海外AI创业公司无需承担从零训练基础大模型的巨额成本,同时也彻底规避了永久依赖闭源模型带来的各类潜在问题,企业可以将更多资源投入到自身熟悉的垂直行业场景打磨中,把行业专属数据和业务经验真正转化为自身的技术壁垒。

这一技术路径同样得到了全球专业信息服务领域头部企业的认可,国际知名专业信息服务机构汤森路透发布的自研模型Thomson-1,同样采用了中国开源模型作为底座。汤森路透CTO在谈及这一技术选择时,将其形象地比作买房而非租房,认为企业掌握自有模型的完整权重,能够让长期积累的行业专属数据和知识产权持续沉淀为公司的核心资产,而不是在闭源模型的调用过程中变成完全不可控的外部资源,这种资产沉淀的价值对于深耕垂直行业的企业而言,有着不可替代的长期意义。

当前,中国模型正在以开放权重授权、合成数据输出、直接部署支撑等多种不同形式,全面进入美国AI产品的供应链体系,逐渐成为全球各类AI产品研发过程中不可或缺的底层原料和上游工业品,这种产业层面的渗透并非短期的流量热点,而是展现出了清晰的长期主义价值。越来越多的海外AI从业者已经意识到,美国在前沿开源权重模型开发领域已经出现明显的发展滞后,即便对开源模型施加过于严格的限制,也无法阻止中国实验室持续推出性能更强的新一代开源模型,反而会直接削弱大量类似Harvey这样的垂直领域创业公司,在专业赛道构建差异化模型能力的空间。随着全球AI产业分工的持续细化,中国开源模型的产业价值还将在更多垂直场景中得到进一步释放,为全球AI技术的多元发展提供稳定的底层支撑。

(编辑:付健)