科技

WAIC七月节点大模型迭代密集 月更9款产品重塑行业竞争格局

来源:快线潮资讯
WAIC七月节点大模型迭代密集 月更9款产品重塑行业竞争格局

“最强模型”的保质期,正在加速缩水。

定焦One(dingjiaoone)原创

作者 | 雷晶

编辑 | 金玙璠

短短三十天里,九款旗舰级大模型密集亮相,这在以往的大模型行业并不多见。

从月初腾讯混元Hy3发布正式版并同步开源,到月末Anthropic推出Claude Opus 5,中间Kimi K3、Qwen3.8-Max预览版以及Grok 4.5等模型轮番登场。7月,成了近一年来罕见的发布洪峰期。

各家厂商抢占的时间窗口各不相同。有的趁竞品更新后的空档期迅速跟进;有的借世界人工智能大会的热度集中发声;还有的则通过调整价格策略来回应市场的激烈竞争。

但7月的意义,绝不止于发布数量的堆砌。这轮密集动作背后,折射出两个值得关注的趋势。

其一,头部模型间的性能鸿沟正在填平。根据Artificial Analysis最新发布的综合智能指数,顶尖模型之间的分数差距已显著收窄。随着版本迭代节奏加快,“最强模型”的头衔越来越难以长期稳固,厂商们不再执着于单一维度的绝对碾压,而是转而围绕特定任务场景寻找差异化优势。

其二,开源模型正式跻身第一梯队。在7月发布的新品中,腾讯混元Hy3和Kimi K3均选择了开放权重,允许开发者自行下载部署。其中,Kimi K3在Code Arena前端编程榜单上拔得头筹,力压GPT-5.6 Sol和Claude Fable 5。过去两年,开源模型多被视为闭源巨头的追赶者,而此次竞争表明,开源力量已在部分开发场景中具备了与闭源模型正面交锋的实力。

那么,这一个月的密集发布究竟带来了哪些实质变化?其背后的行业信号又是什么?

01. 告别“唯智商论”,多维战场全面开启

过去几年,大模型行业的竞争焦点主要集中在通用能力上:谁的知识库更庞大,谁的回答更精准。如今,这一评价维度已经重构。

代码能力,成为本轮争夺最激烈的阵地。

OpenAI持续深耕编程与复杂推理,不断扩张Codex生态,意图通过开发工具链锁定程序员群体。Anthropic则将重心放在代码理解与安全审计上,助力开发者应对大型项目中的工程难题。Grok 4.5主打速度与低成本,并与AI编程工具Cursor深度绑定,覆盖日常开发全流程。

大模型研究者姚宇航向「定焦One」透露,各家公司均在编程能力上重金投入,且差距迅速缩小。以Kimi K3为例,其代码能力提升显著,正逐步逼近头部闭源模型的水准。

图源 / pexels

Agent(智能体)是另一个必争之地。GPT-5.6 Sol配合Codex探索自动化编程,Opus 5侧重长程任务执行,Kimi K3展示连续运行完成复杂任务的能力,腾讯混元Hy3则试图结合微信生态探索智能体应用的新路径。

然而,Agent在实际落地中仍显稚嫩。独立开发者北城指出,当前部分智能体产品的短板并非工具调用能力,而是任务调度逻辑。例如,Codex的Ultra模式会开启大量子代理,这些子代理往往重复读取同一文件进行相似分析,导致Token消耗激增,但有效产出并未增加。在他看来,提升智能体能力不能仅靠堆砌子代理数量,核心在于能否精准判断哪些任务值得深入、哪些步骤可以省略。

姚宇航的观点与之相近。他认为智能体是当前最具潜力的方向,但距离真正成熟尚有时日。他指出,医疗、金融等垂直领域仍存在巨大机会;下一阶段拉开差距的关键,不仅取决于模型本身的能力,更取决于智能体在具体场景中的易用性以及客户的付费意愿。

国产模型则通过强化特定能力寻找突破口。Kimi K3聚焦长上下文、前端编程及产品设计能力的提升,在多项编程测试中跻身头部,实力接近国外闭源旗舰。

参数规模与推理效率的博弈,构成了另一条主线。

7月发布的多款模型参数规模迈入万亿甚至数万亿级别,但参数多少已不再直接等同于能力高低。随着MoE(混合专家)架构的普及,模型虽拥有海量参数容量,却只需激活其中一小部分即可完成任务,从而大幅降低实际计算成本。

业界由此分化出两条路线:一是继续扩大规模,试图用更大的参数量换取更强的能力上限;二是强调效率,追求以更小的激活参数实现接近旗舰模型的效果。

价格,成为7月市场竞争中最直观的变量。

海外厂商倾向于差异化定价。OpenAI进一步细分市场,将GPT-5.6拆分为不同版本,让用户根据任务复杂度选择对应模型;Anthropic坚守高性能旗舰路线,通过Opus系列覆盖高价值开发与企业场景;Grok 4.5则采取低价策略,输出价格仅为Opus系列的四分之一,并借助与Cursor的绑定吸引开发者。

国内厂商则更凸显成本优势。过去半年,多家国内模型厂商持续下调API价格,意在通过低成本降低使用门槛,扩大开发者与企业用户基数。

简而言之,7月的大模型竞争已从单一能力比拼,扩展至代码、智能体、参数效率及价格等多个维度。

02. 谁超预期?谁两极分化?

综合对比前代升级、榜单表现及开发者反馈,7月发布的模型水平大致可划分为三类。

首先是超出预期的一类:Kimi K3、Grok 4.5、混元Hy3。

其中,Kimi K3关注度最高。该模型采用MoE架构,总参数量达万亿级别,重点强化了长上下文、前端编程和产品设计能力。发布当日,Kimi K3即以1679分登顶Code Arena前端编程榜榜首,相比前代Kimi K2.6的第18名,跃升17个位次。一周后,它在Arena综合榜上也首次闯入全球Top 10。

但Kimi K3的能力边界同样明显。在Artificial Analysis的知识可靠性测试中,其幻觉率从Kimi K2.6的39%上升至51%,输出速度约为33 Token/s,远低于同类模型水平。

开发者的实际体验印证了这种“偏科”现象。北城认为,Kimi K3较上一代确有显著提升,优势集中于前端开发、UI设计和产品表达。例如在优化网站UI或设计APP界面时,它能产出更优方案;但在涉及复杂工程任务时,表现则不够稳定。

图源 / pexels

同样备受瞩目的还有Grok 4.5。7月9日发布后,它迅速进入Artificial Analysis智能指数前列,并在部分工具调用测试中表现亮眼,被不少开发者视为高性价比之选。

北城的体感与此一致。他认为Grok 4.5的最大优势在于速度,同一需求用它可能三五分钟就能搞定,而用GPT-5.6有时需耗时二十分钟甚至半小时。加之价格低廉,非常适合快速开发场景。姚宇航也指出,Grok 4.5的编程能力经过专门优化,搭配Cursor使用体验良好。值得注意的是,SpaceX此前宣布收购Cursor母公司Anysphere,交易预计三季度交割;xAI与Cursor展开的数据合作,也被认为有助于优化Grok 4.5的编程体验。

混元Hy3则代表了效率路线的突破。该模型总参数295B,激活参数仅21B,以不到旗舰模型五分之一的参数规模,在多个公开基准测试中成绩接近体量更大的竞品。不过在SWE-Bench Pro中,混元Hy3的57.9分与Claude Opus 4.8的69.2分仍有明显差距,显示其在复杂代码修复能力上仍需追赶。

姚宇航评价称,混元Hy3相比腾讯过往模型确有进步,加上开源和小尺寸设计,在中等体量产品中是个不错的选择。

其次是稳定在第一梯队、但惊喜有限的一类:GPT-5.6 Sol和Claude Opus 5。

这两款模型依然稳居第一梯队,但未带来颠覆性变化。GPT-5.6 Sol强化了复杂推理和智能体编程能力,在Terminal-Bench(测试模型在命令行环境中完成实际任务能力的基准)2.1测试中达到88.8%,Ultra模式进一步提升至91.9%。Claude Opus 5则继续保持复杂任务优势,更强调模型在复杂工程、代码理解和安全分析等场景中的可靠性。Opus 5的优势在于性能接近Fable 5,而价格仅为后者的一半。

两款模型虽处第一梯队,却缺乏重大突破。

北城提到,GPT-5.6已能覆盖他大部分日常开发需求,但遇到特别棘手的问题时,他会调用Opus 5来解决。不过,更强能力伴随更高成本。对他而言,Opus 5更像是一个解决关键问题的“专家”角色。

最后是反馈分化、尚待验证的一类:Gemini 3.6 Flash和Qwen3.8-Max预览版。

典型代表是Gemini 3.6 Flash。它在Artificial Analysis智能指数榜单上得分为50,与前代3.5 Flash持平。开发者社区普遍反馈,这一代相比前代无明显提升,表现也不如同期竞品。但也有观点认为,作为一款轻量化模型,Gemini 3.6 Flash的输出质量基本达标。

在独立开发者卡普迪姆看来,Gemini 3.6 Flash日常使用体验不错,虽然编程能力不突出,但多模态理解依然出色。它支持输入任意格式文件,日常聊天的文风和体验也优于许多竞品。

Qwen3.8-Max预览版自7月上线以来,模型效果波动较大,市场反馈不一。北城最大的感受是,Qwen3.8-Max预览版的思考深度较高,但有时会陷入长时间推理,“仿佛把自己绕进去了”,最终却未给出有效解决方案。卡普迪姆则认为其表现低于预期,他用自有前端审美测评集进行测试时,发现实际能力与宣传存在明显落差。作为一款仍在调整中的预览版,最终表现还需等待正式版发布后再行验证。

7月并未出现一款在所有维度都领先的模型,不同模型开始围绕具体场景形成分工。

以北城为例,他会根据任务灵活切换工具:GPT-5.6负责日常开发,Grok 4.5用于快速响应需求,Kimi K3专攻产品和前端场景,Claude Opus 5则解决复杂难题。卡普迪姆的搭配则不同,他习惯使用Claude的Fable 5或Opus 5进行规划,再通过GPT-5.6 Sol执行。

03. 迭代加速,开源闭源之争再升温

这轮密集发布背后,隐藏着几个值得深思的问题:模型迭代为何越来越快?为何集中在7月爆发?开源又是如何冲击现有商业模式的?

首先,模型迭代方式正在发生根本性转变。过去,大模型能力提升主要依赖重新训练更大规模的模型,周期长、成本高。但随着强化学习、后训练(在基础模型训练完成后,通过微调、强化学习等方式继续优化模型表现)等技术成熟,模型升级开始更多依赖训练后的优化手段。

姚宇航告诉「定焦One」,近两年模型发布速度明显加快,一个重要原因是行业已掌握更成熟的后训练方法。如今许多模型的提升无需从头训练,而是在已有基础模型上继续优化,通过强化学习、自我迭代等方式增强能力。

这意味着,模型竞争的周期正在缩短。过去,一个领先模型可能保持数月优势;现在,版本更新带来的领先窗口可能仅有几周。若发布节奏跟不上,便很快会被新版本覆盖。对厂商而言,发布模型不仅是技术展示,发布时间本身也成为竞争的一部分。

图源 / pexels

其次,7月是多重节点叠加的时间窗口。对于国内厂商,世界人工智能大会(WAIC)在7月举行,厂商集中在此前后发布模型、展示技术进展。对于海外厂商,多家头部公司也选择在这一阶段更新模型,旨在开发者生态和商业竞争中占据主动。

再者,行业的竞争规则正在重塑。模型能力强大不再是唯一目标,竞争已延伸至模型如何被使用、如何转化为收入。

这也是为什么开源与闭源之争在7月再次升温。长期以来,开源模型与闭源模型之间存在能力鸿沟。但随着部分开源模型进入第一梯队,一个更现实的问题浮现:当高性能模型可免费获取,模型公司的API调用和订阅收入是否会被分流?

支持开源的一方认为,开放权重能降低技术门槛,让更多企业和开发者参与AI创新。开源意味着技术提供方主动让渡部分利益,推动生态发展;而闭源阵营则担心用户被开源模型分流。Anthropic等公司指出,随着模型能力提升,开放权重可能带来安全风险,需要更严格的治理机制。

这场争论背后,实则对应着不同公司的利益诉求。对于英伟达等基础设施企业而言,模型开放意味着更多部署需求,进而带动更大的算力市场。对于OpenAI、Anthropic等模型公司而言,闭源模式能维持API调用和订阅收入。但也需看到另一面:开源确实会扩大部署需求,但随着参数效率提升,单位任务的算力消耗也可能被摊薄,算力市场的增量未必与模型开放程度同步。对国内厂商而言,开放权重不仅是技术路线的选择,更是争取开发者生态、云服务和后续商业化入口的关键。

7月之后,大模型竞争仍将延续。开发者社区普遍预计,DeepSeek V4正式版、Fable 5.1、GPT-6等新模型将在8月陆续发布。

模型能力差距正在缩小,单靠发布一款更强的模型,越来越难建立长期优势。接下来值得观察的具体指标包括:DeepSeek V4正式版能将开源模型的能力上限推至何处,API价格是否继续下探,智能体能否出现稳定的付费场景,以及开源模型能否进入更多企业的私有化部署。对这些问题的回答,会比榜单名次更能揭示这一轮混战究竟改变了什么。

*题图来源于pexels。

【站点差异】本稿将发布到 kuaixianchao.com。请换一种措辞、句式与段落节奏,避免与发往其他站点的版本雷同;事实与数字仍必须与原文一致。

相关推荐

最新文章