数码影音频道 频道

大模型按月发布之后,"选哪个模型"成了开发者的常驻成本

“AI摘要”

7月一个月内,十款旗舰大模型密集发布,发布节奏从年度大版本压缩为月度迭代,开发者面临"该用哪个"的困惑。榜首信号失效,头部模型分差收窄、偏科严重,开源模型能力提升但价格战转向"按结果计费"的暗战。选型从一次性决定变成常驻运营成本,开发者需按任务动态匹配模型,关注每次跑通的成本而非每token价格。

7月这一个月,有十款旗舰大模型先后露面。算上6月底到8月初,约一个半月里,十家头部团队排着队发了新模型——腾讯混元Hy3、xAI Grok 4.5、月之暗面Kimi K3、阿里Qwen3.8-max-preview、智谱GLM 5.2、字节Seed 2.1 pro、Google Gemini 3.6 flash,一个接一个。钛媒体的口径是"7月九款旗舰",平均每三天一款。开发者圈子里讨论最多的,已经不是"哪个最强",而是"我到底该用哪个"。这个问题,排行榜答不上来了。

为什么答不上来,得从发布这件事本身说起。

一、发布节奏,已经从年度大版本压成了月度迭代

7月初,腾讯混元Hy3正式开源。7月8日,xAI的Grok 4.5上线。7月16日,月之暗面甩出Kimi K3。7月19、20日前后,阿里的Qwen3.8-max-preview露出。到月末,Claude Opus系也补了位。把这份名单铺开,会看到一个过去少见的现象:同一档次的模型,不是在各自的年度节奏里错峰发布,而是挤在同一个窗口里接连登场。

这不是一次集体撞车,是几家不约而同把发版日历调成了月历。Grok 4.5发布后,xAI给出过一个承诺:2026年底前,大约每月一款基础模型。OpenAI把GPT-5.6拆成多个版本,按需选配。Anthropic守着高性能旗舰慢慢更。节奏一旦卷起来,没有人敢停在"一年一次大版本"的旧节奏上了。放在两年前,头部实验室的旗舰模型之间往往隔着半年以上,开发者认准一个,能安心用一阵;如今这个间隔被压缩到了以周计。

为什么是现在,而不是去年。三件事叠在了一起。一是Agent能力跨过了可用性门槛,模型开始能独立完成一段完整的工作流,而不只是补全一行代码。二是token成本降到了能跑高频智能体的程度,让"让模型反复试错"这件事在经济上说得通。三是"模型即服务"的计费方式,天然奖励高频迭代——发得勤,就能多占几次开发者的注意力窗口,也能在月报的榜单上多露几次脸。

这三件事加在一起,模型从"你花时间学会的一个工具",变成了"你每个月重新比价的消耗品"。发布快了,真正的麻烦才开始。因为榜首,不再是那个唯一的答案。

二、榜首的信号,正在失效

过去你认准一个榜首,能干上好一阵子。现在不行了。xbench月报里,头部模型的综合智能指数分差明显收窄——榜首Opus 4.8大约76.4分,新模型密集挤在68到73分的区间。"最强"的领先幅度,从过去的一档,缩到了几分。换句话说,榜首还是榜首,可它领先的那几分,未必覆盖你手上的具体任务。

更麻烦的是偏科。Kimi K3在网页前端拿了第 一,可幻觉率51%,比上一代的39%还高,转去啃复杂工程就不那么稳。腾讯混元Hy3反过来,搜索类Agent追平了顶尖水平,高阶数学却差出一倍多。一个模型能在一项上追平顶尖、在另一项掉到中段,已经成了常态。

一个模型能在一项上追平顶尖,在另一项上掉到中段,已经成了常态。对写前端的、做搜索的、算硬数学的,答案各是各的。榜首还是那个榜首,只是它不再代表"你应该用谁"。一个"第 一",往往只在一张卷子上成立。

还有一条更安静的变化。过去说"闭源绝 对碾压开源",这句话正在松动。Kimi K3的2.8T、Qwen3.8的2.4T,把开源阵营推到了2.4到2.8T的量级,国产开源模型站到了全球前列。原生多模态也成了出厂标配——Qwen3.8第 一次把图像、视频、文档并进2.4T旗舰,Kimi K3、Thinking Machines Lab的Inkling同为原生多模态。多模态推理从"看图回答"走向"复杂任务执行链"。格局在动,可这对一个具体开发者选哪个,帮助有限——你还是得回答"我的活儿落在哪张卷子上"。

榜看不准,大家开始比价格。价格这一比,又比出了新的问题。

三、价格战,打成了"按结果计费"的暗战

"便宜"两个字,在模型这儿得拆成好几笔账。

Grok 4.5标价是Claude Opus 4.8的四分之一,单看单价确实低。可xAI说,完成同一个任务,它吐出的token也只有Opus的四分之一不到。折算到每一个跑通的任务,两边成本差被拉到十几倍——便宜的那边,真到任务层面反而可能更省,前提是你能接受它的完成度。Grok 4.5和Cursor真实开发数据共训、默认进Cursor,这是SpaceX收购Cursor母公司之后的第 一个联合模型;但Cursor的仓库曾被误纳进训练数据,那些Cursor专属跑分,可信度得打折。

Kimi K3单价更低,可它输出慢、吐字多,整张账单未必好看。腾讯混元Hy3把单价压到国产最低档,靠稀疏激活结构摊薄推理成本。三家路线分明:国内持续降价扩基数,海外OpenAI拆版本按需选、Anthropic守高价、Grok走便宜加快加Cursor渠道。评测维度也从单一"强",扩到了代码、智能体、参数效率、综合成本的多维竞争。

Forrester的Biswajeet Mahapatra和Omdia的Lian Jye Su都讲过同一句话:看每次跑通的成本,不是每token的成本(cost per successful outcome)。这句话正好点破了"便宜"的陷阱——你省下的token钱,可能又被重试和返工吃回去。一个有经验的团队,不会只看价目表,而会在自己的真实任务上跑一遍,记下"这个任务,这家花多少钱、返工几次才跑通"。这笔账,价目表上查不到。

又快又便宜又强,听着能兼得。有一个群体先撞上了墙:跑Agent的人。

四、选型,正在变成一项常驻的运营成本

Agent是这一轮模型最被寄望的场景。现实落地,没那么顺。钛媒体援引独立开发者北城的说法:Codex Ultra的子代理会重复读同一个文件,token翻倍,有效工作没跟上。研究者姚宇航的判断是,下一步的差距不在榜单分数,而在真实业务里是否真好用、客户是否愿意持续付费。榜单上的分,落到真实工程里,会被返工、上下文丢失、子代理空转一层层吃掉。

模型越强,反而越难一锤定音。以前认准一个榜首,能干半年。现在它三个月一更新,隔壁又冒出个更对你的活儿的。选模型,从交卷前的一次决定,变成了每个月都要重新算的一笔账:这个月谁的榜首跟我手上的活儿对得上,谁的价格我能接受,谁在这个任务上不偏科。更实际的是,不少团队开始给不同任务接不同的模型——简单检索走便宜的,复杂工程走贵的,等于在模型之上自建了一层路由和评测。选型这件原本属于"上线前"的事,被拉进了日常运营。

密度高,对开发者未必全是坏事。至少议价权在买家这边,价格被持续压低,开源阵营也把能力推到了新量级。麻烦在于,选择本身成了成本。当模型每月一换、偏科各异,"选哪个"不再是一次性动作,而是一个要持续评估、动态切换的运营动作——你得盯着榜单、比着账单、按自己的工作流对账。

接下来半年,比的可能不是谁家模型分更高,而是哪家能让你少算几次这笔账。或者,干脆帮你把这笔账算了。

0
相关文章