商业第 155 期 ·

谷歌削减的不是价格表,而是账单

模型竞争的单位正从“每token单价”转向“每项任务的成本”

谷歌削减的不是价格表,而是账单

开篇

今天(当地时间7月21日)谷歌发布了Gemini 3.6 Flash。准确地说,是Gemini 3.6 Flash、3.5 Flash-Lite以及3.5 Flash Cyber这三款模型。撇开常规发布节奏不谈,因为这是有时效性的消息,所以我以特刊形式为您加急奉上。

价格是每100万输入token 1.50美元,每100万输出token 7.50美元。大多数报道都聚焦在跑分成绩上,而我的目光则落在发布文中的另一句话上。

“比上一代模型减少了17%的输出token消耗。”

订阅者朋友,先说结论:这次发布真正的新闻并不是性能。它是一个信号——AI价格竞争的单位,正从“token单价”转向“用多少更少的token完成同样的工作”,也就是“能效”。


发生了什么

谷歌这次推出了三款产品:主力模型Gemini 3.6 Flash、超轻量级的3.5 Flash-Lite,以及安全专用的3.5 Flash Cyber。

价格表先来看数字。3.6 Flash的输出单价为每100万token 7.50美元,相比上一代3.5 Flash的9.00美元,下降了约17%。输入单价维持在1.50美元不变。性能方面,在长程编码任务基准测试DeepSWE上从37%提升到49%,在机器学习工程基准测试MLE-Bench上从49.7%提升到63.9%,在直接操作电脑屏幕的OSWorld-Verified测试中从78.4%提升到83.0%。

但谷歌在发布文中着墨最多的,并非跑分成绩,而是效率。据Artificial Analysis指数1统计,输出token消耗减少了17%,而在DeepSWE等部分任务中最多减少了65%。这意味着推理步骤和工具调用次数本身减少了。

同期发布的3.5 Flash-Lite也很有意思。它输入0.30美元、输出2.50美元,每秒可产出350个token,在编码基准测试SWE-Bench Pro上取得54.2%的成绩,反超了比自己高一代的3 Flash(49.6%)。这相当于低阶产品线逆袭上一代高阶产品线的“以下犯上”。

发布末尾,谷歌还顺带透露已经开始对Gemini 4进行预训练。而3.5 Pro目前正在合作伙伴测试阶段。


为什么说是能效而非单价

要理解这一点,得看看Flash系列的价格走势。

2025年6月,Gemini 2.5 Flash的价格是输入0.30美元、输出2.50美元。此后3 Flash涨到0.50美元和3.00美元,今年5月的3.5 Flash又涨到1.50美元和9.00美元。一年之内,输入单价涨了5倍。

围绕这一走势,出现了“廉价AI时代终结”的解读。据研究机构Epoch AI的数据,实现同等性能的成本每年都在下降5到10倍,但供应商们却开始不再把这部分节省反映到价格上。正如OpenAI在2025年约37亿美元营收却出现50亿美元规模亏损所显示的那样,此前的低价更接近于抢占市场的补贴,如今投资者要求的是盈利而非增长,这种补贴正在被撤走——这是一种解读。

google然而这次3.6 Flash却降低了单价。看似矛盾,但这正是这次发布的核心所在。降价只是枝节,本体是消耗量的减少

在人们通过聊天使用AI的时代,token单价基本就等于成本,因为一问一答即可结束。但在智能体(agent)工作负载中,模型会独自制定计划、调用工具、审查结果,在这个过程中消耗token。成本发生在人类根本不会去读的中间过程之中。在这个世界里,主导账单的不是价目表,而是“这个模型完成一项任务要用掉多少token”。

我们来算一笔账。如果输出单价下降17%,token消耗也减少17%,那么每项任务的输出成本大约会降低30%。价目表上只能看到17%,但账单实际减少的是30%。顺带一提,100万个token大约相当于750张A4纸的文本量。产出这么多内容,现在只需7.50美元,约合1万韩元左右。

总结一下:单价已经涨到了该涨的程度,从现在起,竞争将转向在不触碰名义价格的前提下,通过提升能效来调整实际有效价格。


三家公司登上了同一个擂台

更重要的是,这场竞争并非谷歌一家的独角戏。

截至7月,把这一量级的价目表并排放在一起是这样的:OpenAI的GPT-5.6 Luna输入1美元、输出6美元;xAI的Grok 4.5是2美元和6美元;Anthropic的Claude Sonnet 5则是限时折扣价2美元和10美元。Sonnet 5从9月起将回归正价3美元和15美元。仅仅一年前,这个价格区间里还根本不存在前沿级性能,而如今三家公司的主力产品全都挤在这个区间里。

跑分高下各有不同。按谷歌公布的对比表,长程编码任务(DeepSWE)中Luna以67%领先,电脑操作(OSWorld)中3.6 Flash以83.0%领先,知识型工作评测GDPval-AA v2的Elo2分数中Sonnet 5以1607分最高。也就是说没有绝对的胜者。既然性能上分不出胜负,竞争的重心就必然转向价格与效率。

因此,我这样看未来的图景:价目表会越来越趋同,差异化会发生在三个地方。第一是今天谈到的token效率,第二是缓存与批处理等实际有效的折扣机制,第三是根据任务性质在便宜模型和昂贵模型之间切换的路由3。事实上,在采购端,不固定于某一款模型、而是根据任务复杂度切换调用模型的结构,正在成为标准做法。


Oswarld视角

以我曾在制定GTM战略时亲自设计B2B产品价目表的经验来看,谷歌这一招是教科书式的利润防御。守住名义单价,同时降低实际有效价格。如果直接降价,整体营收都会被削减;但如果提升能效,折扣就只会有选择性地流向“用得多的优质客户”——也就是那些大规模运行智能体的客户,正是谷歌想要留住的那批人。

站在采购方的角度,启示很明确:模型单价对比表如今顶多只能当参考,很难再有决定性意义。即便单价相同,实际成本也会因token消耗量的不同而相差数倍。归根结底,只能用自己的工作负载去实测。挑选公司内部经常运行的几个代表性任务,每当新模型发布时就测量一次“每任务成本”,建立这样一套流程。这比盯着价目表要精确得多。

有一点也需要警惕。17%这个效率数字,是供应商所选基准测试的平均值。这是我在做数据工作时反复确认过的规律:这类平均值在不同工作负载之间的偏差可能很大。文档摘要任务中效率可能大幅提升,而代码生成任务中反而可能消耗更多token,这种反转完全可能发生。基准不应是供应商的平均值,而应是你自己任务的实测结果。


结语

今天的内容可以归纳为三句话。

谷歌把3.6 Flash的单价降了17%,但真正的信息是:用17%更少的token完成同样的工作。智能体时代的成本,主导者不是价目表,而是token消耗量,竞争的单位正在转向“每项任务的成本”。因此,采购者需要的不是一双寻找更便宜模型的眼睛,而是一套以自身任务为基准实测成本的流程。

我建议这周不妨做一件事:挑选团队中用AI处理的三四个代表性任务,实测一次当前所用模型的“每任务成本”。下一次更换模型的决策会因此容易得多。

如果您在实际工作中有过更换模型的经验,欢迎在评论区分享账单与预期不符的时刻——无论是只看价目表就换模型结果大吃一惊的案例,还是反而因效率提升而受益的案例都欢迎。我会在下一期中参考采纳。


💬 欢迎在评论区分享更换模型后账单与预期不符的经历,我会在下一期中参考采纳。 📨 如果身边有同事正为AI成本发愁,欢迎分享这篇文章。


参考资料与延伸阅读

核心来源

  • Google,“Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber”,Google Blog,2026年。 链接 ··· 是今天这期通讯的一手信源,跑分表和价格都在这里。
  • Artificial Analysis,“Gemini 3.6 Flash: Intelligence, Performance & Price Analysis”,2026年。 链接 ··· 是token效率17%这一数字的出处,是比较各模型实际有效成本时最有用的独立指标。

背景知识

  • XDA Developers,“Google’s Gemini 3.5 Flash costs 3x the model it replaced, and the era of cheap AI is ending”,2026年。 链接 ··· 梳理了Flash系列的价格走势和“补贴时代终结”的论点,与今天文章的第二章相呼应。
  • 9to5Google,“Google launches Gemini 3.6 Flash and 3.5 Flash-Lite, teases Gemini 4”,2026年。 链接 ··· 是关于发布背景以及Gemini 4预训练消息的报道。
  • AI2Work,“GPT-5.6 vs Claude Sonnet 5: Inside the Frontier Price War”,2026年。 链接 ··· 参考了其中关于竞争对手价格结构和限时折扣的信息。

安光涉个人插画

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. Artificial Analysis指数:一项独立测量各主流AI模型性能、速度与成本并进行比较的基准服务。因其基于第三方实测而非供应商自我发布的数据,在业内被广泛引用。

  2. Elo分数:源自国际象棋排名体系的相对评估方式。通过让两个模型的输出正面对决,提升获胜一方的分数,反映的是相对优劣而非绝对分数。

  3. 路由(Routing):根据传入任务的难度,在多个AI模型中自动挑选合适的一个并加以分配的方式。简单任务分配给便宜的模型,复杂任务分配给昂贵的模型,以此降低整体成本。