一个代币的价格正在改变什么
不是开放模型“变得够用了”,而是能用上AI的团队范围正在改变。先给您一个数字:每百万输出代币25美元 vs 0.20美元,相差125倍。前者是目前最聪明的闭源AI模型(Claude Opus 4.6)的输出价格

开篇
订阅者朋友,您听说过开放模型吗?它也被称为本地模型、本地部署模型等等,简单来说,就是可以不联网、直接安装在自己电脑(或服务器)上使用的人工智能模型。
上周谷歌发布了Gemma 4。Apache 2.0许可、31B参数、在智能体工具使用基准测试(τ2-bench)中得分86.4%。考虑到仅仅一代之前的Gemma 3在同一测试中只有6.6%,这不是渐进式的改进,而是巨大的飞跃。
差不多同一时期,AI智能体框架Deep Agents团队公布了自己的评测结果。GLM-5、MiniMax M2.7这类开放模型,在文件操作、工具调用、指令执行等核心智能体任务上,展现出了与Claude Opus 4.6、GPT-5.4等闭源前沿模型相近的准确率。
不过我关注的并不是基准测试分数(我已经说过很多次,我是基准测试怀疑论者)。我关注的是价格表。如果做同样的事,成本却相差10到20倍,这就不是技术新闻,而是产业结构正在变化的信号。
🔢 数字告诉我们的:成本差距的真相
把Deep Agents团队的评测数据和价格放在一起看,画面就不一样了。
先看智能体任务的准确率(Correctness)。Claude Opus 4.6以0.68排名第一,GLM-5以0.64紧随其后,甚至高于GPT-5.4(0.61)。MiniMax M2.7也有0.57,与Gemini 3.1 Pro(0.65)的差距并不大。
现在把价格加上去。按输出代币计算,Opus 4.6每百万代币25美元。GLM-5为3.15美元,MiniMax M2.7为1.2美元。做同样的事,成本相差8到20倍。
如果换算成实际业务规模,差异会更加明显。假设运营一个每天输出一千万代币的智能体系统,Opus 4.6每天需要250美元,MiniMax M2.7只需要12美元。按年计算,差额约为8,700万韩元。这样的差距已经不是“节省成本”的问题,而是“能不能做”的问题。
🧩 Gemma 4展示的新方程式
谷歌于4月2日发布的Gemma 4,又给这个成本方程式增加了一个变量——那就是“在哪里运行”。
看Gemma 4的产品线,意图很明确。E2B(2B)、E4B(4B)面向智能手机和浏览器。26B MoE1在推理时只激活3.8B参数,却在LMArena文本得分上达到了1,441。31B Dense的体量能装进一张消费级GPU,同时在开放模型世界排名第三。
尤其引人注目的是与智能体相关的性能。在τ2-bench(智能体工具使用基准测试)中,Gemma 3 27B得分为6.6%,而Gemma 4 31B达到了86.4%。仅一代之间就提升了13倍。原生函数调用2、结构化JSON输出、多步骤计划制定等功能都已内置,无需额外框架即可搭建智能体工作流。
而且,这些模型采用Apache 2.0许可,商业使用没有限制,也没有月活跃用户上限。如果把Gemma 4 31B部署在自家服务器上运行内部智能体呢?成本就不再是API调用费,而只剩下GPU电费。
根据Artificial Analysis的数据,以Lightning AI为基准,Gemma 4 31B的API调用成本为每百万代币0.20美元。与Opus 4.6的25美元相比,相差125倍。当然存在性能差距,但在智能体反复的工具调用这类“够用就行”的任务上,这个价格差距是决定性的。
🤖 智能体时代的真正问题:消耗大量代币
这里再往深处走一步。开放模型便宜是好事,但为什么这一点现在变得重要了?
答案在于智能体工作流的代币消耗结构。
**普通聊天机器人是一个用户问题对应一次LLM调用。但智能体不同。为了处理一个用户请求,需要经历计划制定→工具选择→执行→验证→自我修正,反复调用LLM 10到20次。**根据Gartner在2026年3月的分析,智能体模型消耗的代币是普通聊天机器人的5到30倍。

**将一项软件工程任务交给智能体处理,包括重试和自我修正循环在内,会消耗100万到350万代币。**如果用前沿模型来运行,一个任务就要花费5到8美元。在每天处理数千件任务的生产环境中,每月费用可能高达数亿韩元。
根据FinOps Foundation在2026年的报告,企业的平均AI预算从2024年的年度120万美元跃升至2026年的700万美元。然而单位代币价格却在持续下降——2024年至2026年间,代币价格中位数以年200倍的速度下跌。
这就是悖论所在。**代币单价在下降,但总成本却在上升。原因在于智能体消耗的代币量的增速已经超过了价格下降的速度。**在这种情况下,开放模型的价格优势不再只是简单的节省,而成为了智能体能否投入生产环境的分水岭。
🏗️ 价值正在流向何处
退一步看这股趋势,会看到更大的图景。开放模型开始在智能体任务中站稳脚跟,意味着AI产业的价值重心正在转移——从“谁能做出更聪明的模型”,转向“谁能把模型编排得更好”。
Deep Agents的方法很好地展示了这一点。这个框架的设计使得模型可以一行代码就替换掉。它还支持一种多模型模式:用前沿模型来制定计划,用开放模型来执行。它会根据模型上下文窗口的大小自动调整压缩策略,并将模型的名称和能力注入系统提示,让智能体知道自己能做什么。

这里的核心是“驾具”(harness)。价值的重心正在从模型本身,转移到包裹模型、使其真正可用于实际业务的编排层3。那这个驾具是不是什么了不起的资产呢?倒也不是。驾具说到底也不过是把JSON和Markdown拼接起来,再加装权限和特定知识的一种“魔改工具”……大概是这样的形态。驾具最终不过是skill.md的高级化版本。这与智能手机产业中,iOS和安卓生态系统比半导体本身创造出更大价值的结构颇为相似。今后类似的东西还会不断出现。
Deloitte在2026年1月的报告中,用“代币经济学(Tokenomics)”这一框架总结了这一点。企业AI成本不再以订阅费或虚拟机来衡量,一种以代币这种浮动单位来运转的新经济体制正在开启。在这个体制下,竞争力不再来自“能用得起昂贵模型的资本”,而来自“每个代币能榨取出更多价值的架构”。
Oswarld视角
如果您是iPhone用户,请点击[iOS];如果是安卓用户,请点击[AOS],安装谷歌推出的Google AI Edge Gallery,然后下载上面提到的Gemma 4模型试用一下。体积大约3.2GB,实际体验的性能感觉相当于GPT-4o左右。当然支持韩语,还支持图像/语音识别的多模态功能。这意味着什么呢?
到目前为止,AI市场的格局非常明确:OpenAI、Anthropic、谷歌负责制造模型,企业购买API来使用。这和SaaS市场的早期阶段很像——拥有平台的一方掌握定价权,客户则被锁定其中。从GTM战略的角度来看,我觉得这种变化最有意思。而现在,开放模型已经越过了某个门槛,甚至连优化都做到位了。
当开放模型超越“够用”的水平,达到“可以投入生产”的水平时,这个格局就会动摇。企业将拥有把核心工作流迁移到自有基础设施的选项。Gemma 4 E2B能在智能手机上运行,31B能装进一张消费级GPU——这意味着AI推理的去中心化在技术上已经成为可能。
从数据的角度,我还想指出一点,在看这类基准测试时需要注意的地方。Deep Agents的评测基于138个测试用例。Gemma 4的τ2-bench分数是在特定场景(Retail)下取得的结果。这些数字并不能反映实际生产环境的全部复杂性。准确的解读不是“开放模型等同于前沿模型”,而是“在特定任务上具备足够的竞争力”。
但方向是明确的。代币单价的下降、智能体代币消耗量的增加、开放模型性能的提升——这三条轴线交汇之处,能够“拥有”AI的组织范围正在根本性地扩大。
结语
- 开放模型(GLM-5、MiniMax M2.7、Gemma 4)已经达到了在智能体核心任务上可与闭源前沿模型竞争的水平,成本却便宜8倍到125倍。
- 智能体工作流消耗的代币是聊天机器人的5到30倍。在这种环境下,代币单价的差异决定的不是“节省”,而是“能否执行”。
- AI产业的价值重心正在从“制造模型的人”转向“善于编排模型的人”。模型正在成为可替换的零件,编排能力正在成为竞争力。
下次审视AI工具成本的时候,不妨不以模型的名字为标准,而以每个代币能榨取出的价值为标准来比较,风景会变得不一样。
感谢您今天也阅读到这里。这份通讯是订阅者专属通讯。
如果您能推荐给身边的人、帮我增加订阅者,这将是我持续写作的强大动力!
参考资料与延伸阅读
- Langchain,“Open Models have crossed a threshold”,2026.4.2. :今天这期通讯的核心数据来源,包含开放模型与前沿模型的智能体基准测试对比结果。
- Google DeepMind,“Gemma 4: Byte for byte, the most capable open models”,2026.4.2. :Gemma 4官方发布博客,包含基准数据和架构说明。
- Google AI for Developers,“Gemma 4 model overview”,2026.4.2. :整理了各模型规模的内存需求、量化选项和部署指南。
- Oplexa,“AI Inference Cost Crisis 2026: Why Your AI Bill Is Exploding”,2026. :探讨推理成本占企业AI预算85%的背景,以及智能体代币消耗的结构。
- Deloitte Insights,“AI tokens: How to navigate AI’s new spend dynamics”,2026.1. :分析企业在以代币为基础的经济体制中应如何管理AI成本的报告。
- Zylos Research,“AI Agent Cost Optimization: Token Economics and FinOps in Production”,2026.2. :从实务角度整理智能体工作流的代币消耗结构和模型路由策略。
- Hugging Face,“Welcome Gemma 4: Frontier multimodal intelligence on device”,2026.4. :关于Gemma 4架构以及与开源生态系统整合的技术分析。

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。
注释
-
MoE(Mixture of Experts,专家混合模型):在AI模型内部设置多个“专家”网络,根据输入只激活其中一部分的结构。虽然是26B参数的模型,但实际推理时只使用3.8B,因此能像小模型一样运行迅速,同时保持大模型的性能。类似于自助餐摆满了全部菜品,但客人实际吃的只是其中一部分。 ↩
-
原生函数调用(Native Function Calling):AI模型能够直接调用外部工具(API、数据库、搜索引擎等)的内置功能。以前需要借助额外的框架,而现在这一功能被内置到模型本身,使得构建智能体变得简单得多。 ↩
-
编排层(Orchestration Layer):连接和协调多个AI模型、工具、数据源的中间软件层。就像交响乐团的指挥协调各件乐器一样,它管理着把哪个任务交给哪个模型、以及如何整合结果。像Deep Agents这样的框架就承担着这一角色。 ↩
