商业第 178 期

可以下载,只是无法运行

2.8万亿参数Kimi K3与“开放”的重新计算

可以下载,只是无法运行

开篇

读者,7月17日,北京的月之暗面发布了Kimi K3。参数达2.8万亿个,是它自称的全球最大开放权重1模型。现在任何人都可以在Hugging Face上下载它。按钮是可以按下的。问题出在下载之后。这个模型光是权重文件就超过1.5TB,别说个人电脑,就连一般公司的服务器也没办法运行。

先说结论:如今前沿级开放模型的“开放”,已不再是过去那种敞开。下载的自由赋予了所有人,但运行的能力却只留给了云、企业和国家。这是一种门开着、门槛却变成了山的结构,今天我们就用数字来量一量这道鸿沟。


两周内被重新绘制的地图

先看看整体格局。按基准测评机构Artificial Analysis的智能指数,目前开放权重模型的排名依次是Kimi K3(57分)、GLM-5.2(51分)、DeepSeek V4 Flash(50分)。第4位和第5位分别是Kimi的低配版本和MiniMax。也就是说,前五位全部是中国模型。

这份排行榜在过去两周里被重新改写。7月17日,月之暗面发布了Kimi K3;两天后,阿里巴巴以“仅次于Fable 5”的自我评价,预告了参数达2.4万亿的Qwen3.8-Max。期间还发生了OpenAI将主力模型价格下调80%的事件,7月31日DeepSeek推出了V4 Flash正式版,8月3日阿里巴巴推出了Qwen3.8-Max正式版。权重预计将在下周公开。

不只是性能在提升,体量也在膨胀。GLM-5.2有7530亿个参数,DeepSeek V4-Pro有1.6万亿个,Qwen3.8-Max有2.4万亿个,Kimi K3有2.8万亿个。变大的原因很明确——这是追赶前沿的代价。DeepSeek V4 Flash的50分与OpenAI最新闭源模型只差1分,而Kimi K3干脆宣称达到了Fable、Sol级别的智能。要在顶端多拿到几分,就得付出这样的体量。而这种体量能够实现,是因为如今的大模型清一色采用了混合专家(MoE)2结构——处理一个token时,只唤醒整体中的一部分来计算。Qwen3.8-Max的2.4万亿个参数中只有950亿个参与计算,DeepSeek V4 Flash的2840亿个参数中只有130亿个参与计算。

这里就出现了本文的核心不对称:**计算成本跟着激活参数走,但内存需求跟着总参数走。**因为不知道哪个“沉睡的专家”何时会被调用,所有参数都必须常驻内存。所以API价格才那么便宜(DeepSeek的价格是每100万输出token 0.28美元),但要在家里跑起来,却需要能装下全部2.8万亿个参数的显存。API便宜的原因,和在家里跑不起来的原因,来自同一个设计。

1.5TB是什么概念呢?消费级顶配显卡RTX 5090的显存是32GB。得插满48张卡,才勉强能装下权重本身,而这还没算上支持100万token上下文所需的KV缓存3。再看看另一边的速度:消费级GPU显存从2020年的24GB到2025年的32GB,5年间增长了33%。同期开放模型的最大规模,却从2024年的Llama 405B增长到2026年的2.8T,两年间变为原来的7倍。年糕变大的速度,压倒性地超过了厨房变大的速度。


连GPU专营公司也拿起了镐头

那么这块年糕,究竟是谁在吃、又是怎么吃的呢?恰好上周出现了一份很好的实测。在AMD芯片上销售开放模型推理服务的初创公司Wafer,记录了自己亲自部署Kimi K3的过程。这是一家以AMD服务为业务的公司做的自测,读的时候要考虑到这一点,但正因为过程写得非常具体,这一点反倒成了收获。

先总结数字:Kimi K3无法把权重和KV缓存一起装进英伟达标准的8卡B200节点(每张GPU 192GB,总计1.5TB)。因此要么用288GB的高配芯片B300,要么就得把两个B200节点绑在一起。但还有另一块每GPU拥有288GB显存的芯片——AMD的MI355X。在Wafer的测试中,MI355X的8卡节点跑出了每秒952个token,若换算成反映GPU租赁价格的每美元处理量,则达到48个token,同时超过了B300(33个token)和双节点B200配置(7个token)。就在模型变大、瓶颈从计算转移到显存容量的那一刻,排位被颠覆了。

和一个月前的记录对比,这条界线就更清晰了。同一个团队在7月初部署GLM-5.2(7530亿个参数)时,情况完全不同。因为GLM-5.2的规模能装进英伟达的单个节点,AMD即便做了量化4和框架层面的“手术”,也只停留在“性能约80%、价格减半”的性价比替代方案上。仅仅改变了一个变量——模型是否越过1.5TB的边界——结果就出现了分岔。

不过,我在这份实测中更关注的不是排名,而是难度。就连以GPU优化为主业的这家公司,也在第一次请求时就遇到了调度器崩溃的错误,还得亲自用PyTorch补写缺失的函数,甚至用绕开注意力运算形状限制的小技巧,才达到目标性能。而该团队自评这次已经算是容易的了——因为在之前的模型上,他们得重新编写自定义内核,或修复两个框架漏洞。这里也有弱点:首次读取一份17万token的文档需要51秒,比英伟达B300的23秒慢了一倍以上。而且即便闯过这一切,节点租金也在每小时20美元左右。跑满一个月,折合韩元约2000万韩元,这明显是一笔生意的数字。

当然也有反例。DeepSeek V4 Flash总共只有2840亿个参数,设计本身就小,3位量化版只有103GB,配备128GB内存的高端工作站就能跑起来。阿里巴巴也预告了与Qwen3.8-Max同时推出的270亿参数小型版。所以“能跑得动的开放”并没有消失,只是那已经比前沿低了一个台阶,而前沿本身已经脱离了个人之手——这才是准确的描述。


依然免费开放的算盘

这里还留下一个奇怪的问题:一个大多数个人开发者根本跑不动的东西,为什么大家还争先恐后地免费开放?

华尔街的回答提供了一条线索。花旗在8月初的阿里巴巴报告中这样总结:由于模型以数周为单位更新,企业正走向按业务场景更换模型的“模型不可知”策略,这样一来,单个模型的护城河越来越弱,竞争焦点转移到承载模型的平台和基础设施上。因此,从芯片到云、模型再到应用一应俱全的阿里巴巴更有利——这就是买入评级的逻辑。虽然要考虑到这是卖方报告的利益立场,但方向恰好与阿里巴巴的实际行动吻合。它一边宣布免费开放权重,一边在同一天推出了绑定钉钉的企业级智能体产品QwenWork。模型是传单,商品是云和办公工具,这就是这套结构。

这也和上个月DeepSeek融资那一期引用过的梁文锋的算盘相呼应。

“如果想赚取100倍的利润,开源会成为阻碍,但如果只追求合理的利润,那就毫无影响。”

所以,前沿级权重开放的真正需求方,从一开始就不是个人。而是把它接到自身基础设施上出售的云厂商、无法把数据送到外部的企业、想把智能留在本国境内的政府,以及像Wafer这样把“服务本身”做成生意的公司。企业方面的需求尤其具体:对金融、医疗、军工等无法把数据发往外部API的行业来说,权重就是可以引入自身边界之内的智能,随之而来的还有用自有数据微调的自由,以及模型不会某天突然被改变的可控感。各国政府所说的“主权AI”的原料清单最上面,排的正是这类开放权重。归根结底,开放对它们来说,更接近于把流通这件事外包出去。

在这条流通链条里,还有一方在悄悄地笑。当模型体量的竞争被翻译成显存容量的竞争,芯片的命脉就不再是运算单元,而是堆叠在它旁边的高带宽内存(HBM)5。填满MI355X那288GB的,正是三星电子和美光的12层HBM3E。在英伟达认证上屡屡失手的三星,从AMD这道门走了进去,而中国模型的体量膨胀,恰恰在把这道门开得更宽。吃不到年糕的人很多,但卖蒸笼的商人,做的是稳赚不亏的生意。


也有反向运转的算盘

在这两周的风暴中,还夹着一则韩国国内的发布。7月27日,Kakao发布了第二代小型模型系列Kanana-2。它先从头训练出一个30亿参数的版本,再通过剪枝和蒸馏削减到13亿参数,13亿参数版本明确标注为面向端侧部署。和Kimi K3并排放,体量只有它的2000分之一。1.5TB旁边摆着2.6GB,相当于服务器机架旁边放了一台智能手机。

cant方向截然相反并非偶然,而是一种算盘。无法参与前沿资本游戏的公司手里握的牌,是早已进入数千万人手中的流通网络,而在那个规模下,服务器推理成本就是一场灾难。如果模型能在设备本身上运行,推理成本就会趋近于零,数据也不会离开手机。这正是前文所说“边界之内的智能”的零售版。设计也全都集中在节省内存上。

kakaocorp/kanana-2-1.3b-base · Hugging FaceWe’re on a journey to advance and democratize artificial intelligence through open source and open science.huggingface.co

据Kakao的说明,他们采用了能将KV缓存最多削减72.7%的注意力结构。在自测中,韩语知识问答以两倍的差距胜过同级别的Qwen,但数学方面落后。虽然与前沿显然不在一个量级,但如果目标本来就是摘要或分类这类生活单位的任务,算盘就不同了。这是一种不等巨人施舍雨露,而是在自己的地盘上取胜的策略。


Oswarld视角

在做GTM战略咨询、审视免费策略时,我一定会确认一个项目:这份免费的账单,最终会以什么形式、送到谁的手上。用这个镜头去看,现在的开放权重,虽然用的是和Linux时代的开源相同的词,却是完全不同的东西。Linux时代,下载的人就是运行的人——毕竟它连老旧的486电脑也能跑起来。而前沿级开放权重,下载者与运行者在结构上被分离开了。语言上说的是可及性,功能上做的却是批发分销。

所以每次看到“开源AI让智能变得民主化”这句话时,我都建议大家先停顿一拍,打个问号。被民主化的不是智能的零售市场,而是批发市场。受益者不是个人,而是接过这份智能再转手出售的那一层。

不过,反方向的事实我也要公平地写下来。涓滴效应确实存在。如今能在个人工作站上运行的模型级别,大致相当于一年前的前沿水平。它确实在往下渗透,只是带着时间差,而且永远只低一个台阶。在我看来,承认这份时间差和台阶,才是诚实使用“开放”这个词的方式。


结语

总结一下。

第一,开放权重的头部排名全被中国模型占据,短短两周内体量就膨胀到2.8万亿参数。

第二,由于MoE结构,API价格再便宜,自行部署也需要相当于全部参数量的内存。这就是下载的自由与运行的能力被割裂的原因。

第三,前沿级权重开放的真正需求方不是个人,而是云、企业和国家,而体量竞争的涓滴效应则流向了存储半导体。

下周如果阿里巴巴真的开放2.4万亿个参数的权重,我会单独用一期来拆解那份“免费的账单”。

读者的团队有没有亲自运行过开放模型?现实中能跑到多少B、又是在哪里碰壁转而回到API的,欢迎在评论区分享。我会收集这些案例,反映到下一期里。


💬 欢迎在评论区分享您亲自运行开放模型的经验。我会反映到下一期里。 📨 如果身边有正在考虑自建托管的同事,请把这篇文章转发给他们。


📎 参考资料与延伸阅读

核心来源

  • Ian Ye,《Is memory the moat?》,Wafer Blog,2026年7月31日。……这是本文的骨架——Kimi K3的实测。内核修改过程被原样记录下来,如果好奇“运行开放模型”的实际难度,就从这篇开始读。
  • Ian Ye,《Performance per dollar is getting faster and cheaper》,Wafer Blog,2026年7月3日。……这是一个月前GLM-5.2的实测。作为今天这篇的对照组,展示了模型能“装进一个节点”时的局面。
  • Artificial Analysis,《DeepSeek V4 Flash 0731分析》,2026年8月。……开放权重智能排名和价格数据的出处。
  • Qwen Team,《Qwen3.8发布》,2026年8月3日。……2.4万亿参数及权重开放计划的第一手来源。
  • Citi Research,《Alibaba:Qwen3.8-Max官方发布评价》,2026年8月。……“模型不可知”这一框架的出处。需要注意这是一份买入评级的报告。
  • Kanana LLM团队,《Kanana-2 SLM》,Kakao Tech Blog,2026年7月27日。……将3B压缩为1.3B这一过程的第一手来源。权重可在Hugging Face上获取。

背景知识

  • Unsloth,《DeepSeek-V4本地运行指南》,2026年8月。……实际运行103GB量化版的方法。如果好奇“可运行的开放”目前的上限在哪里,可以参考这篇。
  • 《首尔经济》,《AMD称“MI350X采用三星HBM3E”》,2025年6月。……MI355X上搭载的韩国内存的背景。

值得一起阅读的往期


📝 术语说明

安光涉个人插画

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。

注释

  1. 开放权重(open weights):将训练完成的模型的权重文件公开,让任何人都能下载的方式。这是一个比连训练数据和代码都开放的完全开源更狭窄的概念,但近来这两者常常被混用。

  2. 混合专家(MoE,Mixture of Experts):将模型拆分成多个“专家”碎片,每个token只挑选所需的碎片来计算的结构。这样能节省计算量,但因为不知道哪个碎片会被调用,所有碎片都必须待命在内存中。

  3. KV缓存(KV cache):模型在阅读长文本时,为避免重复计算前面部分而堆存在内存里的工作记忆。上下文越长、同时在线用户越多,这部分的占用就越大。

  4. 量化(quantization):降低权重数值的精度,从而缩小文件大小和内存占用的压缩方法。用得好的话,几乎不损失性能就能把容量缩减到几分之一。

  5. HBM(高带宽内存):垂直堆叠在GPU旁边、以超高速交换数据的内存。AI芯片的容量和速度实际上由这种内存决定,市场由三星电子、SK海力士、美光三家公司分割。