1分钟视频制作花费1,000美元的时代正在终结
AI视频生成成本在1年内暴跌65%。这不是技术的进化,而是视频制作产业结构正在改变的信号

开篇
订阅者朋友,制作一段1分钟的企业宣传视频要花多少钱?
以2025年为准,交给自由职业者做的话是1,000~5,000美元,找代理公司则从15,000美元起步。摄制团队人工费、设备租赁、场地费用、后期剪辑都算上,很快就能超过数万美元。换算成韩元,1分钟至少要130万韩元,代理公司级别的话超过2,000万韩元。
但现在AI视频生成工具的每秒成本是0.01~0.50美元。换算成1分钟的话是0.6美元到30美元。就算用最贵的高端模型,也只是传统制作方式的0.2%水平。而且这个成本在过去1年间又下降了65%。
上周,字节跳动发布的Seedance 2.0是这条成本曲线崩塌的最新案例。但这个模型引发热议的原因不是价格,而是一张照片就能复制出一个人的声音这件事。技术变得又便宜又强大,一旦在没有安全装置的情况下扩散开来会发生什么,在发布后短短3天内就赤裸裸地展现了出来。
今天我们来聊聊AI视频成本的结构性变化、Seedance 2.0展示的技术转折点,以及这一切为什么正在瓦解“做视频得有钱”这个公式。
视频制作成本,到底降到了什么地步?
先来看数字。
2024年,AI视频生成服务的成本水平是每分钟50~200美元。那时候大家谈论的还只是“比传统制作便宜”这种程度的话题。但2025~2026年之间,局面彻底变了。
看当前主要模型的每秒生成成本,最便宜的Vidu 2.0约为0.0375美元。行业平均水平是每秒0.084美元左右,Vidu 2.0比这还便宜55%。以通过API大量生成为标准的话,甚至出现了每秒降到0.01美元的平台。据WaveSpeedAI整理的2026年初数据,根据平台和功能不同,成本在每秒0.01~0.50美元区间浮动。
换一个更能直观感受的对比方式。如果传统企业视频制作成本是每分钟1,000~5,000美元,AI生成成本就是每分钟0.6~30美元。即便拿最贵的AI模型和最便宜的传统制作相比,也能节省97%以上的成本。有分析指出,用AI制作10条社交媒体宣传视频大约花费89美元,同样的工作交给代理公司则要10万美元以上。
产业采用率也支撑着这个趋势。AI视频生成工具的产业采用率同比增长了300%,而每秒生成成本在同一时期下降了65%。成本下降,使用的人就增多;使用的人增多,竞争加剧,成本就进一步下降,就是这样一种结构。
这不仅仅是“AI很便宜”这么简单的事。这意味着视频制作本身的进入门槛正在消失。以前只有拥有资本的人才能做视频,现在只要有想法就够了。
Seedance 2.0展示的东西——不只是便宜
成本下降自然会引出一个问题:“是不是便宜的同时质量也下降了?”字节跳动的Seedance 2.0正面回答了这个问题。
现有的AI视频工具大多以单一路径运作。输入文字就出视频,或者输入图片就出视频,就是这种方式。Seedance 2.0彻底颠覆了这一点。它采用了同时处理文本、图像、视频、音频四种输入的统一多模态1架构。一次最多可以参考12个文件。“这张图片作为角色,这段视频作为运镜参考,这段音频作为背景节奏”——可以像这样按要素分别指定。
如果说现有的AI视频工具是自动贩卖机(按下按钮就出结果),那么Seedance 2.0更像是厨房(挑选食材、指定菜谱,由主厨来制作)。
技术上值得关注的部分是双分支扩散变换器2架构。视频的画面和音频在各自独立的分支中同时生成,但在时间上精确同步。唇形同步3支持8种以上语言,立体声音频(背景音乐+环境音+对白)也是同时生成的。
瑞士咨询公司CTOL实际测试了这个模型后评价说,这是“现存最先进的AI视频生成模型”。当然这类评价的独立性有待考量,但2K分辨率输出、比上一版本快30%的生成速度、60秒内生成多镜头4序列这些规格本身,客观上确实令人印象深刻。
而且关键在于,它没有水印。这在便利性上是优点,但也是稍后要谈到的问题的种子。
四强格局——没有“最好”,只有“最合适”
目前AI视频生成市场正在形成四强格局。由于每个模型的强项不同,比起追问“哪个最好”,思考“这个场景适合用哪个模型”更符合实际情况。
**OpenAI的Sora 2在物理模拟方面最强。**连玻璃破碎的碎片都能逼真呈现。不过需要每月200美元(Pro)订阅,并且带水印。**Google的Veo 3.1在电影质感上出色。**支持24fps广播级视频和4张参考图片,但同样包含SynthID元数据水印。Kuaishou的Kling 3.0性价比最高。10秒片段约0.50美元左右,专注于亚洲内容。而字节跳动的Seedance 2.0在多模态控制和编辑灵活性上有差异化优势,是唯一支持音频参考输入的模型。
有证据表明这场竞争正在产生实实在在的产业影响。截至2025年12月,Kuaishou的Kling月活跃用户约1,200万,月营收2,000万美元。这意味着AI视频已经不再是实验室项目,而是真正能赚钱的产业了。
Seedance 2.0发布后不久,中国股市也做出了反应。2026年2月10日,COL Group涨停20%,Perfect World和Shanghai Film分别上涨10%。沪深300指数也上涨了1.4%。开源证券分析师Fang Guangzhao评价称,“这可能成为影视产业的奇点时刻”。

一张照片就能复制声音——成本越低,风险越大
到这里,故事的走向变了。技术成本急剧下降、质量急剧提升,一旦在没有安全装置的情况下扩散开来会发生什么——Seedance 2.0在发布后短短3天就展示了出来。
中国科技博主Pan Tianhong只上传了一张自己的照片。没有语音样本,也没有文本提示。但Seedance 2.0生成的视频却精准复制了他的声音音色、语速甚至语调。他留下的反应中,“恐怖”这个词出现了6次。
从技术角度看,这相当有意义。现有的语音克隆工具至少需要30秒以上的语音样本。而Seedance 2.0仅凭一张脸部图像就推断出了声音特征。视觉相似性(脸)和声学身份(声音)之间原本存在的那堵墙——一种“数字气隙”——就这样被打破了。
字节跳动立即做出了应对。暂停了真人参照功能,并在Jimeng、Doubao应用中引入了实时认证(人脸+语音录制)程序。虽然这是中国AI开发中“先开发后监管”这一典型模式的又一例证,但应对速度本身是够快的。
不过这不只是字节跳动一家的问题。欧盟以xAI的Grok可能生成未经同意的色情内容为由,对X(原推特)展开调查,也是同样的脉络。AI视频生成成本越低,滥用的成本也随之降低。一个每秒只需几美分就能复制他人脸孔和声音的世界,已经到来了。
Oswarld视角
我把这个现象看作不是“视频制作的民主化”,而是“视频制作的商品化(Commoditization)”。
在做了20年GTM战略的过程中,我见过无数次这样的模式。当技术成本急剧下降时,那项技术本身就不再是差异化要素了。云计算是这样,网站制作也是这样。AI视频正在走同样的路径。
能以每秒0.01美元制作视频,反过来说,意味着仅靠视频本身已经无法确保竞争优势了。当人人都能做的时候,重要的就变成了“做什么”——也就是策划能力和故事。工具一旦民主化,视角就成了稀缺资源。
作为数据专家,我还想多说一点:看到“成本下降65%”这个数字时,要留意衡量标准。是以API为准的每秒成本,还是按订阅模式折算,包含了哪种分辨率和功能——不同标准下数字差异很大。在我看来,纯粹的生成成本确实急剧下降了,但包含提示词设计、反复生成、后期编辑在内的实际制作成本,还没有降到那种程度。
而且正如语音克隆事件所展示的,技术越便宜、越强大,安全装置的成本反而应该越高。生成成本曲线和安全装置成本曲线朝相反方向移动,这是这个产业的结构性困境。Seedance 2.0不加水印,也许是出于用户便利性的考量,但这个选择的社会成本账单还没有寄到。
结语
总结一下。
第一,随着AI视频生成的每秒成本降到0.01~0.50美元,视频制作不再是资本的游戏,而是正在转变为想法和策划能力的游戏。
第二,Seedance 2.0以同时处理文本、图像、视频、音频的统一多模态架构,展示了AI视频从“生成”走向“制作”的转折点。
第三,成本下降的同时,滥用的成本也在下降。一张照片就能复制声音的现实,是技术创新速度已经超越伦理安全装置的警示。
字节跳动扩散引擎AI算法负责人Wu Di近期在采访中表示,“2026年AI视频技术还会有1~2次大规模跃进”。成本曲线还会继续下降。到那时我们需要的不是更便宜的工具,而是更好的问题——“用这项技术做什么”,以及“什么是不该做的”。
📎 参考资料与延伸阅读
- 字节跳动Seed官方博客,《Seedance 2.0》,2026.02.12.:可以直接查看技术架构和演示视频。
- TechNode,《ByteDance suspends Seedance 2.0 feature that turns facial photos into personal voices》,2026.02.10.:最详细报道Pan Tianhong事件经过与字节跳动应对措施的文章。
- Caixin Global,《ByteDance Unveils New AI Video Model, Sparking Rally in Chinese Tech Stocks》,2026.02.10.:包含中国股市反应和开源证券产业分析的报道。
- WaveSpeedAI Blog,《Complete Guide to AI Video Generation APIs in 2026》,2025.12.27.:整理各主要模型每秒成本对比和API接入方法的指南。
- vidBoard.ai,《AI Video Generation vs. Traditional Production: Cost Breakdown》,2025.10.:传统视频制作成本与AI生成成本的系统性对比。
- South China Morning Post,《AI video generation: How China’s Kling challenges Google’s Veo, OpenAI’s Sora》,2026.01.27.:Kling月活跃用户1,200万、月营收2,000万美元等商业化数据的原始出处。
- Free AI Tools,《17 Best AI Video Generation Models Pricing, Benchmarks & API Access》,2025.12.:基于Artificial Analysis Video Arena基准测试的各模型性能与价格对比。

作者安光涉是世宗大学经营学教授,也是 OBF(Oswarld Boutique Consulting Firm)首席顾问。他在大学教授经营数据管理、商业分析等统计与数据分析课程,同时在产业现场负责 GTM 与人工智能战略咨询,设计技术与商业的连接方式。他曾发表关于 AI 对话系统记忆架构(HEMA)的学术论文,并运营每日策展全球 AI 论文的 Daily Arxiv 项目。他毕业于高丽大学技术经营专业研究生院与 KMBA,著有《把思考交出去的人:Homo Brainless》。
